Florín Todor Descargar CV
← Todos los proyectos

Clasificador automático de idiomas por bigramas

2023 AlgoritmosProcesamiento de lenguaje

Sistema en C++ que modela cada idioma por la frecuencia de sus pares de caracteres y clasifica un texto desconocido midiendo su distancia a los modelos conocidos.

Demostración

Qué hace

  • Modelo de idioma como perfil de bigramas, serializado a un formato .bgr propio
  • Clasificación por distancia entre modelos: acierta en español, inglés, francés y alemán sobre textos literarios reales
  • Separación nítida: el idioma correcto queda a ~0,08 de distancia y el resto por encima de 0,21
  • Gestión manual de memoria dinámica, sin contenedores de la STL
  • Clase BigramCounter con conteo matricial para el recuento eficiente
  • Desarrollo incremental en seis iteraciones (Language0 → Language5)