← Todos los proyectos
Clasificador automático de idiomas por bigramas
Sistema en C++ que modela cada idioma por la frecuencia de sus pares de caracteres y clasifica un texto desconocido midiendo su distancia a los modelos conocidos.
Demostración
Qué hace
- Modelo de idioma como perfil de bigramas, serializado a un formato .bgr propio
- Clasificación por distancia entre modelos: acierta en español, inglés, francés y alemán sobre textos literarios reales
- Separación nítida: el idioma correcto queda a ~0,08 de distancia y el resto por encima de 0,21
- Gestión manual de memoria dinámica, sin contenedores de la STL
- Clase BigramCounter con conteo matricial para el recuento eficiente
- Desarrollo incremental en seis iteraciones (Language0 → Language5)