Ingeniería lingüística · Software de investigación · Java y Python
Radixor
Stemmer multilingüe determinista que transforma léxicos morfológicos en transformaciones ejecutables compactas. El conocimiento lingüístico se prepara offline; la ruta viva de búsqueda ejecuta un modelo compilado e inmutable en lugar de consultar entrada por entrada un gran diccionario textual.
Morfología compilada en una primitiva de búsqueda
La idea original de Egothor consistía en aprender transformaciones a partir de evidencia léxica en lugar de programar manualmente un stemmer distinto para cada idioma. Radixor completa ese modelo con semántica explícita de reducción, estructuras inmutables de runtime, persistencia binaria versionada, tratamiento determinista de ambigüedad y runtimes interoperables Java/Python.
Un patch no es una respuesta final almacenada. Es una instrucción que transforma una forma de entrada en una representación canónica. Eso permite compartir estructura entre muchas familias léxicas y que el compilador generalice transformaciones compatibles más allá de una tabla plana palabra→salida.
Un motor, muchos idiomas
El runtime es independiente del idioma. El conocimiento lingüístico entra mediante datos de modelo versionados, por lo que añadir o mejorar un idioma es principalmente un problema de compilación de modelo, no de escribir otro algoritmo fuente.
La ambigüedad se conserva
El mismo modelo puede exponer un resultado preferido o todos los candidatos locales en orden determinista. El sistema de búsqueda decide cuánta ambigüedad quiere activar.
Complejidad al construir, simplicidad al ejecutar
Inducción, reducción y validación ocurren offline. El lookup de producción recorre el modelo congelado y aplica un patch command compilado al token.
Los modelos son artefactos de primer nivel
Los modelos de idioma son artefactos de despliegue versionados e íntegramente verificables, no recursos ocultos dentro de un único ejecutable.
Java y Python nativo
El proyecto proporciona integración Java y un runtime nativo Python/Rust que consumen el mismo concepto de modelo compilado versionado.
Extensión controlada
Un modelo Java compilado puede reabrirse mediante un builder, ampliarse con evidencia específica de dominio, reconstruirse, probarse y desplegarse como nuevo artefacto en lugar de mutarse en vivo.

- La evidencia lingüística se prepara offline y no se improvisa durante la consulta.
- Los modelos multilingües permanecen como artefactos explícitos y versionados.
- El comportamiento determinista hace que el stemming encaje en sistemas controlados.
- Los resultados de investigación se convierten en activos desplegables.
Qué se midió realmente
El estudio de 2026 en veinte idiomas evalúa la conflación morfológica como relación. En términos sencillos pregunta, a gran escala: ¿las formas que deben agruparse terminan juntas y las no relacionadas permanecen separadas? No exige que todos los sistemas escriban su salida como el mismo lema de diccionario.
De millones de formas a billones de decisiones por pares
La evaluación utiliza paradigmas derivados de UniMorph y curados de manera independiente, y cuenta la relación inducida por stemming determinista. Así pueden medirse uniones falsas y relaciones perdidas sin confundir ortografía del stem con calidad.
- Los pares positivos indican si las variantes auténticas permanecen juntas.
- Los pares negativos muestran si formas no relacionadas se fusionan por error.
- La ortografía del lema no se trata como toda la historia.
- La ambigüedad puede estudiarse por separado para salida primaria y todos los candidatos.
El resultado de calidad en términos prácticos
El resultado candidate-aware es especialmente útil para entender el diseño. Un stemmer sin contexto debe elegir una respuesta incluso cuando existe ambigüedad morfológica real. Radixor conserva primero la evidencia alternativa; un indexador, expansor de consulta o capa contextual puede después elegir la política apropiada.
Modelos compactos en lugar de lookup vivo de diccionario
Los léxicos fuente son valiosos porque contienen evidencia morfológica curada, pero no tienen por qué seguir siendo la representación en runtime. Radixor destila esa evidencia en programas de patch y un trie reducido.
99.92 MB de evidencia léxica se convierten en 16.55 MB de modelo compilado
Medido sobre payloads descomprimidos, sin wrappers GZip externos ni metadata del paquete. En los veinte modelos, el stream v7 usa 2.50 bytes por forma evaluada frente a 15.12 bytes en la fuente.
Un sobre visible de conocimiento–calidad–coste
Otro experimento inglés compila deliberadamente modelos a partir de fracciones deterministas del léxico y evalúa contra el recurso completo. No busca un tamaño «mágico» de diccionario, sino mostrar qué se sacrifica cuando se retira conocimiento.
Tres puntos de referencia
Para lectores no especializados es más intuitivo que una gran tabla: reducir evidencia compra poco runtime, pero erosiona progresivamente la calidad, sobre todo en las formas transformadas.
| Filas del diccionario | Exactitud · todas las formas | Exactitud · formas cambiadas | Runtime de formas cambiadas |
|---|---|---|---|
| 100% | 97.478% | 97.197% | 71.6 ns/token |
| 50% | 95.262% | 86.107% | 61.1 ns/token |
| 10% | 92.868% | 76.516% | 47.0 ns/token |
La latencia absoluta depende de máquina y workload. La curva es útil como ilustración de ingeniería: retirar evidencia perjudica sobre todo formas que necesitan transformación y el runtime varía de forma más modesta y no estrictamente monótona.
Veinte idiomas por defecto
Una vista visual del conjunto estándar permite absorber mejor la amplitud que una simple lista separada por comas.
Se utilizan banderas cuando ayudan a orientarse. Cuando asociar una lengua a una bandera soberana podría resultar engañoso, se usa un identificador lingüístico.
Trayectoria de investigación y reproducibilidad
Radixor es la realización contemporánea de una línea iniciada en Egothor en 2001: inferir programas compactos de edición palabra→stem a partir de ejemplos léxicos, organizarlos en un trie y ejecutar el modelo resultante en un sistema de búsqueda. El trabajo moderno añade reducción semántica explícita, contracción de subárboles uniformes, representaciones compiladas inmutables, alternativas ordenadas por evidencia, procedencia de modelos, interoperabilidad Java/nativa y artefactos de evaluación de nivel publicable.
La evaluación está diseñada para ser auditable. Los identificadores y hashes se registran con las filas de resultados; el snapshot de calidad incluye los conteos de confusión originales y métricas derivadas; tablas y figuras pueden regenerarse a partir de datos machine-readable en lugar de transcribirse manualmente.