Ingeniería lingüística · Software de investigación · Java y Python

Radixor

Stemmer multilingüe determinista que transforma léxicos morfológicos en transformaciones ejecutables compactas. El conocimiento lingüístico se prepara offline; la ruta viva de búsqueda ejecuta un modelo compilado e inmutable en lugar de consultar entrada por entrada un gran diccionario textual.

20idiomasmodelos por defecto versionados de forma independiente en el conjunto evaluado
6.61Mformas superficialesformas distintas en la evaluación relacional de veinte idiomas
99.9988%precisiónprecisión pairwise agregada del resultado determinista en 20 idiomas
83.4%más pequeñoreducción total del payload léxico al payload compilado v7

Morfología compilada en una primitiva de búsqueda

La idea original de Egothor consistía en aprender transformaciones a partir de evidencia léxica en lugar de programar manualmente un stemmer distinto para cada idioma. Radixor completa ese modelo con semántica explícita de reducción, estructuras inmutables de runtime, persistencia binaria versionada, tratamiento determinista de ambigüedad y runtimes interoperables Java/Python.

Léxico morfológicoformas observadas y formas canónicas Inducción de patchesediciones ejecutables de coste mínimo Trie de frecuenciasevidencia y alternativas Reduccióncompartición semántica y contracción Modelo compiladolookup inmutable en runtime

Un patch no es una respuesta final almacenada. Es una instrucción que transforma una forma de entrada en una representación canónica. Eso permite compartir estructura entre muchas familias léxicas y que el compilador generalice transformaciones compatibles más allá de una tabla plana palabra→salida.

Un motor, muchos idiomas

El runtime es independiente del idioma. El conocimiento lingüístico entra mediante datos de modelo versionados, por lo que añadir o mejorar un idioma es principalmente un problema de compilación de modelo, no de escribir otro algoritmo fuente.

La ambigüedad se conserva

El mismo modelo puede exponer un resultado preferido o todos los candidatos locales en orden determinista. El sistema de búsqueda decide cuánta ambigüedad quiere activar.

Complejidad al construir, simplicidad al ejecutar

Inducción, reducción y validación ocurren offline. El lookup de producción recorre el modelo congelado y aplica un patch command compilado al token.

Los modelos son artefactos de primer nivel

Los modelos de idioma son artefactos de despliegue versionados e íntegramente verificables, no recursos ocultos dentro de un único ejecutable.

Java y Python nativo

El proyecto proporciona integración Java y un runtime nativo Python/Rust que consumen el mismo concepto de modelo compilado versionado.

Extensión controlada

Un modelo Java compilado puede reabrirse mediante un builder, ampliarse con evidencia específica de dominio, reconstruirse, probarse y desplegarse como nuevo artefacto en lugar de mutarse en vivo.

Qué se midió realmente

El estudio de 2026 en veinte idiomas evalúa la conflación morfológica como relación. En términos sencillos pregunta, a gran escala: ¿las formas que deben agruparse terminan juntas y las no relacionadas permanecen separadas? No exige que todos los sistemas escriban su salida como el mismo lema de diccionario.

EVALUACIÓN EN VEINTE IDIOMAS

De millones de formas a billones de decisiones por pares

La evaluación utiliza paradigmas derivados de UniMorph y curados de manera independiente, y cuenta la relación inducida por stemming determinista. Así pueden medirse uniones falsas y relaciones perdidas sin confundir ortografía del stem con calidad.

767,167grupos morfológicos
6,607,708formas distintas
130.2Mpares relacionados
3.052Tpares no relacionados
314escenarios validados
20modelos por defecto

El resultado de calidad en términos prácticos

15 de 20 idiomasprodujeron cero conflaciones false-positive en la salida primaria determinista.
1,538 pares false-positiveen el resultado agregado, frente a más de 3.052 billones de pares no relacionados.
97.5952% recallpara la salida determinista agregada de los veinte idiomas.
12 de 20 pasan a ser exactoscuando se consideran todos los candidatos explícitos como análisis de capacidad.

El resultado candidate-aware es especialmente útil para entender el diseño. Un stemmer sin contexto debe elegir una respuesta incluso cuando existe ambigüedad morfológica real. Radixor conserva primero la evidencia alternativa; un indexador, expansor de consulta o capa contextual puede después elegir la política apropiada.

Qué afirman estas cifras y qué no. Miden fidelidad al recurso morfológico independiente disponible. Ese mismo recurso compila el modelo, por lo que es un experimento extremo a extremo de utilización de conocimiento, no de predicción de familias totalmente ausentes; tampoco constituye por sí solo una afirmación de mejora universal de MAP, nDCG u otra métrica externa.

Modelos compactos en lugar de lookup vivo de diccionario

Los léxicos fuente son valiosos porque contienen evidencia morfológica curada, pero no tienen por qué seguir siendo la representación en runtime. Radixor destila esa evidencia en programas de patch y un trie reducido.

REPRESENTACIÓN COMPILADA

99.92 MB de evidencia léxica se convierten en 16.55 MB de modelo compilado

Medido sobre payloads descomprimidos, sin wrappers GZip externos ni metadata del paquete. En los veinte modelos, el stream v7 usa 2.50 bytes por forma evaluada frente a 15.12 bytes en la fuente.

6.04× relación fuente/modelo · 83.4% reducción de bytes

Un sobre visible de conocimiento–calidad–coste

Otro experimento inglés compila deliberadamente modelos a partir de fracciones deterministas del léxico y evalúa contra el recurso completo. No busca un tamaño «mágico» de diccionario, sino mostrar qué se sacrifica cuando se retira conocimiento.

Filas del diccionarioExactitud · todas las formasExactitud · formas cambiadasRuntime de formas cambiadas
100%97.478%97.197%71.6 ns/token
50%95.262%86.107%61.1 ns/token
10%92.868%76.516%47.0 ns/token

La latencia absoluta depende de máquina y workload. La curva es útil como ilustración de ingeniería: retirar evidencia perjudica sobre todo formas que necesitan transformación y el runtime varía de forma más modesta y no estrictamente monótona.

Cómo se presenta el rendimiento en este sitio. Los tiempos se muestran como mediciones absolutas documentadas y junto al contexto de workload o calidad. Se omiten deliberadamente antiguos ratios titulares frente a Porter/Snowball: el diseño del benchmark evolucionó y las ratios entre implementaciones se interpretan mal con facilidad cuando difieren el mix de tokens y la ruta medida.

Veinte idiomas por defecto

Una vista visual del conjunto estándar permite absorber mejor la amplitud que una simple lista separada por comas.

🇨🇿
Checocs · modelo por defecto
🇩🇰
Danésda · modelo por defecto
🇳🇱
Neerlandésnl · modelo por defecto
🇬🇧 🇺🇸
Inglésen · base léxica US/UK
🇫🇮
Finésfi · modelo por defecto
🇫🇷
Francésfr · modelo por defecto
🇩🇪
Alemánde · modelo por defecto
🇮🇱
Hebreohe · modelo por defecto
🇭🇺
Húngarohu · modelo por defecto
🇮🇹
Italianoit · modelo por defecto
🇳🇴
Noruego Bokmålnb · modelo por defecto
🇳🇴
Noruego Nynorsknn · modelo por defecto
🇮🇷
Persafa · modelo por defecto
🇵🇱
Polacopl · modelo por defecto
🇵🇹
Portuguéspt · modelo por defecto
🇷🇺
Rusoru · modelo por defecto
🇪🇸
Españoles · modelo por defecto
🇸🇪
Suecosv · modelo por defecto
🇺🇦
Ucranianouk · modelo por defecto
YI
Yidisidentificador de idioma en lugar de bandera estatal

Se utilizan banderas cuando ayudan a orientarse. Cuando asociar una lengua a una bandera soberana podría resultar engañoso, se usa un identificador lingüístico.

Trayectoria de investigación y reproducibilidad

Radixor es la realización contemporánea de una línea iniciada en Egothor en 2001: inferir programas compactos de edición palabra→stem a partir de ejemplos léxicos, organizarlos en un trie y ejecutar el modelo resultante en un sistema de búsqueda. El trabajo moderno añade reducción semántica explícita, contracción de subárboles uniformes, representaciones compiladas inmutables, alternativas ordenadas por evidencia, procedencia de modelos, interoperabilidad Java/nativa y artefactos de evaluación de nivel publicable.

La evaluación está diseñada para ser auditable. Los identificadores y hashes se registran con las filas de resultados; el snapshot de calidad incluye los conteos de confusión originales y métricas derivadas; tablas y figuras pueden regenerarse a partir de datos machine-readable en lugar de transcribirse manualmente.

Recursos del proyecto