Segunda evaluación de K-AI inminente: SKT y Upstage lideran en indicadores comunes

  • SKT, Upstage y LG AI Research publican modelos en Hugging Face

  • SKT obtiene las puntuaciones más altas en 4 de 7 indicadores de referencia comunes

  • LG AI Research lidera en escala de modelo; mejoras de calidad previstas para el futuro

Gráfico de Ajou Economía
[Gráfico=Ajou Economía]


La segunda fase de evaluación del proyecto "Modelo de Fundación de Inteligencia Artificial Autónoma" (MFAIA), impulsado por el Ministerio de Ciencia y Tecnología de la Información y Comunicaciones, está próxima a realizarse. Con los modelos ya públicos de las empresas participantes, se ha comprobado que poseen capacidad competitiva en campos especializados como coreano, matemáticas y ciencias; sin embargo, persisten brechas respecto a los modelos de frontera global en operación de modelos ultragrandes y eficiencia de inferencia.
Según fuentes del sector del 2 de agosto, SK Telecom, Upstage y LG AI Research, participantes en el proyecto MFAIA, hicieron públicos sus modelos en Hugging Face el mes pasado. Motif Technologies (Motif), que se sumó posteriormente, también presentó una versión preliminar.
Tras analizar las tarjetas de modelo publicadas en Hugging Face, se identificaron siete puntos de referencia con denominaciones idénticas o similares: △razonamiento matemático, △razonamiento científico, △razonamiento integral de alto nivel, △cumplimiento de instrucciones, △razonamiento de textos largos, △conocimiento del idioma coreano, y △cultura y conocimiento general de Corea. Los puntos de referencia comunes publicados incluyen evaluaciones especializadas domésticas, tales como conocimiento del idioma coreano y comprensión cultural.
A.X K2 de SKT registró las puntuaciones más altas entre los tres modelos en cuatro indicadores: cultura y conocimiento general de Corea (91,6 puntos), conocimiento del idioma coreano (80,5 puntos), razonamiento de textos largos (66,0 puntos) y razonamiento matemático (97,1 puntos). Solar Open 2 de Upstage presentó puntuaciones relativamente altas en tres indicadores: razonamiento científico (86,3 puntos), razonamiento integral de alto nivel (28,8 puntos) y cumplimiento de instrucciones (80,0 puntos).
Por el contrario, K-EXAONE 2.0 de LG AI Research, que ocupó el primer lugar en la evaluación de la primera fase, no registró la puntuación más alta en ninguno de los siete indicadores comunes.
En cuanto a la escala del modelo, LG AI Research lidera. K-EXAONE cuenta con 750 mil millones (750B) de parámetros, la mayor escala del país. LG AI Research tiene previsto transformarlo en un modelo de nivel de frontera global mediante mejoras adicionales de calidad de datos y aprendizaje reforzado.
Woo-hyung Lim, codirector de investigación de LG AI Research, señaló: "El modelo actual no es un resultado final, sino un punto de partida para evolucionar hacia un modelo de nivel frontera", y añadió: "Completaremos el desempeño de K-EXAONE a través de optimización de calidad de datos, aprendizaje posterior, aprendizaje reforzado y refinamiento de técnicas de inferencia".
Sin embargo, expertos sostienen que los modelos ahora públicos no son versiones finales presentadas, sino versiones preliminares, lo que limita su evaluación de competitividad global. Además, dado que los puntos de referencia publicados tienen un peso significativo en campos especializados como el idioma coreano y la comprensión de la cultura local, el resultado tiene más valor al confirmar las fortalezas de cada empresa y sus orientaciones tecnológicas que al establecer comparaciones sobre todos los indicadores de desempeño frente a modelos globales.
Bong Kang-ho, investigador senior del Instituto de Política de Software, manifestó: "Este resultado tiene significado para confirmar si se ha asegurado competitividad de nivel de frontera global en algunos campos, más que para evaluar si se ha superado a los modelos globales en todos los indicadores de desempeño", y añadió: "La tecnología y experiencia de desarrollo acumuladas a través del MFAIA servirán como base para la competitividad de IA nacional en el futuro".
La competencia de modelos de frontera global está adquiriendo característica de competencia simultánea en escala de modelos ultragrandes y eficiencia de inferencia. El "Kimi K3" recientemente publicado por Moonshot AI de China posee un tamaño total de parámetros aproximadamente 3,7 veces mayor que K-EXAONE, el mayor del país, además de capacidades integradas de procesamiento de textos largos, multimodalidad y función de agente.
En particular, Kimi K3 aplica una arquitectura de expertos ultraescasos (MoE, Mixture of Experts), seleccionando solo 16 de los 896 expertos totales para operar por token, reduciendo la proporción de parámetros activos realmente involucrados en el cálculo a aproximadamente un 3,7%. Este es un método que mantiene modelos ultragrandes mientras reduce la cantidad de operaciones y costos, mejorando la eficiencia de inferencia. En cambio, la proporción de parámetros activos de los modelos publicados nacionales ronda el 4,1 a 6,0%, evidenciando que la competencia tecnológica para mejorar la eficiencia de inferencia de modelos ultragrandes está en plena activación.





* Este artículo ha sido traducido por IA.