1,6 billones de won invertidos en datos de aprendizaje de IA: derroche de presupuesto por duplicación y errores

  • Auditoría de la Oficina de Auditoría: se confirma construcción duplicada y deficiencias en control de calidad

  • Coordenadas de vehículos faltantes y el 23% de datos de residuos no coinciden con imágenes reales

  • Errores no corregidos de empresas desaparecidas: se establece sistema de mantenimiento por terceros

Estado de promoción de la industria de IA III (Datos de aprendizaje de IA) [Gráfico=Oficina de Auditoría]
Estado de promoción de la industria de IA III (Datos de aprendizaje de IA) [Gráfico=Oficina de Auditoría]

Se han confirmado casos reiterados en los que el gobierno invirtió 1.632.800 millones de won en la construcción de datos de aprendizaje para inteligencia artificial (IA), donde se recrearon datos similares a materiales existentes o se publicaron datos deficientes que no podían utilizarse para el aprendizaje de IA. Los expertos señalan que la ejecución presupuestaria ha sido ineficiente debido a deficiencias en la revisión previa, la gestión de calidad y el mantenimiento posterior.

 

Según el informe de auditoría sobre "Estado de promoción de la industria de IA - Enfoque en proyectos de construcción de datos de aprendizaje de IA" publicado por la Oficina de Auditoría el 12 de agosto, el Ministerio de Ciencia y Tecnología de la Información y Comunicaciones construyó datos de aprendizaje de IA desde 2017 hasta 2024. A partir de noviembre de 2025, se han publicado 908 tipos de datos en el centro de IA.

 

De forma separada, 26 instituciones públicas, incluyendo la Agencia de Seguridad de Medicamentos y Alimentos, la ciudad de Seúl y la Corporación de Carreteras de Corea, publicaban 313 tipos de datos a través de sus propios portales. Sin embargo, no existía un sistema para compartir previamente planes de construcción entre instituciones ni para revisar la viabilidad de utilizar datos existentes, lo que resultó en la construcción duplicada de datos similares.

 

El Ministerio de Ciencia y Tecnología construyó primero 4 tipos de datos invirtiendo 7.380 millones de won en vida silvestre, residuos domésticos, grietas de hormigón e información relacionada con huevos. Sin embargo, 5 instituciones, incluyendo la ciudad de Seúl y la Corporación de Carreteras de Corea, invirtieron nuevamente 610 millones de won en la construcción de datos similares.

 

De 9.000 imágenes en los datos de residuos domésticos construidos por Seo-gu, Daejeon, 5.200 imágenes (57,8%) eran similares a los datos existentes del Ministerio de Ciencia y Tecnología. Los datos de vida silvestre de la Corporación de Carreteras de Corea también mostraban que aproximadamente 25.000 de un total de 60.000 imágenes eran similares a los materiales existentes.

 

También hubo casos donde instituciones crearon datos similares cada una sin coordinar planes entre ellas en el mismo año. Mientras el Ministerio de Ciencia y Tecnología invirtió 23.300 millones de won en la construcción de datos relacionados con píldoras, odontología y conducción autónoma entre 2021 y 2023, 3 instituciones, incluyendo la Agencia de Seguridad de Medicamentos y Alimentos, utilizaron por separado 840 millones de won en la construcción de datos similares.

 

Las 1.000 imágenes construidas por la Comisión de Protección de Información Personal en 2023 para tratamientos odontológicos eran todas similares a los datos construidos por el Ministerio de Ciencia y Tecnología en el mismo año. Los datos para identificación automática de píldoras construidos por el Ministerio de Ciencia y Tecnología y la Agencia de Seguridad de Medicamentos y Alimentos en 2021 también tenían 1.411 imágenes coincidentes.

 

La gestión de calidad de los datos también fue deficiente. Entre los 20 principales organismos públicos en cuanto a desempeño de construcción, 4 carecían de criterios separados de gestión de calidad, y 9 no realizaron verificación de calidad de terceros antes de la entrega. La Agencia de Seguridad de Medicamentos y Alimentos y la Corporación de Energía Este-Oeste de Corea no requirieron ni verificación de terceros ni inspección interna de las organizaciones ejecutoras.

 

De 114 tipos de datos construidos por 5 instituciones, 96 tipos (84,2%) carecían de especificaciones de reglas de sintaxis para evaluar la precisión de la estructura y formato de las oraciones, lo que hizo imposible la inspección de calidad.

 

Cuando la Oficina de Auditoría realizó verificación de expertos en 6 tipos de datos construidos por la provincia de Gyeonggi y la Corporación de Carreteras de Corea como muestra, 1 tipo no pudo ser inspeccionado. La precisión de formato de los 5 tipos restantes fue de 77,3% a 99,2%, por debajo del estándar de 99,5%.

 

El "Conjunto de datos de aprendizaje de CCTV de carreteras" construido por la Corporación de Carreteras de Corea en 2025 carecía de información de coordenadas de caja delimitadora en 2.680 imágenes donde se marcaban objetos como automóviles. Dado que la IA no podría reconocer la ubicación de los vehículos, estos datos no podían utilizarse como material de aprendizaje para el desarrollo de tecnología de conducción autónoma.

 

En los "Datos de aprendizaje de residuos voluminosos" construidos por la ciudad de Seúl en 2020, 538 imágenes (23,4%) de 2.303 imágenes totales no coincidían entre el nombre del archivo y la imagen real. Se trataba de errores donde los archivos estaban etiquetados como "bolso" pero contenían imágenes reales de cajas o mesas.

 

También surgió el problema de que los errores de datos no podían corregirse después de que las empresas constructoras cerraron. El Instituto de Promoción de la Sociedad de Información Inteligente de Corea construyó 721 tipos de datos a través de 1.270 empresas entre 2021 y 2024. De estos, 213 tipos de datos (29,5% del total) fueron entregados por 65 empresas que cerraron o experimentaron circunstancias internas.

 

Aunque se presentaron 11 tipos de estos datos con quejas relacionadas con errores, el instituto cerró las quejas argumentando que las empresas constructoras habían cerrado, sin corregir directamente los datos ni encargar reparaciones a terceros. Los datos con errores confirmados continuaron siendo publicados en el centro de IA.

 

La Oficina de Auditoría notificó al Ministerio de Ciencia y Tecnología que coordinara con el Ministerio de Administración Pública y Seguridad para revisar previamente la viabilidad de utilizar datos existentes y establecer un sistema para compartir y coordinar planes de construcción entre instituciones. También se requirió el establecimiento de criterios comunes de gestión de calidad aplicables a organismos públicos y procedimientos de inspección interna y verificación de terceros.

 

Se solicitó al Instituto de Promoción de la Sociedad de Información Inteligente de Corea que corrigiera directamente los errores en datos construidos por empresas que cerraron o estableciera un sistema de mantenimiento por terceros. El Ministerio de Ciencia y Tecnología indicó que realizaría una encuesta exhaustiva entre múltiples ministerios para validar la calidad de los datos existentes y complementaría los materiales deficientes a través de empresas especializadas en datos e IA.

 

La Oficina de Auditoría declaró: "Se produjo datos que no podían utilizarse debido a la construcción de datos similares y deficiencias en el sistema de gestión de calidad, y el mantenimiento posterior también fue insuficiente. Dado que las empresas de IA continúan expresando la preocupación de que no hay datos utilizables, es urgente mejorar tanto la cantidad como la calidad de los datos para avanzar hacia una posición de potencia en IA".





* Este artículo ha sido traducido por IA.