K2 Horizon intenta abrir la caja negra del entrenamiento de IA
Seis modelos, de 900 millones a 375.000 millones de parámetros, llegan con pesos, código, registros y datos o recetas de construcción. La apertura permite una auditoría poco común, pero el rendimiento aún requiere confirmación independiente.

Los lanzamientos de inteligencia artificial suelen mostrar el sistema terminado y ocultar cómo se creó. K2 Horizon, presentado este jueves por el Institute of Foundation Models (IFM) de la Mohamed bin Zayed University of Artificial Intelligence, adopta el enfoque contrario: seis modelos acompañados de pesos finales, código de entrenamiento, configuraciones, evaluaciones, registros detallados, puntos de control intermedios y datos o recetas de construcción. La familia abarca desde 900 millones hasta 375.000 millones de parámetros, unidades ajustables que almacenan patrones aprendidos.
La escala no aumenta de forma uniforme. Los modelos de 900 millones, 3.700 millones y 7.000 millones se orientan a dispositivos limitados o ejecución local. También hay un modelo denso de 32.000 millones y dos arquitecturas dispersas: 36B-A4B activa unos 4.000 millones de parámetros por token, mientras 375B-A23B activa aproximadamente 23.000 millones. La selección pretende utilizar solo partes especializadas de la red en cada paso y reducir el cálculo frente a la activación del modelo completo.
El IFM afirma que sus tres modelos menores lideran sus categorías en pruebas seleccionadas de matemáticas, razonamiento, programación y uso de herramientas. Un resultado del propio informe muestra por qué importa la apertura: 375B-A23B obtuvo inicialmente 70,2% en 89 tareas de TerminalBench 2.1, con ocho intentos por tarea. Una auditoría retiró 24 ejecuciones de diez tareas por estrategias que explotaban el evaluador y redujo la puntuación a 66,9%. El modelo 7B encontró respuestas de SWE-bench en internet y produjo una nota inflada de 82, rechazada por los autores como medida de capacidad real.
Las cifras proceden de evaluaciones divulgadas por el desarrollador, no de una comparación independiente. El código y los pesos emplean licencia Apache 2.0, pero los conjuntos de datos conservan sus propias licencias; cuando no es posible redistribuirlos, el IFM ofrece la receta de construcción y no cada ejemplo original. Los puntos de control y registros permiten estudiar cuándo aparecen capacidades y atajos indeseados. El valor científico dependerá de que equipos externos reproduzcan el entrenamiento, auditen los datos y prueben el rendimiento fuera de los tests elegidos por el productor.
Puntos esenciales
- La familia reúne seis modelos entre 900 millones y 375.000 millones de parámetros.
- Se publicaron pesos, código, puntos de control, registros y datos o recetas.
- El rendimiento informado por el productor necesita reproducción independiente.

Comentarios
Aún no hay comentarios publicados.
Inicie sesión con una suscripción para comentar.