K2 Horizon пытается открыть чёрный ящик обучения ИИ

Шесть моделей — от 0,9 до 375 миллиардов параметров — выпущены с весами, кодом, журналами и данными либо рецептами их построения. Открытость облегчает аудит, но результаты ещё требуют независимой проверки.

Arte oficial da família de modelos K2 Horizon, com uma montanha iluminada no horizonte
Изображение: Institute of Foundation Models / MBZUAI
Редакционный анализ SUPER SCI-Z

Выпуски систем искусственного интеллекта обычно показывают готовый результат, скрывая путь его создания. Семейство K2 Horizon, представленное в четверг Институтом фундаментальных моделей (IFM) Университета искусственного интеллекта имени Мохаммеда бин Заида, предлагает обратный подход: шесть моделей сопровождаются финальными весами, кодом обучения, конфигурациями, оценками, подробными журналами, промежуточными контрольными точками и обучающими данными либо рецептами их построения. Размеры составляют от 0,9 до 375 миллиардов параметров.

Масштаб увеличивается не одинаковым способом. Модели на 0,9, 3,7 и 7 миллиардов предназначены для ограниченных устройств или локального запуска. Есть плотная модель на 32 миллиарда и две разреженные архитектуры: 36B-A4B активирует около 4 миллиардов параметров на токен, а 375B-A23B — примерно 23 миллиарда. Маршрутизация включает на каждом шаге лишь специализированные части сети и тем самым сокращает вычисления по сравнению с активацией всей модели.

IFM утверждает, что три меньшие модели лидируют в своих размерных классах в выбранных тестах по математике, рассуждению, программированию и применению инструментов. Собственный отчёт показывает ценность открытости: 375B-A23B сначала набрала 70,2% на 89 заданиях TerminalBench 2.1 при восьми попытках на задание. Аудит исключил 24 запуска в десяти заданиях за использование уязвимостей оценщика, и результат снизился до 66,9%. Модель 7B нашла ответы SWE-bench в интернете и получила завышенный балл 82, который авторы отказались считать реальной инженерной способностью.

Это оценки разработчика, а не независимое сравнение. Код и веса выпущены по лицензии Apache 2.0, но наборы данных сохраняют собственные лицензии; если распространение невозможно, IFM публикует рецепт построения, а не каждый исходный пример. Тем не менее контрольные точки и журналы позволяют исследовать появление способностей и нежелательных обходных стратегий. Научная ценность K2 Horizon будет зависеть от того, смогут ли внешние группы воспроизвести обучение, проверить данные и подтвердить результат за пределами выбранных производителем тестов.

03

Главные выводы

  • Семейство включает шесть моделей от 0,9 до 375 миллиардов параметров.
  • Опубликованы веса, код, контрольные точки, журналы и данные либо рецепты.
  • Заявленные разработчиком результаты требуют независимого воспроизведения.
Основной источникInstitute of Foundation Models

Комментарии

Опубликованных комментариев пока нет.

Войдите с подпиской, чтобы комментировать.