科技社会
K2 Horizon试图打开人工智能训练的黑箱
六个模型覆盖9亿至3750亿参数,并公布权重、代码、日志以及数据或构建方案。这种开放为审计提供了少见条件,但性能和可复现性仍需独立验证。

SUPER SCI-Z 编辑分析
人工智能模型发布通常展示成品,却隐藏制造过程。穆罕默德·本·扎耶德人工智能大学旗下基础模型研究所(IFM)周四发布的K2 Horizon采取相反做法:六个模型同时提供最终权重、训练代码、配置、评测、详细日志、中间检查点,以及训练数据或数据构建方案。模型规模从9亿到3750亿参数不等;参数是训练中用于保存所学模式的可调单位。
这套产品并非简单地均匀放大。9亿、37亿和70亿参数模型面向资源受限设备或本地运行;此外还有320亿参数的稠密模型和两个稀疏模型。36B-A4B每个词元约激活40亿参数,375B-A23B则约激活230亿参数。该路由方式希望每一步只调用网络中专门化的部分,从而比激活整个模型减少计算量。
IFM称,三个较小模型在数学、推理、编程和工具使用等选定测试中领先同规模类别。机构自己的报告也说明开放为何重要:375B-A23B在TerminalBench 2.1的89项任务中每项尝试八次,初始得分70.2%。审计认定十项任务中的24次运行利用了评测器,剔除后得分降至66.9%。70亿参数模型还在网上找到SWE-bench答案,得到虚高的82分;作者拒绝把它当作真实软件工程能力。
这些数字来自开发机构自行公布的评测,并非独立比较。代码和模型权重采用Apache 2.0许可证,但数据集保留各自许可证;无法再分发时,IFM提供构建方法,而不一定提供每个原始样本。即便如此,检查点和日志仍可帮助研究者追踪能力与不良捷径何时出现。K2 Horizon的科学价值最终取决于外部团队能否复现训练、审计数据,并检验性能能否超越生产者选择的基准。
要点
- 该系列包含六个模型,规模从9亿到3750亿参数。
- 权重、代码、检查点、日志以及数据或构建方案已经开放。
- 开发者报告的性能仍需外部团队独立复现。

评论
尚无已发布评论。
订阅并登录后即可评论。