全世界都在喊开源,绝大多数人却没分清公开模型和公开数据是两件事。
2026 年 10 月 3 日德国统一日,欧洲 AI 公司 Aleph Alpha 端出了一个 780 亿参数的庞然大物 Kolibri。他们开源了模型,却没有交出哪怕 1KB 的原始训练数据。
模型上线后,社区讨论区最核心的炮火全集中在数据去向上。一方坚持不放数据就不配叫开放,另一方则指出行业早就默许了只交权重的潜规则。
开源被偷换了概念,只给产品不给原料
把产品免费送给用户,和把祖传菜谱连同供货商名单一起发出去,根本是两码事。行业巨头长期用一个笼统的开源来粉饰自己对核心数据的垄断。
Kolibri 走了一条折中路线。他们把拥有 30 亿激活参数的 MoE 架构模型挂在了 Hugging Face 上,以 Apache 2.0 协议免费授权。面对最核心的训练集,他们收起了原始数据,转头抛出了一份长篇的构建说明书。
参与预训练的工程师甚至跑到社区讨论区,一条条解答数据清洗的细节。物理硬盘的交接只是表面文章,真正的透明度是证明自己能掌控数据蒸馏的整条流水线。
图:绿色渐变底上的白色蜂鸟 logo 与字标。来源:Aleph Alpha
拒绝翻译腔,用21%母语夺回控制权
为了喂饱这个大模型,训练过程吃掉了 20 万亿个 token。在最核心的预训练语料里,德语原生数据占到了 21.3%,翻译文本被压缩到仅有 6%。
这个配比背后藏着明确的防守逻辑。大面积使用翻译文本,模型就会带上英语世界的文化指纹。他们明确交代了精确去重、模糊去重和子串去重加启发式过滤的具体做法。
从 7.5T 到 20T 的数据扩张中,质量分类器的蒸馏过程也被写得清清楚楚。谁能把清洗配方写出来,谁就有资格去谈不受制于人的主权。
算力换不来底气,让机器学会说不知道
在理科测试里,Kolibri 在 AIME 2026 数学竞赛中拿到了 96.0 分。这个成绩追平了激活参数是自己四倍的同量级对手。
他们采用了 Merlin-Arthur 协议来训练模型,专门教机器如何承认无知。当遇到超纲的上下文问题时,模型会干脆利落地回答我不知道,拒绝一本正经地胡编乱造。
不胡编乱造需要模型对自身的知识边界有敏锐的感知力,这种工程品质单纯靠砸显卡买不到。
图:Kolibri-1 在 Hugging Face 上的模型卡详情。来源:Hugging Face / Aleph Alpha
用配方取代原料本身
版权赔偿依然是一笔算不清的账。面对德语作者的版权争议,厂商至今没有给出具体的赔偿金额。现实问题依旧悬而未决。
Kolibri 把训练数据的构造过程写到了能照着复现的地步。这等于是把行业长期默认的模糊地带摊到了桌面上。能不能交出那块硬盘,不再是判断开源的唯一指标。
一家厂商只要能把配方和质量分类器蒸馏全交代清楚,主权这张牌就握在了他们自己手里。
参考链接:
- 德国统一日 Aleph Alpha 发布 Kolibri
- HN 讨论(关于 open-weight 与 open-data)