蜂鸟落在统一日:Aleph Alpha 开源 78B 主权模型 Kolibri,把合规做成了产品
德国统一日当天,海德堡的 Aleph Alpha 发布了英德双语 MoE 模型 Kolibri:78B 总参数、每 token 只激活 3.46B,权重 Apache 2.0 开放,训练全程在德芬算力上完成。这是 2026 年下半年最像"国家基础设施发布"的一次模型亮相——而比模型本身更值得看的,是它的训练管线和合规设计。

统一日飞出的"蜂鸟":发生了什么
2026 年 10 月 3 日,德国统一日,来自海德堡的 Aleph Alpha 发布了新模型 Kolibri——德语里"蜂鸟"的意思。选日子不是巧合:官方博客标题叫《Kolibri Has Landed》,正文第一句就是"值此德国统一日,我们发布新模型 Kolibri"。在一个所有模型发布都挤在工作日的行业里,故意挑国庆日发布,本身就是一种宣言:这是欧洲主权 AI 的国家级亮相。
先说硬参数:Kolibri 是一座英德双语的 Mixture-of-Experts Transformer,总参数 78.1B,每次推理只激活约 3.46B。上下文窗口最高可达 100 万 token(原生训练到 262,144 token,官方提供拉伸到 1M 的配置)。完整权重已经放到 Hugging Face,Apache 2.0 协议——下载、商用、微调、二次开发全部放行。
模型针对德语、推理、数学、代码和智能体行为做了专项强化,带原生工具调用和四档推理强度(none / low / medium / high),可以在成本、延迟和回答质量之间手动换挡。目标客户画像也很明确:公共行政、工业、航空航天——用 Aleph Alpha 自己的话说,是"主权关键任务"(sovereign mission-critical)场景。
这不是 Aleph Alpha 第一次训练模型,但它是第一款真正公开权重的旗舰。值得注意的节奏是:预训练在 9 月 11 日收官,21 天跑完 20 万亿 token,发布只晚了不到一个月——效率本身就是这篇发布要讲的故事之一。
规格拆解:78B 的牌面,3B 的花销
MoE 架构的精髓就是"牌面大、花销小":78B 参数全部要装进显存(FP8 权重约 78GB),但每个 token 只动用 3.46B。这决定了 Kolibri 的部署形态——官方给出的最低配置是 2 块 A100 80GB,或 1 块 H200 / B200 / B300。这不是笔记本玩具,是数据中心级的下载,个人开发者大概率不会本地跑它。
架构细节值得细看:50 层全 MoE,384 个专家、每 token 激活 6 个加 1 个共享专家;注意力是 512 token 滑动窗口,每 5 层插入一次全注意力,用来控制长上下文的推理成本。官方给出的基准成绩相当激进:在数学、代码、 grounding 和长上下文任务上,能对标激活参数多达 4 倍的模型(点名了 Nemotron 3 Super)。AIME 2026 拿到 96.0,LiveCodeBench v6 拿到 85.9——数字很漂亮,但必须加一句:这是厂商自报成绩,第三方独立验证还没出现,"Pareto 前沿"的说法先打个问号再看。
德语是这款模型真正的差异化:预训练 token 里德语占 21.3%,配了 12.8 万词的英德双语分词器,而且翻译语料只占 6%——官方的说法是"按设计就是双语模型,而不是读过一点德语的英语模型"。德语复合词在分词器里被完整保留,这对德语 RAG 和文档处理是实打实的工程红利。
还有一个很少被讨论、但企业客户最想要的特性:Merlin-Arthur 协议。Aleph Alpha 用专门的弃权(abstention)数据训练 Kolibri,当上下文里没有足够证据时,模型会说"我不知道",而不是编一个。RAG 场景里幻觉的代价最高,"会认怂"恰恰是最值钱的产品特性。官方说会持续跟踪和验证弃权准确率——把"不回答"当成一个可度量的能力来运营,这个思路值得所有做企业 Agent 的人抄走。
主权不是口号:合规被做成了产品
Kolibri 发布里最不像"模型发布"的部分,是合规叙事。Aleph Alpha 把主权拆成两个维度:怎么造的(德国团队、在德国和芬兰的算力上训练、受欧洲和德国法律约束),以及怎么交付的(开权重、客户自己部署、知识产权安全)。官方声称从第一天起就按 EU AI Act、欧盟通用 AI 行为准则(GPAI Code of Practice)和 GDPR 来设计,还签署了欧盟的 GPAI 行为准则。训练数据的来源、筛选决策全部文档化——合规在这里不是法务部的事后补丁,而是模型交付物自带的属性。
把时间线拉开看会更有意思:就在 Kolibri 发布两天前,10 月 1 日,马来西亚的 YTL AI Labs 在马来亚大学发布了 ILMUcode——主权算力加本土大模型的同一套叙事。一周之内,欧洲和东南亚各交出一份"主权 AI 答卷"。主权 AI 正在从论文里的概念,变成各国按基础设施规格招标、按国庆日发布的东西。对开发者来说,这意味着未来几年会出现一批"合规优先"的区域模型:不一定是最强的,但一定是最能进政府和银行采购清单的。
但"主权"也有它的层次,不能当口号全盘接收。训练没有外国控制,不等于供应链没有外国环节——那 21 天预训练跑在 768 块 B200 上,而 GPU 还是 NVIDIA 的。真正的主权是分层的:数据主权、训练主权、部署主权、硬件主权,Kolibri 拿到了前三层,第四层全世界都没人拿到。看发布会的时候分清它在讲哪一层,就不会被"主权"这个词带偏。
观点与判断:给 builder 的三条结论
第一,Model Factory 可能是比模型本身更值得抄的作业。官方博客花了很大篇幅讲训练管线:整个流程做成代码版本化,每次改动触发一次小规模端到端训练,几分钟内知道有没有改坏;训练任务是 GitHub Actions workflow,复现一次就是 checkout 一个 commit;checkpoint 每小时落盘、全员可见,任何团队可以端到端拥有一个能力。21 天预训练里遇到 38 次非计划中断(硬件故障、连接超时),全部被管线自动接管,从最近 checkpoint 恢复,最多回滚 250 步。更狠的是他们公开承认:上一代 Kolibri Origin 的预训练曾因一个数据洗牌 bug,跑了几万亿 token 后推倒重来。把训练做成"可版本、可复现、可回滚"的软件工程,这正是 AI 工程化这两年最缺的一课。
第二,1M 上下文看标题,262k 看正文。官方把 1,048,576 写进特性表,但模型原生只训练到 262,144,更长的部分是"提供了拉伸配置"。Aleph Alpha 自己也建议复杂任务待在 262k 以内。记住这个数字游戏:headline context 和 working context 是两回事,选型时以后者为准。
第三,对 vibe coder 和独立开发者的实际意义,不在本地运行,而在"合规 Agent"的参考实现。78GB 权重要两块 A100 起步,个人开发者大概率不会本地跑 Kolibri。但它的设计清单值得抄:四档推理强度(给 Agent 做成本分级)、弃权协议(RAG 的安全阀)、小语种优化思路(21% 本土语料加定制分词器)。如果你在做面向强监管行业(金融、政务、医疗)的 Agent 应用,Kolibri 的发布页本身就是一份需求说明书:客户要的不是最聪明的模型,是"数据不出内网、回答有出处、不知道就认怂"的模型。Apache 2.0 的权重意味着云厂商很快会有人把它做成托管 API,到时候在欧盟区做 toB 应用,就多了一个不用把数据送到美国云的选项。
最后说一句大实话:Kolibri 会不会成为欧洲的"国家队模型",现在下结论太早。基准成绩需要独立复现,生态(微调、量化、推理优化)需要社区时间。但它标志着一个转折——2026 年下半年开始,模型发布的竞争维度从"谁更聪明"扩展到了"谁更合规、谁更能进采购清单"。聪明是上限,合规是入场券。Kolibri 买的正是这张入场券。
欧洲开源模型的 2026:Kolibri 站在什么位置
把 Kolibri 放进 2026 年欧洲开源模型的版图里看,画面更完整。Aleph Alpha 和 Mistral 是公认的两家欧洲冠军:Mistral 刚在 9 月底发布了 Le Chonk,走的是"小而快"的端侧路线;Aleph Alpha 的 Kolibri 则押注"大而合规"的企业与政务路线。一家做轻量推理,一家做主权部署,错位竞争的格局已经成型。
更值得注意的是迭代速度。Kolibri Origin(30B、65k 上下文)在 6 月 11 日完成预训练,Kolibri(78B、最高 1M 上下文)在 9 月 11 日完成预训练——三个月,参数翻 2.5 倍、上下文翻 15 倍、训练 token 从 7.5T 到 20T。官方把这归功于 Model Factory:训练管线本身成了可复用的资产,而不是一次性工程。这种"管线复利"一旦跑通,后续模型的边际成本会快速下降,这也是 Aleph Alpha 敢把发布节奏压到以季度计的底气。
对中文读者还有一个视角:Kolibri 的德语优化路线,其实给小语种场景打了个样。21.3% 的本土语料、12.8 万词定制分词器、只用 6% 翻译数据——这套配比说明,想让模型真正"会"一门语言,靠翻译英文语料灌水是不够的,得有原生语料和分词器级别的投入。做垂直领域中文模型(法律、医疗、政务文书)的团队,可以直接抄这份作业:语料配比和分词器,往往比堆参数更划算。
风险同样清楚:开权重不等于开生态。Hugging Face 上的下载量、社区微调版本、vLLM 等推理框架的适配进度,未来两三个月才是真正的考验。Aleph Alpha 需要配套的 aleph-alpha-inference 包才能在 vLLM 上跑,这意味着开箱即用的门槛比 Llama 系、Qwen 系高一截。主权故事讲得再好,开发者用脚投票看的还是"能不能一行命令跑起来"。这一点,Kolibri 还欠社区一个交代。
原始来源
相关文章

2026 年 10 月 8 日,Google Cloud 在 Gemini at Work 2026 大会上发布 Gemini agent:为工作而生的统一 Agent,拿目标自己规划、按任务在 Gemini 和 Claude 模型之间自动选择,并推出拥有独立邮箱、calendar 和通讯录席位的「同事 Agent」。四点判断:Agent 竞赛的下半场是「更像同事的 Agent」。

10 月 3 日,Sites in ChatGPT 以约 209 点赞、218 评论冲上 HN 前页。这不是发布,而是一场清算:提示词直达 URL,到底是玩具、原型托管,还是生产力?四个争论焦点、文档实锤的技术事实(D1/R2、登录、自定义域名),以及给 vibe coder 的三个判断。

Gergely Orosz 走访 OpenAI、Anthropic、Cursor、Ramp 后写下的 2026 行业现状:近 100% 代码由 AI 生成、Agent PR 八个月涨近 10 倍、code review 沦为表演、IDE 被判为遗产产品。本文提炼报告要点,并给出 vibe coder 的三个判断与四件本周可做的事。