8月14日晚,阿里通义千问团队放出了一个”小个子”模型:Qwen3.8-27B,270亿参数,Apache-2.0 协议免费开源,谁都能下载。同一张官方成绩单上,它在编程任务 DeepSWE 1.1 的得分从上一代的 13.3 跳到 42.2——涨了 3 倍多,顺带把几个万亿级参数的商业大模型甩在了身后。消息传到全球开发者社区 Hacker News,一天之内拿到 819 个赞、539 条讨论,是当天热度最高的技术话题之一。
这不是一件”又发布了新模型”的小事。它直接撞上了过去两年 AI 圈最流行的一种直觉:参数越多越聪明。
270亿,在AI界算”小个子”
先解释一下”参数”是什么。可以把大模型想象成一台巨大的旋钮机器,每一个参数就是一个可以拧的旋钮,旋钮越多,机器越”能装”。这些年 AI 公司的竞赛,很大程度就是比谁的旋钮多:从千亿到万亿,顶尖闭源模型已经堆到 2 万亿、甚至 2.4 万亿参数,是 270 亿的将近 90 倍。
旋钮多,意味着训练时烧掉更多显卡、更多电费,用的时候也必须在云端租用昂贵的算力。这套”越大越好”的军备竞赛,最后都折算进了普通用户的账单里——按月付费的会员、按字数计价的接口费。普通人接触 AI,基本只有”花钱租一个云端大脑”这一条路。
Qwen3.8-27B 想走另一条路:把旋钮做精,而不是做多。
先看成绩单:涨3倍,还赢了几个巨无霸
官方公布的对比表里,对手分别是上一代 Qwen3.6-27B、更大的 Qwen3.7-Plus、同量级的 Muse Glimmer-30B,以及闭源巨头 Opus 4.6 Max。270 亿的”小个子”交出了这样的成绩:
- 编程任务 DeepSWE 1.1:42.2,上一代只有 13.3,涨了 3 倍多,官方还特意标注这是 3.7-Plus 的 14.2 的近 3 倍;
- 软件工程任务 SWE-bench Pro:61.7,超过 Opus 4.6 Max 的 53.4;
- 自动化办公任务 CoWorkBench:70.7,超过 Opus 的 68.2;
- 终端操作任务 Terminal Bench 2.1:73.0,逼近 Opus 的 78.2,差距缩到 5 分以内。
图:Qwen3.8-27B 官方成绩表,编程与办公类任务对比上代及闭源大模型。来源:千问官方发布(IT之家转载)
把话说全:它不是全面碾压。在仓库级代码生成等个别任务上,Opus 依然领先;万亿级的庞然大物在不少场景里仍是更强的那个。但方向已经变了——270 亿参数面对比自己大几十倍的对手,输赢不再是单方面的事,这在两年前还难以想象。
小模型凭什么追上来?
这才是这次发布最值得琢磨的地方。从官方模型卡和社区讨论来看,靠的是三件具体的工程事:
第一,注意力机制的”混搭”。 大模型读文字时靠一种叫”注意力”的机制决定该关注哪些内容,但它极其耗算力,这也是大模型吃显卡的大头。Qwen3.8-27B 的做法是把 64 层结构中的约四分之三换成一种更省钱的”线性注意力”(官方名称 Gated DeltaNet),只在剩下的四分之一保留传统的高精度注意力。打个比方:读一本书,大部分章节用快速浏览,重点章节才逐字精读。省下的算力,让 270 亿参数的规模也能消化足够多的知识。
第二,一次多想几步。 传统模型一次只预测下一个字,Qwen3.8-27B 用了”多 token 预测”(MTP)训练,一次预测好几个字。像下棋的人多看几步,走子更连贯,生成速度也更快。
第三,思考开关。 模型默认会”先想后答”,但新加了 reasoning_effort 旋钮,按任务难度调节思考深度:简单问题快速作答,难题才进入深度推理。社区实测里有人让它画一张”骑自行车的鹈鹕”,它认认真真想了两万多步,花了 21 分钟交出一张让围观者惊叹的图;而问个简单问题,它可以秒回。把”想多久”的主动权交出来,是在用工程手段省资源。
从这些设计能看出一个判断:在训练数据和训练方法上花功夫,比无脑堆参数更划算。这个判断是否成立,需要更多第三方验证,但从公开信息看,它已经成了 Qwen 这条”小模型路线”的立身之本。
一本小说量级的”记忆力”,外加能看图的”眼睛”
除了编程,这个模型还带着两个对普通人很直观的能力。
一是超长的”记忆力”:原生支持 26 万 token 的上下文,约等于一次读完整本 20 万字的长篇小说还能记住前后情节,官方称技术上可扩展到 100 万。以前长文档、长视频的 AI 处理是云端大模型的专属,现在小模型也接得住。
二是原生看图、看视频。图像和视频是它的”第一等公民”——从理工科的图表、扫描文档,到几小时长的视频,都能直接理解、直接处理。官方多模态成绩单同样把它排在了不少更大模型的前面。
图:Qwen3.8-27B 多模态成绩表,看图、看视频任务对比。来源:千问官方发布(IT之家转载)
笔记本就能跑:开源最实在的礼物
参数小带来的最直接变化在硬件账本上。万亿级模型自托管需要几十张专业显卡,而 Qwen3.8-27B 的 FP8 量化版权重约 17GB,官方称量化后性能与原始版几乎一致——就像把高清照片压成标清,肉眼几乎看不出差别。社区里已经有人在 MacBook 上用免费工具跑起来,也有人在家用显卡上部署。IT之家报道里说得更直白:量化后家用级显卡即可运行。
这正是”免费开源”四个字的分量:Apache-2.0 协议意味着随便下载、随便改、商用也不收费。一家小公司想把 AI 用在内部流程,不用再按字数给云端接口付费,数据也不用送出公司大门;一个学生想研究模型内部怎么工作,可以把全部”内脏”摊开来看。Hacker News 上有开发者留言说,自己一直用 Qwen 的上一代小模型支撑业务,新版发布当晚就动手测试了。
社区里也有冷静的声音:有人觉得它思考痕迹太重、对部分任务”想太多反而绕远路”;有人提醒,跑分高不代表日常体验一定好,拿 270 亿的模型去硬碰云端 API 的顶级服务,期望要放对地方。这些质疑都成立,它们恰好说明”小模型时代”还没到来——更准确的说法是,小模型第一次挤进了牌桌,和万亿级选手有了掰手腕的资格。
从军备竞赛到两条腿走路,阿里这次押注的是把选择权交还给用户:想要极致能力,去云端租巨无霸;想要便宜、私密、可控,270 亿的”小个子”已经在笔记本上等你。这两种需求,本来就不该只有一种答案。
参考链接:
- Hugging Face 模型页:Qwen3.8-27B(官方模型卡,含架构与完整基准数据)
- Hugging Face 模型页:Qwen3.8-27B-FP8(量化权重版)
- Hacker News 讨论:Qwen 3.8 27B(819 分 / 539 条评论)
- IT之家:阿里开源 Qwen3.8-27B 模型,编程、办公场景表现超越 Qwen3.7-Plus
- 知乎专栏:刚刚,Qwen3.8-27B 开源了!