AMD 把 AI 烧进芯片,速度是显卡 70 倍

AI芯片AMD硬件

数据源:HN + web research · HN

一家把 AI 模型直接「烧」进硅片里的公司,被芯片巨头 AMD 收购了。这家 2023 年创立于多伦多的初创叫 Taalas,它声称自己的芯片跑 AI 比顶级显卡快 48 倍,每秒能吐 1.7 万个词元,还省电得多。收购金额没有披露,交易预计今年第四季度完成。AI 行业正在为「运行 AI 到底贵不贵」打价格战,AMD 这笔收购,是给一条完全不同的路线下注。

模型是什么:一长串数字,一份食谱

要理解「把 AI 烧进芯片」,先得知道 AI 模型是什么。一个训练好的大模型,本质是一长串数字,从几亿个到几万亿个,业内叫「权重」。这些数字决定了 AI 怎么接话:看到「今天天气」,就接「怎么样」。打个比方,模型像一份食谱——面粉几克、糖几克、烤几分钟,全是数字,做菜步骤全在里面。

显卡是怎么跑 AI 的?它是万能厨具。食谱放桌上,食材摆台面,它一边读食谱一边称料一边做。好处是任何菜谱都能做;代价是每一道菜都要重新读食谱、重新称料,费时费电。

Taalas 换了个思路:把食谱直接刻进锅底。锅自己就会做那道菜,不用读食谱,不用称料,火一点就出锅。这颗「锅」是专门为一道菜定制的——那道菜就是某一个具体的 AI 模型。芯片出厂的那一刻,模型的数字就以电路的形式永久焊死在硅片里。这类芯片只能跑这一个模型,别的什么都干不了,但它跑这一个模型,快到离谱。

Taalas HC1 演示板卡 图:Taalas 的 HC1 演示板卡,模型以电路形式固化在芯片里。来源:taalas.com

每秒 1.7 万词元:一本书十几秒写完

Taalas 不是只画饼。今年 2 月它流片了第一颗测试芯片 HC1,用台积电 6 纳米工艺,里面刻的是 Meta 的开源模型 Llama 3.1 8B——一个 80 亿参数的模型。实测每秒生成 1.7 万词元。词元是 AI 的基本单位,一个词元大约半个到一个词。

这个速度意味着什么,用普通人的尺子量一下:ChatGPT 这类服务目前给用户的生成速度大约是每秒几十个词元,人眼勉强跟得上。1.7 万词元是每秒好几万字——一本十万字的书,十几秒生成完。官方对比口径是比英伟达显卡快 48 倍;以英伟达 H200 显卡为参照算,每秒约 230 词元对 1.7 万,接近 74 倍。口径不同,数字不同,量级一致:几十倍。

Taalas 官方性能对比图 图:Taalas 官方给出的单用户每秒词元数对比(Llama 3.1 8B 模型,英伟达 H200 为基线)。来源:taalas.com

工程上的判断:这是单用户、单模型的理想数据,真实机房里的表现要打折扣。但即便打对折,也足够改写 AI 的成本账了。

为什么这事值钱:AI 每回答一次,都在烧钱

AI 有两个花钱的阶段。训练——把模型喂大,一次花掉上亿美元,但只花一次。推理——模型上线后每一次回答都要重新计算,这是持续不断的开销。你每问一次 ChatGPT,背后都是显卡在满负荷运转,电费在烧。

推理成本正是 AI 普及的最大瓶颈。过去两年各家公司都在打推理价格战,把每次回答的价格一降再降,降的是利润换份额。Taalas 给的是另一条路:模型刻进硅片后,不需要再反复读取和搬运那几百 GB 的数字,电路自己就是数字。Taalas 在 2 月的采访里说,把模型蚀刻进硅片的成本,比训练一个前沿模型便宜 100 倍。这是公司自己的口径,还没经过独立验证,但方向是可信的:一次流片成本再高,也高不过训练一个千亿参数模型。

万能厨具 vs 定制锅:两条路线的对峙

到这里,路线之争就摆上台面了。

显卡是通用路线:什么模型都能跑,模型更新换代,软件升级就行,硬件不用动。代价是效率——为了「什么都能算」,电路里塞了大量用不上的通用逻辑,费电、发热、慢。

Taalas 是专用路线:只为一个模型设计,电路极简,快、省电、便宜。代价是僵——芯片出厂那天,模型就定格了。游戏卡带就是这个逻辑:插上就玩,加载飞快,但出了新游戏,只能买新卡带。数字版游戏随时下载、随时更新,但要等、要带宽。

AI 模型的更新速度是月级的。这颗芯片里刻的还是 2024 年中的老模型,两年过去,在今天的标准下已经过时。模型一更新,芯片里的电路不会跟着变。小修补可以现场打补丁(业内叫 LoRA 适配器,相当于给刻好的菜谱贴便签);模型大改,只能重新流片——重新制造芯片。Taalas 的说法是换模型只需重做两层金属层,比从零设计便宜得多,但依然要重新上产线、重新等产能。哪个模型配得上被刻进去?只有被大规模验证、能长期服役的模型。赌错一次,一柜子芯片变废铁。

AMD 为什么下这个注

英伟达吃下了 AI 芯片市场的大头,AMD 追了多年,显卡性能追上了,软件生态还是短板——全世界的 AI 程序员都习惯用英伟达那套工具,换平台要改代码。硬拼生态赢面不大,AMD 选择换一条赛道:在「模型专用芯片」这片新战场押注。

对手也没闲着。英伟达去年 12 月和推理芯片公司 Groq 签了一笔 200 亿美元的授权协议,盯的同样是「把 AI 跑得更快更便宜」。两家巨头在同一个方向上用不同的姿势下注。

Taalas 的创始人 Ljubisa Bajic 是前 Tenstorrent 公司 CEO,也是 AMD 的老员工——这桩收购某种程度上是回娘家。团队并入 AMD 的 AI 部门。按 The Register 的推测,AMD 的打算是把 Taalas 芯片和自己家的 Instinct 显卡搭配:显卡负责处理问题的开头,Taalas 芯片负责飞速生成回答,各干各的强项。AMD 官方表态很克制,只说收购是为了「给每种 AI 负载提供合适的计算方案」。

Taalas 官网产品演示画面 图:Taalas 官网的产品演示画面。来源:taalas.com

对普通人意味着什么

AI 的运行成本,最终会变成 AI 服务的价格。如果刻进芯片真能把推理成本砍下一个量级,AI 会变得更便宜、更快,然后才有可能走进手机、电视、汽车、家电——那些塞不下整机柜显卡的地方。

HN 讨论区里有人感叹:苹果应该买下这家公司,把模型烧进手机芯片,AI 助手秒回、几乎不耗电。这是很自然的联想,但距离现实还远:HC1 那块芯片本身就不小,刻的还是两年前的模型。你手机里烧着一个过时模型的电路,新模型出来了怎么办——换手机?

这场路线之争没有定论。通用显卡押的是「模型会一直变」,专用芯片押的是「总有几个模型会活很久」。前者灵活,后者极致,各有各的账要算。谁赢,取决于模型更新速度和芯片固化成本的赛跑。第四季度交割完成后,AMD 会用真金白银给出第一批答案。笔者先看着。

参考链接:

  • The Register: AMD acquires AI chip startup Taalas to boost inference performance by etching models into silicon
  • Hacker News: AMD acquires Taalas 讨论帖 (item?id=49201970)
  • AMD 官方新闻稿:AMD Acquires Taalas to Advance Compute Solutions for Rapidly Growing AI Inference Market
  • CNBC: AMD buys Taalas, startup that hardwires AI models into its silicon
  • EE Times: AI Chip Startup Taalas Acquired By AMD
  • Taalas 官网:HC1 Technology Demonstrator 产品页
  • Medium: A Look at Taalas’ HC1 Chip Reaching 16,000 Tokens per Second