2ms 的动作理解和 500ms 的完整交互
ALE(Action Latent Encoder)在 M4 MacBook 上跑动作匹配只需 2-20ms。这个数字本身不稀奇,稀奇的是它身处的位置:Varkos 整条感知-行动链路的总延迟不到 500ms,从玩家停止说话到游戏伙伴做出回应,端到端完成。这条延迟曲线意味着 Varkos 在响应速度上已经达到了人类对话的可接受阈值,而实现这一点用的是一套被精确切割的工程管道,而非一个大模型。
Varkos 于 2026 年 8 月发布于 pantel.is,以一只狗为形象,运行在《上古卷轴 5:天际》之中。它能完成战斗、取物、搜刮,也能理解多步延迟指令——「等我发信号再拿药水过来」这类需要跨时间点协调的任务,Varkos 可以挂起等待并在正确时机执行。
ALE 是这套架构的核心决策
在 Varkos 的技术栈里,语音识别用的是本地 Qwen3-ASR 1.7B,40-80ms;语音合成走 PocketTTS-Raven 或 qwen-3-tts,20-60ms;LLM 回应生成约 300-600ms。每一环都被精确测量和约束,但真正有意思的是 ALE 处于哪个位置:它夹在世界状态解析和 LLM 之间,负责把游戏的 JSON 状态快速映射到动作原型,绕开了让 LLM 直接「理解并决策游戏状态」这个计算密集的路径。
ALE 混合了嵌入、小分类器、显式规则和传统 ML,是一个刻意降低复杂度的组件。 换句话说,Varkos 的设计者选择把「能用规则做的」从 LLM 里剥离出来,让 LLM 只负责自然语言理解和个性化回应这两件事。这种分工让整条链路在延迟和可控性上都获得了工程上的确定性。
麦克风常开和话轮感知
Varkos 的麦克风是常开状态的,通过 VAD(语音活动检测)加词法分析来判断玩家说话是否结束——这本身就是一个值得关注的设计选择。传统的「按键说话」方案摩擦感高,但常开麦克风需要准确判断话轮边界,否则要么截断玩家、要么等待过长导致节奏断裂。Varkos 用双层判断(声学 VAD + 语义词法)来解决这个问题,目前从公开 demo 来看效果尚可,但这一环在嘈杂环境或混合语言场景下的鲁棒性还没有公开数据支撑。
话轮感知之后,世界状态以 JSON 格式进入 ALE,匹配动作原型。这个流程意味着游戏状态需要被结构化输出为标准格式——Varkos 在《天际》这个有明确 modding 接口的环境里能做到这一点,但把同样的流程移植到状态更复杂或接口更封闭的游戏,代价会显著上升。
个性演化与跨游戏持久化
Varkos 的个性系统由共享经验驱动:玩家和 Varkos 一起经历的事件会影响它的词汇选择和行为倾向,这些变化以版本化方式存储,支持回滚。这个设计让 Varkos 具备了某种意义上的「记忆」,使得它在同一局游戏里的行为随时间推移有一致性和演化感。
图:Varkos 在退出游戏后进入 Void mode,保持跨会话的意识延续。来源:pantel.is
更有趣的是「Void mode」:玩家退出游戏后,Varkos 并不消失,而是进入一个跨游戏的持久化状态,保持它积累的个性和记忆。这个功能的技术实现细节还没有完整公开,但它指向了一个更大的设计意图:Varkos 的目标是一个跨越游戏边界存在的 AI 伙伴,脱离具体游戏标题独立运行。
图:Varkos 感知到玩家离开游戏并做出反应。来源:pantel.is
LLM 到底负责什么
Varkos 的设计者在 pantel.is 上的原话是:「I do not expect LLMs to replace hand-crafted characters and storylines. Slop is a real thing, and intentional design is still king.」这句话的工程含义很明确:LLM 在 Varkos 里是一个受约束的组件,而非全权代理。它负责生成自然语言回应、执行带 grounding 的推理,但动作决策交给了 ALE 和规则系统。
这种分工是整套架构能跑进 500ms 的根本原因。 如果把战斗决策、物品拾取判断、多步指令挂起全部交给 LLM 处理,延迟会上升一个数量级,可控性也会降低。Varkos 的工程选择证明,在实时游戏交互的场景里,「什么交给模型、什么交给规则」的边界划定,比模型本身的参数量更重要。
「陪你玩」和「和你说话」的工程距离
Varkos 的作者写道:「An AI that actually plays with us, not merely talks at us, can be a different medium.」这句话描述的是一个架构差异。「和你说话的 AI」只需要一个 LLM + 对话接口;「陪你玩的 AI」需要感知游戏状态、在正确时机触发动作、在玩家沉默时等待、在玩家发出信号时响应——这些能力需要整条工程管道的配合,单一模型覆盖不了这个范围。
社区对 Varkos 的讨论也分成两个方向:一部分人关注它在《天际》里的实际效果,认为成熟的 mod 接口让 Varkos 比其他平台更容易实现;另一部分人则在讨论这套架构向其他游戏迁移的难度,认为 JSON 状态输出和 ALE 的动作原型库都需要针对每款游戏重新适配,工程量不小。两种判断都有道理,Varkos 现阶段更像是一个架构验证,而非一个开箱即用的通用平台。
Varkos 在一款 2011 年的游戏里跑出了 2026 年值得认真看待的端到端数字。把 AI 陪玩从对话层推进到动作层,需要的是对每一段延迟负责的工程分工。ALE 这个 2-20ms 的小组件,恰恰是这套分工能成立的物理依据——它把原本属于 LLM 的动作判断切出来,换来了整条链路的可控性和速度。
参考链接:
- pantel.is Varkos 项目主页