全网信息技术服务商

电脑端+手机端+微信端+APP端(安卓+IOS),全网覆盖

0532-89269576

Hermes Agent v0.20史上最大更新:语音能插话了、多Agent能联网了

发布时间:2026-08-07 编辑:智序网络 浏览:154 次

2026年8月3日,Nous Research发布了Hermes Agent v0.20.0,代号"The Herald Release"。单版本合并约1400个PR、3650次提交、5200个文件变更,650多名贡献者参与。

这是Hermes项目有史以来规模最大的一次迭代。

这不是又一个小版本更新。 这次升级同时推进了三条主线:语音交互从"能用"变成"自然",Agent架构从单体扩展到多智能体互联,以及一轮系统性的开发者体验补全。

语音终于能"打断"了

以前的AI语音交互是什么体验?你说一句,等它生成完一整段,再听它念完。中间你想说"停,这里不对"——不行,只能干等。就像用老式对讲机,说完还得加一句"over"。

v0.20改了这个底层逻辑。

Hermes现在支持实时流式语音输出,你可以随时开口打断。 AI一边生成一边按分句往外说,你一旦说话它立刻停下来开始听,模型会被告知"你被打断了"。

还有两个细节值得关注。

一个是本地唤醒词。你可以自定义唤醒短语,比如"hey Hermes",检测完全在本地完成,等待期间音频不会离开你的机器。另一个是忙碌感知静音检测——你在思考的时候它不会误触发。

语音模式覆盖了CLI、桌面端以及所有网关平台(WhatsApp、飞书、钉钉、LINE、QQ、Photon、微信)。发条语音过去,Hermes转写、理解、回复。

你品品,这不就是打电话吗?

A2A协议:让Agent之间能"聊天"

v0.20实现了A2A(Agent-to-Agent)协议v1.0。

这意味着什么?你可以把多个Hermes实例(或其他支持A2A协议的Agent)组成协作网络——一个负责搜索,一个负责代码执行,一个负责用户界面,主Agent负责调度和汇总。

这个能力在之前的v0.18"Judgment"版本里就埋下了伏笔,引入了Mixture-of-Agents预设和支持后台并行的Projects。A2A v1.0是这条路线的正式落地。

需要提醒的是,A2A目前是v1.0,生态还在早期。这不是开箱即用的"几个Agent自动协作",而是提供了一套协议和SDK,开发者来决定怎么组网。

冷启动快了8倍

除了新功能,这次的性能优化同样值得关注。

官方数据:冷启动从14秒降到1.8秒,首Token延迟降低约80%。

原理是启动路径做了大量延迟加载——重度平台适配器只在用到时才初始化,模型目录优先读磁盘缓存,健康检查并行跑。以前的导入和网络调用都堆在冷启动链路里,现在被拆散了。

中大型任务的整体执行时间变化不大,但一开始不用等这件事对使用体验的影响是质的飞跃。

另外,工具调用迭代上限从90提升到了500。对于需要多步骤工具调用的复杂Agent任务来说,这意味着更少被硬性截断。

开发者体验的集中补全

这一版对CLI做了一轮集中补全,有几个命令很实用:

/init 扫描项目结构,自动生成或更新AGENTS.md。对于还在用手写配置文件的团队来说,这个命令能省不少时间。

!command 直接执行Shell命令,不消耗模型轮次。写脚本和调试的时候很常用。

/diff 显示暂存、全部或当前会话的变更。

/context 分析当前上下文窗口占用情况——Token预算紧张的时候这个很关键。

/focus 精简输出视图,减少干扰信息。

还有一个容易被忽略的改动:运行中纠偏。以前AI执行过程中走偏了,只能等它跑完再重新提问,或者强制中断重来。现在可以在任意节点输入纠正,当前轮次被重定向而非重启,原始提示保留。

工具自愈也升级了——截断的终端输出会溢出到文件供Agent读回,patch能检测已应用的编辑并诊断空白不匹配,write_file会验证磁盘内容。

2026年的版本节奏:每两周一个命名版本

把Hermes 2026年的版本历史铺开,能看到一个清晰的节奏:

v0.16(6月) 桌面应用正式版,macOS/Linux/Windows全覆盖

v0.17(6月) iMessage接入、Automation Blueprints

v0.18(7月) Mixture-of-Agents、/goal目标系统、Projects后台并行

v0.19(7月) 首Token延迟降低80%,Bitwarden/1Password密钥源接入

v0.20(8月) 语音交互、A2A协议、性能全面优化

大概每两周一个命名版本。对于生产环境的团队来说,追最新版不现实,建议关注命名版本并在每个大版本发布后评估一次升级窗口。

国内开发者的接入选择

Hermes支持的Provider已经相当广:Anthropic原生、Google AI Studio、AWS Bedrock、Nous Portal(400+模型)、xAI Grok、Hugging Face等。

国内开发者常见痛点是多个模型服务各自的API Key管理,以及密钥安全。七牛云等MCP服务支持SSE、HTTP-Streamable等多种协议接入,密钥在云端托管,可以作为Hermes工具调用层的统一接入点,避免在本地暴露各服务凭证。

对于需要把Hermes连接多个国内模型(DeepSeek、Kimi、GLM等)的场景,通过统一接入点能显著降低运维复杂度。

这标志着什么

Hermes v0.20的更新方向很明确——从CLI工具向跨平台AI Agent基础设施演进

语音交互让交互门槛从"打字"降到"说话",A2A协议打开了多智能体协作的路径,本地推理优化降低了部署成本,工具自愈和运行中纠偏提升了任务可靠性。

2026年的AI Agent赛道,正在从"谁的模型更强"转向"谁能更稳定地把任务跑完"。

Hermes用这次最大版本更新给出了它的答案:可靠的工具链 + 自然的交互方式 + 可协作的架构,三者缺一不可。

您的项目需求

*请认真填写需求信息,我们会在24小时内与您取得联系。