在语音 AI 领域,一件安静却重要的事情正在发生,值得更多关注。Boson AI 是一家成立于 2023 年、位于 圣克拉拉的初创公司,正在通过一款名为 Higgs RealTime 的全新语音到语音模型,突破标准的文本转语音(TTS)流程,而它所代表的技术转变,比乍看之下要重要得多。
Summary
关键要点
- Boson AI 的 Higgs RealTime 在语音处理过程中消除了中间的文本转换步骤,在实时场景中降低延迟并保留声音细节。
- 于 2026 年 6 月 4 日发布的 Higgs TTS 3 支持 100 多种语言的富有表现力的语音,并具备零样本声音克隆和内联情绪控制功能。
- 于 2026 年 6 月推出的 Higgs Avatar API,可以从单张静态图片加上音频或文本输入,生成实时说话人像视频。
- 早期的 Higgs TTS 2 模型在 2025 年 5 月开源发布到 Hugging Face,此前已在超过 1000 万小时的音频数据上完成训练。
- Boson AI 与 OpenAI、Google 和 ElevenLabs 等公司同台竞争,其差异化体现在低延迟、面向生产环境的定位以及面向开发者的开源策略。
超越文本转语音:迈向语音到语音模型
当今大多数语音 AI 系统都遵循相同的基本架构:将输入语音转换为文本,处理文本,然后再合成语音回复。这种方式是可行的——但链路中的每一步都会增加延迟,并剥离人类语音的自然质感。语气、节奏、停顿、情绪色彩:当音频在另一端被重建时,这些几乎都被抹平了。
Higgs RealTime 采用了不同的方法。通过直接以音频形式处理音频——完全消除中间的转写步骤——它减少了让当前语音 AI 显得略微机械的延迟,并保留了让对话更具人性化的声音细节。这正是 Boson AI 所押注的核心:要实现面向生产环境的语音 AI,不仅需要更好的合成能力,还需要从根本上不同的处理架构。
这之所以重要,是因为延迟不仅仅是技术上的小麻烦。在实时语音交互中——例如客服坐席、AI 伴侣、实时翻译工具——哪怕半秒的延迟也会打乱对话的自然节奏。消除文本转换这一瓶颈,不只是让系统更快;它还改变了从一开始就有可能实现的应用类型。
Boson AI 的产品组合:真正已经落地的是什么
Higgs TTS 3 及其多语言、情绪感知能力
Higgs TTS 3 于 2026 年 6 月 4 日发布,是该公司迄今为止最强大的文本转语音模型。它支持100 多种语言的富有表现力的对话语音,并包含两项亮点功能:零样本声音克隆,可在无需大量训练样本的情况下复刻声音;以及内联情绪控制,允许开发者在实时生成语音时调整情绪表达。对于构建语音交互界面的开发者而言,这种“广泛语言支持 + 精细表达控制”的组合,相比早期模型,打开了更广泛的实际应用空间。
Higgs Avatar API:会说话的静态图像
在 TTS 产品线之外,Boson AI 于 2026 年 6 月推出了 Higgs Avatar API。该工具只需一张静态图片,再配合音频或文本输入,就能生成实时说话人像视频。这是一项紧凑却强大的能力——这种特性可以显著降低交互式数字形象的制作门槛,无论是面向客户的应用、教育工具,还是虚拟助手。
开源早期模型以构建开发者基础
Boson AI 早期的 Higgs TTS 2 模型于 2025 年 5 月在 Hugging Face 上开源,此前已在超过 1000 万小时的音频数据上完成训练。这一决定并非偶然。免费发布这些模型,是为了刻意建立开发者好感和生态势能——这一策略还通过与 Eigen AI 于 2026 年 3 月 20–22 日在山景城联合举办 Higgs Audio Hackathon 得到强化。如此规模的开源既体现了对底层技术的信心,也表明公司明确意图在开发者心智中竞争,而不仅仅是争夺企业合同。
Boson AI 的创始人是谁,以及这为何重要
Boson AI 由 Alex Smola 和 Mu Li(李沐) 于 2023 年共同创立,总部位于加利福尼亚州圣克拉拉。Smola 拥有深厚的机器学习学术背景——这种研究资历往往意味着非同寻常的技术野心,而不是对现有产品的小步迭代。公司宣称的重点是面向生产环境、低延迟的语音 AI 应用,这使其定位并非“带着演示的研究实验室”,而是“为真实世界部署约束而构建产品的团队”。
这种对生产环境的强调值得特别指出。许多语音 AI 项目主要优化基准测试成绩或控制环境下的演示效果。Boson AI 围绕延迟、开发者工具链和开源分发的定位,表明这支团队认真思考过语音 AI 在实际应用中究竟会在哪些环节失效——并据此进行构建。
竞争格局:与 OpenAI、Google 和 ElevenLabs 同场竞技
Boson AI 进入的是一个由既有巨头掌控、且拥有巨大资源和分发优势的市场。OpenAI 最近更新了其 ChatGPT 桌面应用,支持基于全新 ChatGPT-Live 语音模型家族构建的 ChatGPT Voice,具备多步代理指令和电脑操作等能力。Anthropic 更新了 Claude 的语音模式,使其支持 Opus、Sonnet 和 Haiku 模型,并新增与 Gmail、Slack 和 Notion 等工具的集成。ElevenLabs 则围绕大规模语音合成与声音克隆构建了可观的业务。
在这样的竞争环境中,Boson AI 的差异化依托于几项具体押注:Higgs RealTime 的技术架构、Higgs TTS 3 的广泛语言支持,以及相比大厂更为积极的开源开发者策略。这些优势能否在 OpenAI 等公司持续迭代自身语音技术栈的过程中保持下去,是公司当前面临的核心问题。
让竞争格局变得有趣的一点在于,生产环境中的低延迟仍然是整个行业尚未完全解决的问题。OpenAI 的语音更新高度聚焦于对话流畅度和代理集成;而 Boson AI 通过消除转写层,瞄准的是另一种同样真实的摩擦点。两者可以同时成立——这也意味着,实际可容纳的专业化玩家,可能比头条新闻所呈现的竞争态势要多。
常见问题
什么是 Boson AI 的 Higgs RealTime 模型?
Higgs RealTime 是一款语音到语音模型,它消除了中间的文本转换步骤,从而降低延迟,并在实时语音 AI 交互中保留声音细节。
Boson AI 的 Higgs TTS 3 有哪些关键特性?
Higgs TTS 3 在 100 多种语言中提供富有表现力的对话语音,支持零样本声音克隆,并具备内联情绪控制功能,使开发者能够在实时生成语音时调整情绪表达。
Boson AI 如何与开发者社区互动?
Boson AI 于 2025 年 5 月在 Hugging Face 上开源了早期的 Higgs TTS 2 模型,并于 2026 年 3 月 20–22 日在山景城与 Eigen AI 联合举办 Higgs Audio Hackathon,以推动生态系统的采用。
Boson AI 如何在竞争激烈的语音 AI 市场中定位自己?
Boson AI 通过联合创始人深厚的学术背景、对早期模型的开源策略,以及对面向生产环境、低延迟语音 AI 应用的聚焦来实现差异化——并与 OpenAI、Google 和 ElevenLabs 等更大玩家展开竞争。
{“@context”:”https://schema.org”,”@type”:”FAQPage”,”mainEntity”:[{“@type”:”Question”,”name”:”什么是 Boson AI 的 Higgs RealTime 模型?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Higgs RealTime 是一款语音到语音模型,它消除了中间的文本转换步骤,从而降低延迟,并在实时语音 AI 交互中保留声音细节。”}},{“@type”:”Question”,”name”:”Boson AI 的 Higgs TTS 3 有哪些关键特性?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Higgs TTS 3 在 100 多种语言中提供富有表现力的对话语音,支持零样本声音克隆,并具备内联情绪控制功能,使开发者能够在实时生成语音时调整情绪表达。”}},{“@type”:”Question”,”name”:”Boson AI 如何与开发者社区互动?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Boson AI 于 2025 年 5 月在 Hugging Face 上开源了早期的 Higgs TTS 2 模型,并于 2026 年 3 月 20–22 日在山景城与 Eigen AI 联合举办 Higgs Audio Hackathon,以推动生态系统的采用。”}},{“@type”:”Question”,”name”:”Boson AI 如何在竞争激烈的语音 AI 市场中定位自己?”,”acceptedAnswer”:{“@type”:”Answer”,”text”:”Boson AI 通过联合创始人深厚的学术背景、对早期模型的开源策略,以及对面向生产环境、低延迟语音 AI 应用的聚焦来实现差异化——并与 OpenAI、Google 和 ElevenLabs 等更大玩家展开竞争。”}}]}
本文由人工智能协助生成,并由编辑团队审核。

