
2025年,杨斌体验了一款海外语音交互产品Sesame。一两轮对话后,他因暂时想不到问题陷入沉默。几秒后,对面突然主动开口:“你现在是不是思维卡壳了?”随后补了一句话,把中断的话题接了起来。
这个微小的反应让杨斌感到意外,模型似乎不只听懂了他讲的内容,还注意到停顿背后的犹豫和尴尬,主动改变对话节奏。“它从等待用户提出问题,变成参与交互本身。”
在此之前,杨斌关注过一款实时语音模型Moshi,那是当时世界上首个原生实时语音输入输出能力的模型,AI因此能够做到“同时听和说”。这次Sesame上的交互体验像是对这一技术前景的再次验证。
在杨斌看来,语音不会只是大模型外接的输入输出工具,而将成为下一代人机协作的核心界面。相较于上一代语音模型主要解决自然度、情感表达和多语言生成问题,下一阶段更重要的是让AI具备实时交互能力:持续理解用户所处的情境、交流意图与任务进展,在沟通中判断何时倾听、何时回应、何时主动确认,并与人共同推进任务。
围绕这个想法,杨斌自2025年开始组建团队,于2025年底创立音频模型公司BreezeBlue。他带团队自研的模型Breeze TTS 2,能够生成自然、清晰的语音,并理解用户的角色设定和表演要求,应用于实时交互场景。
最近,在国际权威评测机构Artificial Analysis发布的Text-to-Speech榜单中,Breeze TTS 2排名全球并列第四,超过ElevenLabs v3、Gemini 3.1 Flash TTS等行业头部模型。为更真实地反映模型在广泛业务场景中的通用生成能力,Breeze TTS 2的参评音色全部通过零样本音色设计生成,未使用针对评测场景的人工录制音频进行模型微调。

创始人杨斌2022年多伦多大学博士毕业。博士期间,他与导师联合创立全球第一个自动驾驶研究实验室Uber ATG Research,后联合创立自动驾驶卡车公司Waabi,获得微软博士奖学金、英伟达先锋研究奖,谷歌学术引用16,000+次。博士毕业后,他加入MiniMax,担任技术合伙人与视觉生成模型团队负责人,代表工作包括图像生成模型的个性化生成技术研究以及视频生成模型的scaling law研究(CVPR2025 Most Influential Papers Top3),并落地Talkie、星野、海螺等内容互动和创作产品。
BreezeBlue目前团队规模15人,团队成员来自谷歌、字节、阿里、阶跃、华为等公司,围绕语音模型搭建的预训练、后训练、数据、评估、infra等环节展开协作。目前,BreezeBlue已获600万美元种子轮融资,由元璟资本、红点中国联合领投。
从提供固定音色,到让用户创造声音、指导表演
BreezeBlue将自己定义为一家以自研语音模型为核心的Voice AI公司,通过超拟人、低延迟且高度可控的语音能力,推动语音技术从AIGC时代的内容创作迈向AGI时代的实时人机交互,为创作者、开发者和企业提供适用于多元角色与交互场景的语音基础设施。
在团队看来,当前TTS模型已经能够生成自然、清晰的声音,但大部分能力仍被封装在固定产品中。声音、角色和表达方式通常由平台预设,用户只能从已有音色和情绪标签中进行选择,很难真正定义一个角色是谁,以及它在不同情境中应当如何说话。
Breeze TTS 2首先试图解决的,是让声音从一次性的生成结果,变成可以被设计、指导和复用的角色资产。他们认为,传统TTS生产的短音频内容主要用于旁白、配音等,重点考察自然度、音质和单次情绪表现,比如用户给出一段文字,模型生成一段可以直接消费的声音。BreezeBlue则致力于让AI根据角色的人设、场景和关系,持续做出合适的声音表演。如广播剧、游戏角色、虚拟主播和AI Agent等需要长期、角色化互动的场景。
在目前的落地场景中,BreezeBlue不断确定这类创作者的诉求。今年,一名创作者使用BreezeBlue的产品制作了一部十几分钟的《三体》二创广播剧,其中包含多个角色,对音色区分、情绪表达和长内容稳定性都有极高的要求,作品发布首日即冲上平台热门。同时,一位海外客户使用BreezeBlue的API搭建虚拟主播,每场直播持续一至两个小时。AI主播需要不断回复弹幕,根据观众的指令改变语气、完成声音表演和“整活”,目前已累计完成上百场直播。

△图注:Breeze TTS 2与主流TTS模型对比
据此,BreezeBlue的声音模型Breeze TTS 2,核心功能主要集中在音色设计、声音指导以及实时生成等方面。
首先,Breeze TTS 2能够把开放式的角色描述直接转化为声音。用户不仅可以指定年龄、口音和音色,还可以描述声音质感、人物气质、性格特征和表达方式,由模型从零创造符合设定、具有辨识度的新声音,而不再局限于预设音色库。Breeze TTS 2在Voice Design Benchmark中取得行业第一,体现了模型对抽象角色概念的理解能力和声音生成的多样性。
其次,Breeze TTS 2能够基于已有声音,理解并执行自然语言提出的表演要求,同时尽可能保持原有说话人的声音身份。它所控制的不只是“开心”或“悲伤”等基础情绪,还包括口音、声音质感、笑声与叹气等声音事件,以及紧张、疲惫等生理状态、交流意图、角色状态和多项要求组合而成的复杂表演,也能处理一句话中表演方式随时间发生变化的指令。在Voice Direction Benchmark中,Breeze TTS 2取得行业第一,展现其在指令遵循、语义完整性和实际可用性等方面的性能。
此外,Breeze TTS 2的模型侧生成延迟(TTFB,Time To First Byte)低至40ms,领先于 ElevenLabs Flash v2.5官方披露的50ms model TTFB。模型并非通过牺牲声音质量换取速度,而是在低延迟下继续保持更高的自然度、文本准确性、表演能力与实际可用性,可用于实时智能体、游戏角色、互动娱乐和智能客服等场景。
同时,Breeze TTS 2支持50多种语言,覆盖全球100多个国家和地区。模型在扩展语言覆盖范围的同时,保持不同语言下的声音自然度、角色一致性和表演控制能力。
基于Breeze TTS 2,团队还打造了面向内容创作者的AI声音设计与语音生成平台BreezeCreator。让用户可以从零创造角色声音,也可以通过自然语言指导声音的情绪、节奏、语气和表演方式。
目前,BreezeBlue已形成C端创作者产品与B端企业服务并行的商业化路径。C端方面,BreezeCreator已服务全球数万名创作者,用于角色声音设计和专业音频内容生产;B端方面,BreezeBlue通过API及企业服务,已在虚拟主播、互动漫剧、角色扮演和AI游戏等场景实现真实落地,帮助客户打造以声音为核心的内容产品与互动式消费体验。随着模型能力从TTS进一步走向实时语音交互,BreezeBlue将持续拓展企业与开发者生态,构建覆盖内容生成与实时交互的语音基础设施。
为声音角色的长期互动重建研发链路
在BreezeBlue看来,要让语音模型从生成一段配音,转向长期扮演一个角色,需要改变的是从数据、模型到评测的整条研发链路。
模型层面,BreezeBlue沿用了大语言模型的技术路线,希望把语言模型的泛化能力、指令遵循能力和Scaling Law迁移到声音生成中。
在初期的数据采集与标注方面,BreezeBlue更关注影视、短剧、访谈和播客中的长对话。这些声音包含更强的情绪张力,也呈现了人物如何接话、停顿,以及随语境改变表达。团队需要先把一段复杂的长音频拆成一来一回的对话,再标注其中的角色、情绪、表达意图和上下文等。希望让模型见过更复杂的互动、理解人际关系,而不只是学习标准化朗读。
而在一次测评登顶榜单后,BreezeBlue对研发链路有了新的理解。
2025年底,BreezeBlue第一版模型在语音指令遵循评测集InstructTTSEval上取得第一。按照常见的模型研发逻辑,这意味着它已经具备领先的指令控制能力。但团队把模型交给专业创作者后发现,Benchmark第一并不等于产品好用。
他们发现,学术评测更像是在判断一个个离散片段:当客户输入“生成一段气势磅礴的电影宣传片旁白”后,学术评测判断模型生成的声音是否符合要求;或者分别衡量一段声音够不够开心、够不够悲伤。但当前的市场诉求并非只生成一句孤立的声音,而是先创造一个角色,再让这个角色进入不同场景,他们要求模型在连续变化中,同时做到表达准确、过渡自然和角色稳定。
为此,BreezeBlue与客户、创作者共同拆解真实工作流,重新围绕“音色设计”和“声音导演”两个主要环节搭建评测体系。音色设计就像是“捏角色”,声音导演则是让角色在不同场景中完成表演。
在调研过程中,BreezeBlue发现同一个AI主播可能会先主持情感节目,接着进行体育解说,最后录制一档深夜播客。为保证用户的互动体验,模型需要做到根据场景改变情绪、语气和节奏,又保证始终是同一个人。而过去的评测更多是两者的混合,只判断单次生成结果。BreezeBlue便针对跨场景适配、角色一致性和连续变化等方面的评判,搭建新的测评体系。
目前这套Benchmark已经开源,具体包括测试题、细分能力指标和自动化评估等。也是基于这套新的评测标准,团队重新比较和迭代模型,做出了第二版模型及产品。
这次调整也让BreezeBlue开始用真实用户场景定义模型优化方向。在杨斌看来,目前行业正从单句TTS转向长内容和实时交互的路线,但模型进展快于数据与评测体系,BreezeBlue的这套针对性的研发链路也将帮助自身占领当下市场窗口。
大模型越强,语音交互越紧迫
杨斌当前判断一个创业方向是否成立,有一条简单的标准:它解决的问题,会随大模型发展变得更紧迫,还是会在半年后被基础模型顺手解决。
在他看来,语音交互属于前者。随着模型执行和推理能力持续提高,人机之间的信息传递、情境理解与协作效率,反而可能成为新的瓶颈。基础模型能够完成越来越复杂的任务,但人类监督、反馈和纠偏的带宽并没有同步增长。而AI Voice是连接基础模型智能与用户体验的关键交互层。
这个判断也来自他与团队使用Coding Agent的经历。过去,工程师会主动设计代码结构,并审阅Agent提交的大部分修改;随着代码模型Agent能力的提升,人工监督逐渐转向测试结果验收和关键节点介入。模型执行得更快,但人如何低成本地了解进展、补充背景和纠正方向,开始成为新的问题。
这一矛盾让杨斌再次思考语音智能的价值。语音无法代替代码、数据和可视化界面,但可以成为一种更加低摩擦的实时协作方式。AI可以在执行过程中主动汇报关键进展、确认中间判断,人也可以随时打断、补充信息或改变目标。要实现这种体验,模型不仅需要识别用户说了什么,还要理解语气、停顿、情绪和交流意图,并判断自己何时回应、如何表达,以及是否需要主动发起确认。
在杨斌看来,未来交互将从键盘和文本,走向更自然、实时、低负担的语音交流。AI也将逐渐具备持续倾听、实时理解、接受打断、感知情绪和主动协作的能力。而BreezeBlue的生态定位,则是在其中构建智能与人之间的语音交互层。让AI以不同角色、在不同场景中自然地与人交流,同时将这种能力开放给整个生态,让交互智能从封闭产品走向通用基础设施。
为此,BreezeBlue规划了两个递进的技术里程碑。第一个里程碑是生成式语音智能,解决“如何让任何角色拥有独特的声音与表演能力”;第二个里程碑是交互式语音智能,进一步解决“如何让角色理解情境、适应用户并持续完成任务”。前者为后者提供模型、数据与评估基础,最终共同构成通用的语音交互智能基础设施。
未来一至两年时间里,BreezeBlue将计划围绕声音创作、实时交互和开发者生态持续拓展商业化边界。在创作者市场,BreezeBlue将继续强化声音设计、音色导演等核心能力,让AI声音从传统的“文本朗读”进一步走向可设计、可指导、可持续复用的声音资产,覆盖视频、播客、有声内容、游戏和虚拟角色等更多专业创作场景。
同时,BreezeBlue将把已经验证的模型能力进一步开放给企业和开发者。依托低延迟语音生成、角色声音设计及自然语言声音控制能力,通过API、SDK等方式进入AI Agent、游戏、虚拟角色、智能硬件和实时客服等产品,让企业能够为自己的应用构建具有独特身份、能够理解场景并实时表达的声音。
随着模型能力进一步向实时交互的方向演进,BreezeBlue的商业化空间也将从内容生产进一步延伸至实时人机交互,客户结构从以内容创作者和内容生产企业为主,进一步扩展到AI Agent公司、游戏厂商、机器人和智能硬件企业、企业服务平台等。
文章来自于"智能涌现",作者 "赵芮"。