从信号处理到“文本编辑”:阶跃星辰发布的Step-Audio-EditX 如何重塑语音编辑范式?

11.10 整个系统构建在一个统一的框架内,其30亿参数的音频大语言模型作为大脑,接收用户的文本指令例如将这段话的情感从愤怒改为平静,并直接生成符合要求的新的语音标记序列,最终再通过解码器合成出自然流畅的语音

在文本生成能创作小说、图像生成可绘制杰作的今天,语音编辑却始终像一个被遗忘的角落,停留在繁琐的波形剪辑和复杂的信号处理层面。用户无法像修改文字一样,直观地告诉机器“让这句话听起来更悲伤一点”或“把语气变得更自信”。然而,这一局面正被阶跃星辰(StepFun AI)近日发布的开源项目 Step-Audio-EditX 所打破。

 

Step-Audio-EditX 的核心理念,是将语音编辑从传统的“音频信号处理”任务,转变为一种类似文本的“标记(Token)级”操作。这背后依赖于一个参数量高达30亿的音频大语言模型(Audio LLM),它能够理解并生成代表语音的离散标记序列。该模型的开创性在于,它首次让开发者能够“像改一句文本那样,直接编辑语音的情感、语调、风格甚至呼吸声”——这些被统称为“副语言特征”。


2025111001

 

技术内核:双代码本标记器与统一架构

 

这一切的技术基石,是其独特的双代码本音频标记器(Dual-Codebook Audio Tokenizer)。这个创新组件将输入的连续语音波形拆解为两个并行的、离散的标记流:一个以16.7Hz的速率捕获语言内容(如音素),另一个则以25Hz的速率记录语义与韵律信息(如情感和语调)。通过这种分离,模型能够解耦语音的内容与风格,从而实现对后者精准而独立的控制。

 

整个系统构建在一个统一的框架内,其30亿参数的音频大语言模型作为“大脑”,接收用户的文本指令(例如:“将这段话的情感从愤怒改为平静”),并直接生成符合要求的、新的语音标记序列,最终再通过解码器合成出自然流畅的语音。这种端到端的、基于LLM的架构,使其不仅支持强大的零样本语音合成(TTS),更能实现多轮、可迭代的精细编辑。


2025111002

 

在竞争格局中的独特定位

 

当前语音生成领域已有诸多强大模型,如专注于高质量TTS的 Fish Speech、CosyVoice,以及同样具备语音编辑能力的 VoiceCraft。然而,Step-Audio-EditX 的差异化优势在于其明确的设计目标——专为“表现力编辑”而生。如果说其他模型在“生成”上做到极致,Step-Audio-EditX 则在“修改”和“控制”上开辟了新径。其发布的专属评估基准 Step-Audio-Edit-Test 也证明了其在情感、风格等维度上的编辑能力已超越多个现有模型。

 

迈向语音交互新纪元的“最后一块拼图”

 

Step-Audio-EditX 的意义远超一个技术模型。它代表了一种范式的转变:语音不再是需要专业技能才能处理的“信号”,而是可以被普通开发者和创作者像文本一样直观操控的“数据”。在2025年这个语音AI被认为将达到新高度的年份,Step-Audio-EditX 的出现恰逢其时。

 

这项技术的潜在应用场景极为广阔。从为游戏和影视动态生成带有特定情绪的配音,到为虚拟助手赋予更自然、更富表现力的语调,再到为残障人士提供更人性化的语音交互工具,其可能性几乎是无限的。更重要的是,作为一个完全开源的项目(代码和模型已在 GitHub 和 Hugging Face 上发布),它极大地降低了技术门槛,有望激发整个社区的创新活力。

 

当然,挑战依然存在。如何保证在复杂编辑下语音的自然度和连贯性,如何处理长篇幅语音的上下文一致性,以及如何进一步优化推理效率,都是未来需要攻克的难题。但无论如何,Step-Audio-EditX 已经成功地将语音编辑的“魔法”从专业工作室带到了每个人的键盘上,它或许就是构建未来无缝、自然语音交互体验的“最后一块拼图”。

 

项目:
https://stepaudiollm.github.io/step-audio-editx/ 

论文:
https://arxiv.org/pdf/2511.03601 

https://github.com/stepfun-ai/Step-Audio-EditX 

体验:
https://huggingface.co/spaces/stepfun-ai/Step-Audio-EditX