7月20日,字节跳动Seed官方发布了音频创作模型SeedAudio1.0,旨在通过统一框架下联合建模人声、音效和环境声等多种音频要素,实现影视级音频创作。该模型能够将声音转化为叙事的一部分,直接在听者脑海中形成画面感,实现“听见”即“看见”的效果。
SeedAudio1.0的核心能力包括多要素统一编排、音色风格可控以及多语种自然生成。它支持一条prompt统一编排带有特定情绪的对白、关键音效和环境声,并能按时间线精准控制声音进场。同时,该模型支持文本与参考音频输入,能在长音频和多次延长场景下保持角色一致性,同一音色也能自然呈现不同语气和情绪。此外,SeedAudio1.0支持20+语种的音频生成,同一角色声音可根据不同语种的特点,呈现更自然的发音、节奏与表达方式。
在文本生成音色能力上,SeedAudio1.0在AB主观评测中表现出显著优势,可用率和优良率明显提升。在多场景音频生成能力上,官方评测了影视、电视节目、短剧、动漫、播客对话、直播带货、网络创作、话剧和语音合成等场景,结果显示多数场景中的音频可用率已达到90%以上。针对多语言音频生成能力,在音频自然度上,大部分语言的MOS超过4分,音质已达到优秀水准;在复杂音频生成的指令遵循上,除越南语外,其余语言的MOS均高于3.5分,表明SeedAudio1.0已具备较强的多语言指令遵循能力。目前,SeedAudio1.0已在火山方舟体验中心上线。


