今天苏米分享一个"卧室里的一张 4090 起步"的故事:Fish Audio——AI 配音公司,5200 万美元种子轮,800 万用户、200 多万个社区声音模型、年化收入 2100 万美元,核心团队只有 22 人。它能做的事用一个场景说明:动画配音里同一角色要先压低声音说秘密、突然笑出来、再愤怒地质问——普通 TTS 会把整段读成同一种语气;Fish Audio 让你直接在台词里写指令控制表演。
一、起点:被 AI 配音"听烦了"的英伟达工程师
联合创始人廖世佳在英伟达做视频研发,业余爱看 VTuber 直播,发现当时的 AI 配音短句还行、台词一长就露馅:语气变平、节奏机械,"无论角色在紧张兴奋还是悲伤,都像在朗读说明书"。这不是"声音像不像真人"的问题——一个模型可以准确读出每个字,但未必会表演。他卧室里用一张 4090 训练语音模型,以 Fish Speech 名义开源到 GitHub,2024 年中离开英伟达全职投入。
二、技术核心:把"声音像不像"拆成两个问题
传统 TTS 先解决正确性(怎么念、哪里停顿);自然与否是另一层——这句话说多快、哪个词加重、说话者在克制还是接近崩溃。Fish Speech 用"双自回归"架构拆成两步:先定内容节奏和声音结构,再补音色质感。2026 年的 S2 模型支持在台词中直接插入自然语言指令:"我没有生气。[压低声音,短暂停顿] 我只是有一点失望。"——指令可以插在任意词前而不是整段贴一个情绪标签;支持多人对话分角色控制音色情绪;支持 83+ 语言和 1.5 万种自然语言控制方式("像刚跑完步的人喘着气说完这句")。更接近一个听得懂导演要求的 AI 配音演员,而不是朗读机器。
三、冷启动:开源模型,从开发者中长出第一批客户
开源后最早进来的不是大企业,是独立开发者、动漫爱好者、游戏设计师——有人给游戏角色配音、有人做二创、有人研究中日韩语的音色。GitHub 攒了几万星,开发者的集成需求自然转成商业客户(数字人、电话客服、语音助手)。
苏米的思考
Fish Audio 是"开源社区冷启动→商业转化"的又一个标准样本(对照 Dify、LiblibAI),但它最值得记的是那个产品洞察:从"读对"到"演对"隔着一条专业鸿沟——每个 AI 生成领域都有这条鸿沟(文字生成从"写对"到"有风格"、图像从"像"到"有构图"),找到鸿沟对应的行业语言(导演的镜头术语、配音的情绪指令)并产品化,就是差异化。另一个启示:情绪指令本质是给声音加了一层 DSL——任何 AI 生成产品都可以问:我的领域里那层"行话 DSL"是什么,能不能让用户直接写进行话?
本文变现路径
产品:AI 配音平台(开源 Fish Speech + 商业 API)→ 流量:GitHub 开源社区→开发者集成 → 变现:API 用量+订阅,年化 2100 万美元。开源+商业双轨模式见《独立开发者变现完全指南》。