自研 AI 数字人与语音模型
Genpio 自己训练数字人与语音模型,跑在自有推理栈上。公开训练语料:OpenSLR SLR94、SLR37、SLR41-44 与 Google FLEURS。
我们没有套用 别人的 AI。 模型是我们自己训练的。
多数 AI 直播软件只是在租来的 API 外面套了一层壳。Genpio 的数字人模型和语音模型是我们自研的,自己训练,跑在自己的推理架构上。所以我们能做到一秒内应答,用一小段样音就克隆出声音,还能用同一个模型同时跑数百场直播。
实时评论响应, 本地化母语人声, 语音库覆盖的语言, 并发直播,同一个模型, 数百
超过 85 种语言,一次训练完成。
谁都可以说自己训练了模型。下面是真正进入我们模型的数据,每个语料库都标了编号,方便你回源核对。85 种以上的语言在同一次训练里一起学,其中 85 种以上作为输出语言出现在线上语音库里。
所有数据在同一轮训练里一起学,绝不分开逐个训练。逐个训练会让后一轮覆盖前一轮,最后模型只会说它最后见过的那一种。一份混合语料,一轮训练,一个模型。上面每个语料库编号都是 OpenSLR 的官方编号,而且逐一对照 OpenSLR 索引核对过,不是凭记忆写的,你不必只听我们的。完整语音库支持的语言还要更多。
这套混合数据里的每一个语料库都在模型卡上有完整记录,包含编号、许可证、采样率和时长。
Corpora
Mls
这轮训练里说话人最多的一份语料。它没有带来新语言,这八种模型本来就会说;但几千位不同朗读者的录音,能让每个声音保持自己的特点,不会被平均成千人一声。
Multilingual LibriSpeech(SLR94)
英语、德语、荷兰语、法语、意大利语、西班牙语、葡萄牙语、波兰语
整套混合语料里最干净的音频,在录音棚里以 48 kHz 录制,不是从网上抓的。量不大,但每一小时都用在从零教会一门新语言上,而不是给已经会的语言做打磨。
Google 录音棚 TTS(SLR37、41-44)
孟加拉语、爪哇语、高棉语、尼泊尔语、巽他语
Google Indic
混合语料中真正教语言的最大一块:六种印度语言加缅甸语,按同一录音棚标准录制。它是七个独立编号,而不是常被写成的连续区间 SLR63-80,其中既没有印地语也没有旁遮普语——这两种语言是通过 FLEURS 进入模型的。
Google 众包录音(SLR63-66、78-80)
马拉雅拉姆语、马拉地语、泰米尔语、泰卢固语、古吉拉特语、卡纳达语、缅甸语
Bible
整个混合语料中每小时价值最高的一份。此前模型对契维语几乎一无所知,而这份数据以有声书级的保真度覆盖了大多数引擎从不触碰的西非与中非语言。已对齐的六种语言中用了五种,仅埃维语除外。
BibleTTS(SLR129)
契维语(阿桑特与阿夸佩姆)、豪萨语、林加拉语、约鲁巴语
Aishell
这份是给普通话打磨音色,不是教语言。模型本来就说得流利,400 位说话人在安静室内的录音,改变的是它听起来怎么样,而不是它会什么。
AISHELL-1(SLR33)
普通话
Yoruba
这里最小的一份语料,也是给 BibleTTS 已经教过的约鲁巴语再录一遍。另一组说话人的四十小时录音棚级录音,避免了一份语料单独决定整门语言的发音。
约鲁巴语多说话人 TTS(SLR86)
约鲁巴语
Fleurs
负责广度的一层。每种语言约十小时的平行朗读语音,也正是它让这一轮训练突破八十五种语言,而不是停在 OpenSLR 语料合起来的二十五种。印地语和旁遮普语也从这里进入,而非来自录音棚语料。
Google FLEURS
102 种语言,覆盖并扩展了上述全部
在 OmniVoice 架构上自主训练,权重归我们所有。
Genpio Voices 由我们自己在 OmniVoice 架构上训练。OmniVoice 是一种基于音频码本的语音架构,构建在 Qwen3-0.6B 语言模型之上。两者均为 Apache-2.0 许可,我们直接说明这一点,而不是暗示架构由我们发明。我们训练的是模型本身:参数在该架构上从随机初始化开始训练,没有继承任何第三方的模型权重。语料由我们挑选,混合方案由我们设计,训练由我们执行,我们训练出的权重归我们所有,拥有全部商业使用权,无需与任何一方重新谈判授权;同时 Qwen 和 k2-fsa 保留他们自己成果的著作权。我们不向任何供应商租用模型。它们跑在我们自己的 GPU 上,绝不经过任何第三方 API。
权重归我们所有
公开的模型卡,可在我们自己域名之外核对:huggingface.co/GuidenAI/genpio_voice
个公开语料库, 小时汇总, 种语言, 轮训练
全部, 教会新语言, 补充说话人, 音色打磨, 拓展广度
已截取
条形长度为对数刻度。数字为可用原始时长,尚未应用按语言的上限。
语料规模不等于训练占比。Multilingual LibriSpeech 的音频量大约是混合语料里最小一份的 1,250 倍,按语言设置的上限就是为了抹平这个差距,让真正需要从头学的语言不被本来就流利的语言淹没。
我们的模型如何构建与授权
是的,而且我们会把话说具体。Genpio Voices 是在 Apache-2.0 的 OmniVoice 架构(其本身构建在 Qwen3-0.6B 之上)上,从随机初始化开始自研训练出来的。它不是任何人检查点的微调:没有继承任何第三方模型权重,公开的模型卡也带着 trained-from-scratch 标签。训练语料由我们自己挑选(OpenSLR SLR94、SLR37、SLR41-44、SLR63-66、SLR78-80、SLR86、SLR129、SLR33 以及 Google FLEURS,60 种以上的语言在一次训练中完成),配比由我们自己设计,训练也由我们自己跑。说得精确一点,因为两边都可以核实:我们拥有自己训练出来的权重,并在对上游架构的永久 Apache-2.0 授权之下,享有全部商用权利,没有使用领域限制、没有收入上限、也没有需要跟谁重新谈的许可;同时 Qwen 和 k2-fsa 保留他们自己成果的著作权。我们不向任何供应商租用模型,也不转售第三方的语音合成。一切都跑在我们自己的推理栈上,服务链路里没有任何第三方 API——这正是我们能把延迟、成本和质量攥在手里,而转售商做不到的原因。模型卡公开在 huggingface.co/GuidenAI/genpio_voice,以上没有一条需要你只听我们的说法。
租来的 AI 有天花板,自己的没有。
训练数据的构成和许可证都列在上面了。下面说说自己拥有模型权重有什么不同:和那些同样能力靠租来的工具逐项对比。
套壳工具
Genpio
Rows
Cost
按分钟付费给供应商,每多开一场直播,账单就多一截
推理是我们自己的,多开直播不会让成本成倍上涨
Latency
延迟是多少,全看供应商当天给你什么
延迟由我们自己调,精细到每一帧
Quality
效果出了问题,只能提工单,然后慢慢等
效果出了问题,我们直接在模型里改
Scale
一次只能开一场,离触发限流、直播中断只有一步之遥
第一百场并发直播,不用向谁申请——GPU 是我们自己的
模型自己训练,才能按你的需求改
你的形象,实时生成。
克隆你本人的样貌,也可以直接用品牌主播。口型逐帧生成,不是拿片段拼接,所以嘴型跟着话走,而不是追着话跑。
一小段样音,还原你的声音。
克隆出的声音保留你的语速和温度。600 多种本地化音色,报价格、念名字、抖包袱都像母语者在说,不是在念译文。
对你的商品库了如指掌。
导入商品、价格、常见问题和卖点。主播回答准确、不跑题,观众追问也稳得住。
所有平台,同时开播。
TikTok、YouTube、Shopee、Instagram 等平台,在一个工作台里并行直播。
一条评论,一秒内变成一笔订单
四个环节,一个闭环,直播不停,它就一直转。
端到端,1 秒以内
这个回答本身就会引出下一条评论,循环于是重新开始。
聆听
评论、提问和互动,从每一个已连接的平台同时汇入。
理解
对照商品库、价格和品牌口吻,读出评论里的意图、情绪和购买信号。
发声
语音模型用你克隆的声音作答,观众用哪种语言打字,就用哪种语言回。
呈现
数字人模型逐帧生成口型对齐的画面,直接推流上线。
让 AI 助手帮你完成直播设置。
Genpio 支持 MCP,也就是 AI 客户端连接外部工具所用的协议。连接一次,助手就能开通账号、匹配套餐、撰写话术并填充商品库,第一场直播从一次对话开始,而不是一下午的配置。
| num | title | desc |
|---|---|---|
| 01 | 把客户端指向 Genpio | 一个地址,无需申请 API key。粘贴到 ChatGPT、Claude、Codex 或你正在用的客户端里。 |
| 02 | 在浏览器里确认授权 | 助手会给你一个链接和一个短码。你在 Genpio 自己的页面登录并确认,助手始终看不到你的密码。 |
| 03 | 直接开口提要求 | 开通账号、选定套餐、今晚的话术,或者直接从商品链接导入商品。你说话,它把设置做完。 |
Chat
任意 MCP 客户端
帮我把今晚的 Genpio 直播设置好,再加这三款商品。
请打开这个链接并确认验证码 4F2C-91KD,剩下的交给我。
- 账号已连接
- 套餐已选定,支付链接已就绪
- 开场话术已写好并保存
- 已从你的链接导入 3 款商品
| title | desc |
|---|---|
| 始终看不到你的密码 | 登录在 Genpio 自己的页面完成,就在你的浏览器里。 |
| 不保存你的登录凭据 | 连接后,助手拿到的只是一个 Genpio 内部的标识符,在 Genpio 之外没有任何用处。 |
| 不会扣你的卡 | 它只能给你一个支付链接,付款由你在安全支付页面上自行完成。 |
靠得住的基础设施
企业级安全
传输用 TLS 1.3,存储用 AES-256,声音克隆没有本人授权就不会运行。全部控制措施都列在我们的安全页面上。
查看安全页面
99.9% 在线率 SLA
这是有多区域部署和自动故障切换兜底的承诺值,不是口号。全球边缘节点分发,直播关系到营收时,延迟照样压得住。
开放 API 与集成
把 Genpio 接进你的 CRM、OMS、分析和门店系统。API 文档公开,不需要密钥就能查阅。
查看 API 文档
专属支持
优先入驻、专业培训,还有一支和你一起对结果负责的客户团队。