自社開発のAIアバター・音声モデル
Genpioはアバターと音声のモデルを自社で学習させ、自社の推論基盤で動かしています。学習データはOpenSLRやGoogle FLEURSなどの公開コーパスです。
他社のAIを つなぎ合わせたのではありません。 モデルを自社で学習させました。
多くのAIライブ配信ツールは、借り物のAPIを薄く包んだだけのものです。Genpioのアバターモデルと音声モデルはすべて自社開発です。自社で学習させ、自社の推論基盤で動かしています。だからこそ1秒以内に応答し、短いサンプルから声をクローンし、数百本のライブ配信を同時に同じモデルで動かせます。
ライブコメントへの反応速度, ネイティブなローカライズ音声, 音声カタログが対応する言語, 1つのモデルで同時配信, 100s
85を超える言語を、1回の学習でまとめて。
自社でモデルを学習させたと言うだけなら誰にでもできます。Genpioのモデルに実際に入っているものを、各コーパスの識別子つきで公開します。出典まで遡って確認できます。85を超える言語を1回の学習にまとめており、これは実際に提供している音声カタログの85以上という数字と一致します。
すべて1回の学習でまとめて学びます。順番に学習させると後の回が前の回を上書きし、最後に見た言語しか話せなくなるからです。1つの混合データ、1回の学習、1つのモデル。上記のコーパス識別子はいずれもOpenSLR公式のもので、記憶ではなくOpenSLRの一覧と突き合わせて確認しているため、鵜呑みにする必要はありません。音声ライブラリ全体が扱う言語はさらに広範です。
ミックスに含まれる各コーパスは、識別子・ライセンス・サンプリングレート・時間数まで含めて、モデルカードに全文掲載しています。
Corpora
Mls
この学習で声の多様さを担うデータです。8言語はいずれもモデルがすでに話せるため、新しい言語は増えません。しかし数千人に及ぶ話者の多様さが、声が平均的なものに寄っていくのを防ぎ、一人ひとりの声らしさを保ちます。
Multilingual LibriSpeech(SLR94)
英語、ドイツ語、オランダ語、フランス語、イタリア語、スペイン語、ポルトガル語、ポーランド語
混合データの中で最もクリーンな音声で、ウェブからの収集ではなく48 kHzのスタジオ収録です。規模は小さいものの、その1時間1時間が既知の言語を磨くのではなく、言語そのものを新たに教えます。
GoogleスタジオTTS(SLR37、41-44)
ベンガル語、ジャワ語、クメール語、ネパール語、スンダ語
Google Indic
混合データの中で実際に言語を教える最大のブロックです。インドの6言語にビルマ語を加え、同じスタジオ品質で収録されています。よくSLR63-80と連続範囲で書かれますが実際は7つの個別IDで、ヒンディー語もパンジャブ語も含みません。その2言語はFLEURS経由でモデルに入ります。
Googleクラウドソース音声(SLR63-66、78-80)
マラヤーラム語、マラーティー語、タミル語、テルグ語、グジャラート語、カンナダ語、ビルマ語
Bible
1時間あたりの価値が全体で最も高いデータです。チュイ語はそれまでモデルがほとんど知らない言語でしたが、多くのエンジンが手を出さない西・中央アフリカの言語をオーディオブック級の音質で収録しています。整備された6言語のうち、エウェ語を除く5言語を使用しています。
BibleTTS(SLR129)
チュイ語(アサンテ・アクアペム)、ハウサ語、リンガラ語、ヨルバ語
Aishell
標準中国語に対する音色の調整であり、言語の学習ではありません。モデルは既に流暢なので、400人分のクリーンな室内収録が変えるのは知識ではなく響き方です。
AISHELL-1(SLR33)
標準中国語
Yoruba
ここで最も小さいコーパスで、BibleTTSが既に教えている言語への2度目の収録です。別の話者群によるスタジオ品質のヨルバ語40時間があることで、ひとつのコーパスが言語全体の響きを決めてしまう事態を防げます。
ヨルバ語マルチスピーカーTTS(SLR86)
ヨルバ語
Fleurs
広がりを担う層です。1言語あたり約10時間の対訳朗読音声で、OpenSLRのコーパスだけなら25言語で止まるところを、85言語超へ押し上げているのがこれです。ヒンディー語とパンジャブ語もスタジオ収録側ではなくここから入ります。
Google FLEURS
102言語。上記すべてを包含し、さらに広げます
OmniVoice上で当社が学習。重みは当社のものです。
Genpio Voicesは当社がOmniVoice上で学習させたモデルです。OmniVoiceは Qwen3-0.6B 言語モデルの上に構築された、オーディオコードブック方式の音声アーキテクチャです。いずれも Apache-2.0 であり、当社がアーキテクチャを発明したかのように匂わせるのではなく、そのまま明示します。当社が学習させたのはモデルそのものです。パラメータはそのアーキテクチャ上でランダムに初期化した状態から学習しており、第三者のモデル重みを引き継いではいません。コーパスを選び、混合を設計し、学習を実行し、学習した重みは当社が保有しています。商用利用の権利はすべて当社にあり、誰かと再交渉すべきライセンスもありません。一方でQwenとk2-fsaは自らの成果物の著作権を保持します。どのプロバイダからもモデルを借りてはいません。重みは自社のGPU上で動作し、第三者のAPIに渡ることはありません。
当社の重み
公開モデルカード。当社ドメインの外で検証できます: huggingface.co/GuidenAI/genpio_voice
件の公開コーパス, 時間を集約, 言語, 回の学習
すべて, 新しい言語を教える, 話者を増やす, 音色の調整, 広がりを足す
上限適用
バーの長さは対数スケールです。数値は言語ごとの上限を適用する前の、利用可能な生の時間数です。
コーパスの大きさは学習比率ではありません。Multilingual LibriSpeechは混合データ中で最小のコーパスの約1,250倍の音声量を持ちますが、言語ごとの上限がその差を意図的に平坦化します。実際に教えるべき言語が、すでに流暢な言語に埋もれないようにするためです。
当社モデルの構築とライセンスについて
自社保有とは具体的にどういう意味か、ご説明します。Genpio Voicesは、Apache-2.0ライセンスのOmniVoiceアーキテクチャ(Qwen3-0.6Bを基盤とするもの)を用いて、ランダム初期化から自社で学習させたモデルです。他社のチェックポイントをファインチューニングしたものではなく、第三者のモデル重みは一切継承していません。公開しているモデルカードにはtrained-from-scratchのタグが付いています。学習コーパス(OpenSLR SLR94、SLR37、SLR41-44、SLR63-66、SLR78-80、SLR86、SLR129、SLR33、およびGoogle FLEURS。60以上の言語を1回の学習で)の選定、ミックスの構成、学習の実行は、いずれもGenpioが行いました。次の点は、どちらも検証できることなので正確に記します。学習した重みはGenpioが保有し、上流アーキテクチャに対する恒久的なApache-2.0ライセンスのもとで、商用利用に必要な権利をすべて持っています。利用分野の制限も、売上の上限も、誰かと再交渉が必要なライセンスもありません。一方、Qwenとk2-fsaは、それぞれ自らの成果物の著作権を保持しています。当社はどのプロバイダからもモデルを借りておらず、第三者の音声合成を再販してもいません。すべてが自社の推論基盤で動作し、配信経路に第三者のAPIは一切ありません。リセラーには実現できない水準でレイテンシ・コスト・品質を保てるのは、このためです。モデルカードはhuggingface.co/GuidenAI/genpio_voiceで公開しているので、以上のどれも当社の言葉を信じていただく必要はありません。
APIを借りるAIには上限があります。自社で持つモデルにはありません。
学習データの内訳とライセンスは以上のとおりです。ここからは、重みを自ら所有することが何を変えるのかを、同じ機能を他社から借りているツールと一行ずつ比べます。
ラッパー系ツール
Genpio
Rows
Cost
ベンダーに分単位で支払い、配信のたびに請求額が膨らんでいきます
推論を自社で保有しているため、配信を増やしてもコストは比例して増えません
Latency
レイテンシはその日ベンダーが提供する値に左右されます
レイテンシはフレーム単位まで自社でチューニングします
Quality
品質の不具合が起きても、サポートに問い合わせて長く待つしかありません
品質の不具合は、当社がモデル側で修正します
Scale
一度に1セッションのみ。レート制限に達すれば配信は止まります
100本目の同時配信も誰の許可も要りません。GPUは自社のものです
自社開発だから、細かく調整できる
本人の顔を、リアルタイムに生成。
本人の姿をクローンするか、ブランド専用のAI配信者から始められます。リップシンクはクリップのつなぎ合わせではなくフレームごとに生成するため、口の動きが言葉を後から追いかけるのではなく、言葉にぴったり合います。
短いサンプルから、本人の声を再現。
話すテンポや声の温かみまで再現するクローン音声。600を超えるローカライズ音声が、価格も商品名も決め台詞も、翻訳調ではなくネイティブの話し方で読み上げます。
商品カタログを正確に把握。
商品・価格・FAQ・セールスポイントを取り込めば、AI配信者が正確に答え、視聴者に食い下がられても伝えるべき内容からぶれません。
すべてのプラットフォームで、同時に。
TikTok、YouTube、Shopee、Instagramなどへ、1つのワークスペースから並行してライブ配信。
コメントが1秒以内に売上につながるまで
4つの段階、1つのループ。配信が続くかぎり回り続けます。
コメントから映像まで1秒未満
その回答が次のコメントを呼び、ループがまた最初から回り始めます。
聞く
接続されたすべてのプラットフォームから、コメント・質問・リアクションが同時に届きます。
理解する
意図・感情・購買シグナルを、自社の商品カタログ・価格・ブランドの話し方に照らして読み取ります。
話す
Genpio独自の音声モデルが、クローンした声で、視聴者が実際に入力している言語で応答します。
見せる
Genpio独自のアバターモデルが、フレームごとにリップシンクした映像を生成し、そのままライブ配信に送り出します。
配信の準備は、AIアシスタントに頼むだけ。
Genpioは、AIクライアントが外部ツールに接続するためのプロトコルMCPに対応しています。一度つなげば、アカウントの開設、プランの選定、台本の作成、商品ライブラリの登録までアシスタントが実行。初配信は午後いっぱいの設定作業ではなく、ひとつの会話から始まります。
| num | title | desc |
|---|---|---|
| 01 | クライアントをGenpioに向ける | エンドポイントはひとつだけ。APIキーの発行も不要です。ChatGPT、Claude、Codexなど普段のクライアントに貼り付けます。 |
| 02 | ブラウザで承認する | アシスタントがリンクと短いコードを提示します。Genpioのページでログインして承認するだけ。パスワードがアシスタントに渡ることはありません。 |
| 03 | 必要なことを伝える | アカウント、最適なプラン、今夜の台本、商品ページのリンクからの取り込み。話している間に設定が進みます。 |
Chat
任意のMCPクライアント
今夜の配信用にGenpioを設定して、この3商品を追加して。
このリンクを開いてコード4F2C-91KDを承認してください。あとはこちらで進めます。
- アカウント接続完了
- プラン選定、決済リンク準備完了
- オープニング台本を作成して保存
- リンクから3商品を取り込み
| title | desc |
|---|---|
| パスワードは見えません | ログインは、ご自身のブラウザでGenpioのページから行います。 |
| 認証情報は保持しません | 接続時に返されるのは識別用のハンドルだけで、Genpioの外では使えません。 |
| カードに請求はしません | できるのは決済リンクを渡すところまで。支払いは安全な決済ページでご自身で行います。 |
止まらない配信のためのインフラ
エンタープライズ級のセキュリティ
通信はTLS 1.3、保存データはAES-256で暗号化。音声クローンは本人の同意なしには実行されません。管理策の一覧はセキュリティページに掲載しています。
セキュリティページを読む
稼働率99.9%のSLA
自動フェイルオーバーを備えたマルチリージョン構成に対する、努力目標ではない確約値です。グローバルなエッジ配信がレイテンシを低く抑え、売上がかかった配信を止めません。
オープンAPIと各種連携
GenpioをCRM・OMS・分析ツール・ECサイトに接続。APIリファレンスは公開されており、キーがなくても読めます。
APIリファレンスを読む
専任サポート
優先的なオンボーディングとトレーニング、そして成果に責任を持つアカウントチームがサポートします。