Genpio

自社開発のAIアバター・音声モデル

Genpioはアバターと音声のモデルを自社で学習させ、自社の推論基盤で動かしています。学習データはOpenSLRやGoogle FLEURSなどの公開コーパスです。

他社のAIを つなぎ合わせたのではありません。 モデルを自社で学習させました。

多くのAIライブ配信ツールは、借り物のAPIを薄く包んだだけのものです。Genpioのアバターモデルと音声モデルはすべて自社開発です。自社で学習させ、自社の推論基盤で動かしています。だからこそ1秒以内に応答し、短いサンプルから声をクローンし、数百本のライブ配信を同時に同じモデルで動かせます。

ライブコメントへの反応速度, ネイティブなローカライズ音声, 音声カタログが対応する言語, 1つのモデルで同時配信, 100s

85を超える言語を、1回の学習でまとめて。

自社でモデルを学習させたと言うだけなら誰にでもできます。Genpioのモデルに実際に入っているものを、各コーパスの識別子つきで公開します。出典まで遡って確認できます。85を超える言語を1回の学習にまとめており、これは実際に提供している音声カタログの85以上という数字と一致します。

すべて1回の学習でまとめて学びます。順番に学習させると後の回が前の回を上書きし、最後に見た言語しか話せなくなるからです。1つの混合データ、1回の学習、1つのモデル。上記のコーパス識別子はいずれもOpenSLR公式のもので、記憶ではなくOpenSLRの一覧と突き合わせて確認しているため、鵜呑みにする必要はありません。音声ライブラリ全体が扱う言語はさらに広範です。

ミックスに含まれる各コーパスは、識別子・ライセンス・サンプリングレート・時間数まで含めて、モデルカードに全文掲載しています。

Corpora

Mls

この学習で声の多様さを担うデータです。8言語はいずれもモデルがすでに話せるため、新しい言語は増えません。しかし数千人に及ぶ話者の多様さが、声が平均的なものに寄っていくのを防ぎ、一人ひとりの声らしさを保ちます。

Multilingual LibriSpeech(SLR94)

英語、ドイツ語、オランダ語、フランス語、イタリア語、スペイン語、ポルトガル語、ポーランド語

Google

混合データの中で最もクリーンな音声で、ウェブからの収集ではなく48 kHzのスタジオ収録です。規模は小さいものの、その1時間1時間が既知の言語を磨くのではなく、言語そのものを新たに教えます。

GoogleスタジオTTS(SLR37、41-44)

ベンガル語、ジャワ語、クメール語、ネパール語、スンダ語

Google Indic

混合データの中で実際に言語を教える最大のブロックです。インドの6言語にビルマ語を加え、同じスタジオ品質で収録されています。よくSLR63-80と連続範囲で書かれますが実際は7つの個別IDで、ヒンディー語もパンジャブ語も含みません。その2言語はFLEURS経由でモデルに入ります。

Googleクラウドソース音声(SLR63-66、78-80)

マラヤーラム語、マラーティー語、タミル語、テルグ語、グジャラート語、カンナダ語、ビルマ語

Bible

1時間あたりの価値が全体で最も高いデータです。チュイ語はそれまでモデルがほとんど知らない言語でしたが、多くのエンジンが手を出さない西・中央アフリカの言語をオーディオブック級の音質で収録しています。整備された6言語のうち、エウェ語を除く5言語を使用しています。

BibleTTS(SLR129)

チュイ語(アサンテ・アクアペム)、ハウサ語、リンガラ語、ヨルバ語

Aishell

標準中国語に対する音色の調整であり、言語の学習ではありません。モデルは既に流暢なので、400人分のクリーンな室内収録が変えるのは知識ではなく響き方です。

AISHELL-1(SLR33)

標準中国語

Yoruba

ここで最も小さいコーパスで、BibleTTSが既に教えている言語への2度目の収録です。別の話者群によるスタジオ品質のヨルバ語40時間があることで、ひとつのコーパスが言語全体の響きを決めてしまう事態を防げます。

ヨルバ語マルチスピーカーTTS(SLR86)

ヨルバ語

Fleurs

広がりを担う層です。1言語あたり約10時間の対訳朗読音声で、OpenSLRのコーパスだけなら25言語で止まるところを、85言語超へ押し上げているのがこれです。ヒンディー語とパンジャブ語もスタジオ収録側ではなくここから入ります。

Google FLEURS

102言語。上記すべてを包含し、さらに広げます

OmniVoice上で当社が学習。重みは当社のものです。

Genpio Voicesは当社がOmniVoice上で学習させたモデルです。OmniVoiceは Qwen3-0.6B 言語モデルの上に構築された、オーディオコードブック方式の音声アーキテクチャです。いずれも Apache-2.0 であり、当社がアーキテクチャを発明したかのように匂わせるのではなく、そのまま明示します。当社が学習させたのはモデルそのものです。パラメータはそのアーキテクチャ上でランダムに初期化した状態から学習しており、第三者のモデル重みを引き継いではいません。コーパスを選び、混合を設計し、学習を実行し、学習した重みは当社が保有しています。商用利用の権利はすべて当社にあり、誰かと再交渉すべきライセンスもありません。一方でQwenとk2-fsaは自らの成果物の著作権を保持します。どのプロバイダからもモデルを借りてはいません。重みは自社のGPU上で動作し、第三者のAPIに渡ることはありません。

当社の重み

公開モデルカード。当社ドメインの外で検証できます: huggingface.co/GuidenAI/genpio_voice

件の公開コーパス, 時間を集約, 言語, 回の学習

すべて, 新しい言語を教える, 話者を増やす, 音色の調整, 広がりを足す

上限適用

バーの長さは対数スケールです。数値は言語ごとの上限を適用する前の、利用可能な生の時間数です。

コーパスの大きさは学習比率ではありません。Multilingual LibriSpeechは混合データ中で最小のコーパスの約1,250倍の音声量を持ちますが、言語ごとの上限がその差を意図的に平坦化します。実際に教えるべき言語が、すでに流暢な言語に埋もれないようにするためです。

当社モデルの構築とライセンスについて

自社保有とは具体的にどういう意味か、ご説明します。Genpio Voicesは、Apache-2.0ライセンスのOmniVoiceアーキテクチャ(Qwen3-0.6Bを基盤とするもの)を用いて、ランダム初期化から自社で学習させたモデルです。他社のチェックポイントをファインチューニングしたものではなく、第三者のモデル重みは一切継承していません。公開しているモデルカードにはtrained-from-scratchのタグが付いています。学習コーパス(OpenSLR SLR94、SLR37、SLR41-44、SLR63-66、SLR78-80、SLR86、SLR129、SLR33、およびGoogle FLEURS。60以上の言語を1回の学習で)の選定、ミックスの構成、学習の実行は、いずれもGenpioが行いました。次の点は、どちらも検証できることなので正確に記します。学習した重みはGenpioが保有し、上流アーキテクチャに対する恒久的なApache-2.0ライセンスのもとで、商用利用に必要な権利をすべて持っています。利用分野の制限も、売上の上限も、誰かと再交渉が必要なライセンスもありません。一方、Qwenとk2-fsaは、それぞれ自らの成果物の著作権を保持しています。当社はどのプロバイダからもモデルを借りておらず、第三者の音声合成を再販してもいません。すべてが自社の推論基盤で動作し、配信経路に第三者のAPIは一切ありません。リセラーには実現できない水準でレイテンシ・コスト・品質を保てるのは、このためです。モデルカードはhuggingface.co/GuidenAI/genpio_voiceで公開しているので、以上のどれも当社の言葉を信じていただく必要はありません。

APIを借りるAIには上限があります。自社で持つモデルにはありません。

学習データの内訳とライセンスは以上のとおりです。ここからは、重みを自ら所有することが何を変えるのかを、同じ機能を他社から借りているツールと一行ずつ比べます。

ラッパー系ツール

Genpio

Rows

Cost

ベンダーに分単位で支払い、配信のたびに請求額が膨らんでいきます

推論を自社で保有しているため、配信を増やしてもコストは比例して増えません

Latency

レイテンシはその日ベンダーが提供する値に左右されます

レイテンシはフレーム単位まで自社でチューニングします

Quality

品質の不具合が起きても、サポートに問い合わせて長く待つしかありません

品質の不具合は、当社がモデル側で修正します

Scale

一度に1セッションのみ。レート制限に達すれば配信は止まります

100本目の同時配信も誰の許可も要りません。GPUは自社のものです

自社開発だから、細かく調整できる

本人の顔を、リアルタイムに生成。

本人の姿をクローンするか、ブランド専用のAI配信者から始められます。リップシンクはクリップのつなぎ合わせではなくフレームごとに生成するため、口の動きが言葉を後から追いかけるのではなく、言葉にぴったり合います。

短いサンプルから、本人の声を再現。

話すテンポや声の温かみまで再現するクローン音声。600を超えるローカライズ音声が、価格も商品名も決め台詞も、翻訳調ではなくネイティブの話し方で読み上げます。

商品カタログを正確に把握。

商品・価格・FAQ・セールスポイントを取り込めば、AI配信者が正確に答え、視聴者に食い下がられても伝えるべき内容からぶれません。

すべてのプラットフォームで、同時に。

TikTok、YouTube、Shopee、Instagramなどへ、1つのワークスペースから並行してライブ配信。

コメントが1秒以内に売上につながるまで

4つの段階、1つのループ。配信が続くかぎり回り続けます。

コメントから映像まで1秒未満

その回答が次のコメントを呼び、ループがまた最初から回り始めます。

聞く

接続されたすべてのプラットフォームから、コメント・質問・リアクションが同時に届きます。

理解する

意図・感情・購買シグナルを、自社の商品カタログ・価格・ブランドの話し方に照らして読み取ります。

話す

Genpio独自の音声モデルが、クローンした声で、視聴者が実際に入力している言語で応答します。

見せる

Genpio独自のアバターモデルが、フレームごとにリップシンクした映像を生成し、そのままライブ配信に送り出します。

配信の準備は、AIアシスタントに頼むだけ。

Genpioは、AIクライアントが外部ツールに接続するためのプロトコルMCPに対応しています。一度つなげば、アカウントの開設、プランの選定、台本の作成、商品ライブラリの登録までアシスタントが実行。初配信は午後いっぱいの設定作業ではなく、ひとつの会話から始まります。

numtitledesc
01クライアントをGenpioに向けるエンドポイントはひとつだけ。APIキーの発行も不要です。ChatGPT、Claude、Codexなど普段のクライアントに貼り付けます。
02ブラウザで承認するアシスタントがリンクと短いコードを提示します。Genpioのページでログインして承認するだけ。パスワードがアシスタントに渡ることはありません。
03必要なことを伝えるアカウント、最適なプラン、今夜の台本、商品ページのリンクからの取り込み。話している間に設定が進みます。

Chat

任意のMCPクライアント

今夜の配信用にGenpioを設定して、この3商品を追加して。

このリンクを開いてコード4F2C-91KDを承認してください。あとはこちらで進めます。

  • アカウント接続完了
  • プラン選定、決済リンク準備完了
  • オープニング台本を作成して保存
  • リンクから3商品を取り込み
titledesc
パスワードは見えませんログインは、ご自身のブラウザでGenpioのページから行います。
認証情報は保持しません接続時に返されるのは識別用のハンドルだけで、Genpioの外では使えません。
カードに請求はしませんできるのは決済リンクを渡すところまで。支払いは安全な決済ページでご自身で行います。

止まらない配信のためのインフラ

エンタープライズ級のセキュリティ

通信はTLS 1.3、保存データはAES-256で暗号化。音声クローンは本人の同意なしには実行されません。管理策の一覧はセキュリティページに掲載しています。

セキュリティページを読む

稼働率99.9%のSLA

自動フェイルオーバーを備えたマルチリージョン構成に対する、努力目標ではない確約値です。グローバルなエッジ配信がレイテンシを低く抑え、売上がかかった配信を止めません。

オープンAPIと各種連携

GenpioをCRM・OMS・分析ツール・ECサイトに接続。APIリファレンスは公開されており、キーがなくても読めます。

APIリファレンスを読む

専任サポート

優先的なオンボーディングとトレーニング、そして成果に責任を持つアカウントチームがサポートします。