Genpio

Teknologi Genpio

Genpio melatih model avatar dan suaranya sendiri dan menjalankannya di tumpukannya sendiri. Korpus: OpenSLR SLR94, SLR37, SLR41-44, dan FLEURS.

Kami tidak sekadar menyambungkan AI milik orang lain. Kami melatih modelnya.

Sebagian besar alat siaran langsung AI hanyalah pembungkus tipis di atas API yang mereka sewa. Model avatar dan suara Genpio adalah milik kami sendiri, dilatih secara internal dan dilayani di tumpukan inferensi kami sendiri. Itulah sebabnya kami bisa menjawab dalam waktu kurang dari sedetik, mengkloning suara dari sampel singkat, dan menjalankan ratusan siaran langsung sekaligus dari model yang sama.

Reaksi terhadap komentar langsung, Suara lokal native, Bahasa dalam katalog suara, Siaran bersamaan, satu model, Ratusan

Lebih dari 85 bahasa, satu kali pelatihan.

Siapa pun bisa mengaku melatih modelnya sendiri. Inilah yang sebenarnya masuk ke dalam model kami, disebutkan lengkap dengan id korpusnya, sehingga Anda bisa memeriksanya langsung di sumbernya. Lebih dari 85 bahasa, dilatih bersama dalam satu kali proses, dan 85+ di antaranya sampai kepada Anda sebagai bahasa keluaran di katalog suara langsung.

Semuanya dilatih bersama dalam satu proses, tidak pernah satu demi satu. Putaran berurutan saling menimpa sampai model hanya menguasai apa pun yang terakhir dilihatnya. Satu campuran, satu proses, satu model. Setiap id korpus di atas adalah id milik OpenSLR sendiri dan sudah dicocokkan dengan indeks OpenSLR, bukan dikutip dari ingatan, jadi tidak ada satu pun dari ini yang harus diterima begitu saja. Katalog suara lengkap melayani lebih banyak bahasa lagi.

Setiap korpus dalam campuran ini tercantum lengkap di kartu model, beserta id, lisensi, sample rate, dan jumlah jamnya.

Corpora

Mls

Mesin penutur dalam proses ini. Ia tidak menambah bahasa baru, karena model sudah menguasai kedelapan bahasa itu, tetapi ribuan pembaca yang berbeda itulah yang mengajari sebuah suara untuk tetap menjadi dirinya, bukan hanyut menuju rata-rata.

Multilingual LibriSpeech (SLR94)

Inggris, Jerman, Belanda, Prancis, Italia, Spanyol, Portugis, Polandia

Google

Audio terbersih dalam campuran ini, direkam pada 48 kHz dalam kondisi studio, bukan hasil pengerukan dari web. Kecil, dan setiap jamnya mengajarkan satu bahasa sepenuhnya, bukan sekadar memoles bahasa yang sudah dikuasai.

Google studio TTS (SLR37, 41-44)

Bengali, Jawa, Khmer, Nepal, Sunda

Google Indic

Blok pengajaran bahasa sejati terbesar dalam campuran ini: enam bahasa India ditambah bahasa Burma, direkam dengan standar studio yang sama. Tujuh id, bukan rentang utuh SLR63-80 sebagaimana sering ditulis orang, dan ia sama sekali tidak memuat bahasa Hindi maupun Punjabi; keduanya sampai ke model lewat FLEURS.

Google crowdsourced speech (SLR63-66, 78-80)

Malayalam, Marathi, Tamil, Telugu, Gujarat, Kannada, Burma

Bible

Nilai per jam tertinggi di seluruh campuran ini. Bahasa Twi nyaris tidak dikenal model sebelumnya, dan korpus ini membawa kualitas setara buku audio untuk bahasa-bahasa Afrika Barat dan Tengah yang jarang disentuh mesin lain. Lima dari enam bahasa terselaraskannya dipakai, semua kecuali Ewe.

BibleTTS (SLR129)

Twi (Asante dan Akuapem), Hausa, Lingala, Yoruba

Aishell

Satu putaran suara untuk bahasa Mandarin, bukan pelajaran bahasa. Model sudah fasih, jadi 400 penutur rekaman dalam ruangan yang bersih mengubah cara ia terdengar, bukan apa yang ia ketahui.

AISHELL-1 (SLR33)

Mandarin

Yoruba

Korpus terkecil di sini, dan putaran kedua untuk bahasa yang sudah diajarkan BibleTTS. Empat puluh jam Yoruba bersih kelas studio dari kelompok penutur yang berbeda itulah yang mencegah satu korpus menentukan bunyi sebuah bahasa secara keseluruhan.

Yoruba multi-speaker TTS (SLR86)

Yoruba

Fleurs

Lapisan keluasan. Kira-kira sepuluh jam masing-masing berupa ujaran bacaan paralel, dan inilah alasan proses ini menjangkau lebih dari delapan puluh lima bahasa alih-alih dua puluh lima yang dicakup korpus OpenSLR secara keseluruhan. Bahasa Hindi dan Punjabi tiba dari sini, bukan dari blok studio.

Google FLEURS

102 bahasa, mencakup sekaligus memperluas semua di atas

Dilatih oleh kami di atas OmniVoice. Bobotnya milik kami.

Genpio Voices dilatih sendiri secara internal di atas OmniVoice, sebuah arsitektur ucapan berbasis codebook audio yang dibangun pada model bahasa Qwen3-0.6B. Keduanya berlisensi Apache-2.0, dan kami menyatakannya terang-terangan alih-alih menyiratkan bahwa kami yang menciptakan arsitektur itu. Yang kami latih adalah modelnya sendiri: parameternya dimulai dari inisialisasi acak di atas arsitektur tersebut, jadi tidak ada bobot model pihak ketiga yang diwarisi. Kami memilih korpusnya, menyusun campurannya, menjalankan pelatihannya, dan memiliki bobot yang kami latih, dengan hak penuh untuk memakainya secara komersial dan tanpa lisensi yang perlu dinegosiasikan ulang dengan siapa pun, sementara Qwen dan k2-fsa tetap memegang hak cipta atas karya mereka sendiri. Kami tidak menyewa model dari penyedia mana pun. Model itu berjalan di GPU milik kami sendiri dan tidak pernah diserahkan ke API pihak ketiga.

Bobot kami

Kartu model yang dipublikasikan, bisa diperiksa di luar domain kami sendiri: huggingface.co/GuidenAI/genpio_voice

korpus publik, jam dikumpulkan, bahasa, proses pelatihan

Semuanya, Mengajarkan bahasa baru, Menambah penutur, Putaran kualitas suara, Menambah keluasan

dibatasi

Panjang batang bersifat logaritmik. Angkanya adalah jam mentah yang tersedia, sebelum pembatasan per bahasa.

Ukuran korpus bukan porsi pelatihan. Multilingual LibriSpeech membawa sekitar 1.250 kali lebih banyak audio dibanding korpus terkecil dalam campuran ini, dan pembatasan per bahasa sengaja meratakannya, sehingga bahasa yang benar-benar sedang diajarkan tidak pernah tenggelam oleh bahasa yang sudah fasih.

Bagaimana model kami dibangun dan dilisensikan

Ya, dan kami spesifik soal apa artinya itu. Genpio Voices dilatih secara internal dari inisialisasi acak di atas arsitektur OmniVoice berlisensi Apache-2.0, yang sendirinya dibangun pada Qwen3-0.6B. Ia bukan hasil fine-tune checkpoint siapa pun: tidak ada bobot model pihak ketiga yang diwarisi, dan kartu model yang dipublikasikan ditandai trained-from-scratch. Kami memilih korpus pelatihannya (OpenSLR SLR94, SLR37, SLR41-44, SLR63-66, SLR78-80, SLR86, SLR129, SLR33 dan Google FLEURS, lebih dari 60 bahasa dalam satu proses), menyusun campurannya, dan menjalankan pelatihannya. Dinyatakan dengan tepat, karena kedua belahannya bisa diperiksa: kami memiliki bobot yang kami latih dan memegang seluruh hak untuk memakainya secara komersial, di bawah pemberian Apache-2.0 yang permanen atas arsitektur hulunya, tanpa batasan bidang penggunaan, tanpa plafon pendapatan, dan tanpa lisensi yang perlu dinegosiasikan ulang dengan siapa pun, sementara Qwen dan k2-fsa tetap memegang hak cipta atas karya mereka sendiri. Kami tidak menyewa model dari penyedia mana pun dan tidak menjual ulang text-to-speech pihak ketiga. Semuanya berjalan di tumpukan inferensi kami sendiri tanpa API pihak ketiga di jalur penyajian, dan itulah sebabnya kami bisa menahan latensi, biaya, dan kualitas di titik yang tidak bisa dicapai seorang penjual ulang. Kartu modelnya publik di huggingface.co/GuidenAI/genpio_voice, jadi tidak ada satu pun dari ini yang harus diterima hanya atas kata-kata kami.

AI sewaan punya langit-langit. Milik kami tidak.

Anda sudah melihat campuran dan lisensinya. Inilah yang berubah ketika bobotnya milik sendiri, baris demi baris, dibandingkan alat yang menyewa kemampuan yang sama dari orang lain.

Alat pembungkus

Genpio

Rows

Cost

Bayar vendor per menit, dan saksikan tagihan membengkak seiring setiap siaran

Inferensinya milik kami, jadi menambah siaran tidak melipatgandakan biaya

Latency

Latensi adalah apa pun yang diberikan vendor hari itu

Kami menyetel latensi sendiri, sampai ke tingkat frame

Quality

Bug kualitas berarti tiket dukungan dan penantian panjang

Bug kualitas adalah sesuatu yang kami perbaiki di dalam modelnya

Scale

Satu sesi dalam satu waktu, sejengkal dari batas kuota lalu padam

Tambahkan siaran bersamaan yang keseratus tanpa meminta izin siapa pun: GPU-nya milik kami

Dibangun oleh kami, jadi ia menyesuaikan diri dengan Anda

Wajah Anda, dirender secara langsung.

Kloning rupa Anda atau mulai dari host bermerek. Sinkronisasi bibir dihasilkan frame demi frame, bukan dijahit dari klip, sehingga mulut mengikuti kata-kata alih-alih mengejarnya.

Suara Anda, dari satu sampel singkat.

Suara kloning yang mempertahankan irama dan kehangatan Anda. Di antara 600+ suara lokal, ia membacakan harga, nama, dan kalimat penutup seperti penutur asli, bukan seperti terjemahan yang dibaca keras.

Hafal katalog Anda di luar kepala.

Impor produk, harga, FAQ, dan poin penjualan. Host menjawab dengan akurat dan tetap pada pesannya, bahkan ketika penonton mendesak.

Setiap platform, pada saat yang sama.

TikTok, YouTube, Shopee, Instagram, dan lainnya, tayang paralel dari satu ruang kerja.

Sebuah komentar menjadi penjualan dalam kurang dari sedetik

Empat tahap, satu putaran, berjalan selama siaran tetap mengudara.

di bawah 1 detik, ujung ke ujung

Jawaban itulah yang memancing komentar berikutnya, jadi putarannya dimulai lagi.

Dengar

Komentar, pertanyaan, dan reaksi berdatangan dari setiap platform yang terhubung sekaligus.

Pahami

Maksud, sentimen, dan sinyal beli dibaca terhadap katalog, harga, dan suara merek Anda.

Bicara

Model suara kami menjawab dengan suara kloning Anda, dalam bahasa yang benar-benar diketik penonton.

Tampilkan

Model avatar kami merender jawaban itu dengan sinkronisasi bibir frame demi frame dan mendorongnya ke siaran langsung.

Siapkan siaran Anda cukup dengan bertanya ke asisten AI.

Genpio berbicara MCP, protokol yang dipakai klien AI untuk menjangkau alat di luar dirinya. Hubungkan sekali dan asisten Anda bisa membuka akun Anda, menentukan ukuran paket Anda, menulis naskah Anda, dan mengisi pustaka produk Anda, sehingga siaran pertama Anda dimulai sebagai sebuah percakapan alih-alih satu sore penuh persiapan.

  • Arahkan klien Anda ke Genpio — Satu endpoint, tanpa kunci API yang perlu dibuat. Tempelkan ke ChatGPT, Claude, Codex, atau klien mana pun yang sudah Anda pakai.
  • Setujui di peramban Anda — Asisten memberi Anda sebuah tautan dan kode pendek. Anda masuk di halaman kami sendiri dan menyetujuinya di sana. Ia tidak pernah melihat kata sandi Anda.
  • Minta apa yang Anda butuhkan — Sebuah akun, paket yang tepat, naskah untuk malam ini, produk yang dibaca langsung dari tautan toko. Ia mengurus persiapannya sementara Anda mengobrol.

Chat

Klien MCP mana pun

Siapkan Genpio untuk malam ini dan tambahkan tiga produk ini.

Buka tautan ini dan setujui kode 4F2C-91KD, lalu sisanya saya yang urus.

  • Akun terhubung

  • Ukuran paket ditentukan, tautan pembayaran siap

  • Naskah pembuka ditulis dan disimpan

  • 3 produk diimpor dari tautan Anda

  • Ia tidak pernah melihat kata sandi Anda — Proses masuk terjadi di halaman kami, di peramban Anda sendiri.

  • Ia tidak pernah memegang kredensial Anda — Menghubungkan akun hanya mengembalikan sebuah token yang tidak berarti apa-apa di luar Genpio.

  • Ia tidak pernah menagih kartu Anda — Ia bisa memberi Anda tautan pembayaran. Anda sendiri yang menuntaskan pembayaran itu, di halaman checkout yang aman.

Infrastruktur yang bisa Anda andalkan

Keamanan kelas enterprise

TLS 1.3 saat transit, AES-256 saat tersimpan, dan kloning suara yang tidak akan berjalan tanpa persetujuan si pemilik suara. Setiap kontrol tercantum lengkap di halaman keamanan kami.

Baca halaman keamanan

SLA waktu aktif 99.9%

Angka yang kami komitmenkan di atas infrastruktur multi-region dengan failover otomatis, bukan sekadar cita-cita. Pengiriman edge global menjaga latensi tetap rendah ketika pendapatan bergantung pada siaran itu.

API terbuka dan integrasi

Sambungkan Genpio ke CRM, OMS, analitik, dan etalase Anda. Referensi API bersifat publik dan tidak perlu kunci untuk dibaca.

Baca referensi API

Dukungan khusus

Onboarding prioritas, pelatihan, dan tim akun yang ikut memikul hasilnya bersama Anda.