Genpio

เทคโนโลยี Genpio

Genpio เทรนโมเดลอวตารและโมเดลเสียงเอง แล้วรันบนระบบของตัวเอง คลังข้อมูลที่ใช้เปิดเผยชัด: OpenSLR SLR94, SLR37, SLR41-44 และ Google FLEURS

เราไม่ได้แค่ต่อสาย เข้ากับ AI ของคนอื่น เราเทรนโมเดลเอง

เครื่องมือไลฟ์ AI ส่วนใหญ่เป็นแค่เปลือกบาง ๆ ครอบ API ที่เช่ามาอีกที ส่วนโมเดลอวตารและโมเดลเสียงของ Genpio เป็นของเราเอง เทรนเองในทีม และรันบนระบบ inference ของเราเอง นั่นคือเหตุผลที่เราตอบได้ในเวลาไม่ถึงวินาที โคลนเสียงจากตัวอย่างสั้น ๆ และรันไลฟ์หลายร้อยสตรีมพร้อมกันได้จากโมเดลเดียวกัน

ตอบสนองคอมเมนต์สด, เสียงสำเนียงท้องถิ่น, ภาษาในคลังเสียง, สตรีมพร้อมกัน จากโมเดลเดียว, หลักร้อย

มากกว่า 85 ภาษา ในการเทรนรอบเดียว

ใครก็พูดได้ว่าเทรนโมเดลเอง นี่คือสิ่งที่ใส่เข้าไปในโมเดลของเราจริง ๆ พร้อมรหัสคลังข้อมูล ให้ตรวจย้อนไปถึงต้นทางได้ ภาษามากกว่า 85 ภาษาเทรนไปด้วยกันในรอบเดียว และในจำนวนนั้น 85+ ภาษาคือภาษาที่คุณเลือกใช้ได้จริงในคลังเสียงไลฟ์

ทุกอย่างเทรนไปพร้อมกันในรอบเดียว ไม่ใช่ไล่ทีละภาษา เพราะการเทรนต่อกันจะทำให้รอบหลังทับรอบก่อน จนโมเดลพูดได้เฉพาะภาษาที่เห็นล่าสุด ข้อมูลผสมชุดเดียว เทรนรอบเดียว ได้โมเดลเดียว รหัสคลังข้อมูลทุกตัวข้างต้นเป็นรหัสทางการของ OpenSLR และตรวจทานกับดัชนีของ OpenSLR แทนที่จะอ้างจากความจำ จึงไม่ต้องเชื่อแบบไร้ที่มา คลังเสียงเต็มยังครอบคลุมภาษามากกว่านี้อีก

ทุกคลังข้อมูลในส่วนผสมนี้มีรายละเอียดครบอยู่ในโมเดลการ์ด ทั้งรหัส สัญญาอนุญาต อัตราสุ่มตัวอย่าง และจำนวนชั่วโมง

Corpora

Mls

แหล่งเสียงของการเทรนรอบนี้ ไม่ได้เพิ่มภาษาใหม่เลยเพราะโมเดลพูดได้ทั้งแปดภาษาอยู่แล้ว แต่ความหลากหลายของผู้อ่านนับพันคนคือสิ่งที่สอนให้เสียงคงเอกลักษณ์ไว้แทนที่จะเลื่อนไปหาค่าเฉลี่ย

Multilingual LibriSpeech (SLR94)

อังกฤษ เยอรมัน ดัตช์ ฝรั่งเศส อิตาลี สเปน โปรตุเกส โปแลนด์

Google

เสียงที่สะอาดที่สุดในชุดผสม บันทึกที่ 48 kHz ในสตูดิโอไม่ใช่ดึงมาจากเว็บ ขนาดเล็กแต่ทุกชั่วโมงสอนภาษาขึ้นใหม่ทั้งภาษา ไม่ใช่แค่ขัดเกลาภาษาที่รู้อยู่แล้ว

TTS สตูดิโอของ Google (SLR37, 41-44)

เบงกาลี ชวา เขมร เนปาล ซุนดา

Google Indic

บล็อกที่สอนภาษาใหม่ได้มากที่สุดในชุดผสม หกภาษาอินเดียบวกภาษาพม่า บันทึกด้วยมาตรฐานสตูดิโอเดียวกัน เป็นเจ็ดรหัสแยกกัน ไม่ใช่ช่วงต่อเนื่อง SLR63-80 อย่างที่มักเขียนกัน และไม่มีทั้งภาษาฮินดีและปัญจาบ ทั้งสองภาษาเข้าสู่โมเดลผ่าน FLEURS แทน

เสียงจากอาสาสมัครของ Google (SLR63-66, 78-80)

มลยาฬัม มราฐี ทมิฬ เตลูกู คุชราต กันนาดา พม่า

Bible

คุ้มค่าต่อชั่วโมงมากที่สุดในชุดผสมทั้งหมด ก่อนหน้านี้โมเดลแทบไม่รู้จักภาษาทวีเลย และชุดนี้ให้ความคมชัดระดับหนังสือเสียงกับภาษาแอฟริกาตะวันตกและแอฟริกากลางที่เอนจินส่วนใหญ่ไม่เคยแตะ ใช้ห้าจากหกภาษาที่จัดเรียงไว้ ยกเว้นภาษาเอเว

BibleTTS (SLR129)

ทวี (อาซันเตและอากัวเปม) เฮาซา ลิงกาลา โยรูบา

Aishell

เป็นการปรับน้ำเสียงภาษาจีนกลาง ไม่ใช่การสอนภาษา โมเดลพูดคล่องอยู่แล้ว เสียงบันทึกในร่มที่สะอาดจากผู้พูด 400 คนจึงเปลี่ยนแค่ว่าโมเดลฟังดูเป็นอย่างไร ไม่ได้เปลี่ยนว่าโมเดลรู้อะไร

AISHELL-1 (SLR33)

จีนกลาง

Yoruba

คลังข้อมูลที่เล็กที่สุดในที่นี้ และเป็นรอบที่สองของภาษาที่ BibleTTS สอนไปแล้ว เสียงโยรูบาสี่สิบชั่วโมงที่บันทึกในสตูดิโอจากผู้พูดอีกกลุ่มหนึ่งคือสิ่งที่กันไม่ให้คลังข้อมูลเดียวเป็นผู้กำหนดว่าทั้งภาษาต้องฟังดูอย่างไร

TTS หลายผู้พูดภาษาโยรูบา (SLR86)

โยรูบา

Fleurs

ชั้นที่ให้ความกว้าง เสียงอ่านคู่ขนานราวสิบชั่วโมงต่อภาษา และเป็นเหตุผลที่การเทรนรอบนี้ทะลุแปดสิบห้าภาษา แทนที่จะหยุดอยู่ที่ยี่สิบห้าภาษาซึ่งคลังข้อมูล OpenSLR รวมกันครอบคลุมได้ ภาษาฮินดีและปัญจาบก็มาจากตรงนี้ ไม่ใช่จากบล็อกสตูดิโอ

Google FLEURS

102 ภาษา ครอบคลุมและขยายจากทั้งหมดข้างต้น

เราเทรนเองบน OmniVoice น้ำหนักโมเดลเป็นของเรา

Genpio Voices คือโมเดลที่เราเทรนเองบน OmniVoice ซึ่งเป็นสถาปัตยกรรมเสียงแบบ audio codebook ที่สร้างอยู่บนโมเดลภาษา Qwen3-0.6B ทั้งสองอย่างเป็น Apache-2.0 และเราบอกตรง ๆ แทนที่จะทำให้เข้าใจว่าเราคิดค้นสถาปัตยกรรมนี้เอง สิ่งที่เราเทรนคือตัวโมเดลเอง พารามิเตอร์เริ่มจากการสุ่มค่าตั้งต้นบนสถาปัตยกรรมนั้น จึงไม่ได้รับช่วงน้ำหนักโมเดลจากบุคคลที่สามใด ๆ เราเลือกคลังข้อมูลเอง ออกแบบชุดผสมเอง รันการเทรนเอง และเป็นเจ้าของน้ำหนักโมเดลที่เราเทรนเอง มีสิทธิ์ใช้เชิงพาณิชย์ครบถ้วนและไม่มีไลเซนส์ใดต้องไปเจรจากับใคร ขณะที่ Qwen และ k2-fsa ยังคงถือลิขสิทธิ์ในงานของตนเอง และเราไม่ได้เช่าโมเดลจากผู้ให้บริการรายใด น้ำหนักโมเดลรันบน GPU ของเราเองและไม่เคยส่งผ่าน API ของบุคคลที่สาม

น้ำหนักของเรา

โมเดลการ์ดสาธารณะ ตรวจสอบได้นอกโดเมนของเราเอง: huggingface.co/GuidenAI/genpio_voice

คลังข้อมูลสาธารณะ, ชั่วโมงรวมกัน, ภาษา, รอบการเทรน

ทั้งหมด, สอนภาษาใหม่, เพิ่มผู้พูด, ปรับคุณภาพเสียง, เพิ่มความกว้าง

ถูกจำกัด

ความยาวแท่งเป็นสเกลลอการิทึม ตัวเลขคือชั่วโมงดิบที่มีอยู่ ก่อนใช้เพดานรายภาษา

ขนาดคลังข้อมูลไม่ใช่สัดส่วนในการเทรน Multilingual LibriSpeech มีเสียงมากกว่าคลังข้อมูลที่เล็กที่สุดในชุดผสมราว 1,250 เท่า และเพดานรายภาษาจงใจกดความต่างนั้นให้ราบลง เพื่อไม่ให้ภาษาที่กำลังถูกสอนจริง ๆ ถูกกลบด้วยภาษาที่คล่องอยู่แล้ว

โมเดลของเราสร้างขึ้นและให้สิทธิ์อย่างไร

ใช่ และเราจะบอกให้ชัดว่าหมายถึงอะไร Genpio Voices เทรนเองภายในบริษัทจากการสุ่มค่าเริ่มต้น บนสถาปัตยกรรม OmniVoice ที่เป็น Apache-2.0 ซึ่งสร้างอยู่บน Qwen3-0.6B อีกที ไม่ใช่การ fine-tune จาก checkpoint ของใคร ไม่มีการรับช่วงน้ำหนักโมเดลจากบุคคลที่สาม และโมเดลการ์ดที่เผยแพร่ติดแท็ก trained-from-scratch เราเป็นคนเลือกคลังข้อมูลสำหรับเทรนเอง (OpenSLR SLR94, SLR37, SLR41-44, SLR63-66, SLR78-80, SLR86, SLR129, SLR33 และ Google FLEURS มากกว่า 60 ภาษาในการเทรนรอบเดียว) จัดส่วนผสมเอง และรันการเทรนเอง พูดให้ตรงเพราะตรวจสอบได้ทั้งสองด้าน เราเป็นเจ้าของน้ำหนักโมเดลที่เราเทรน และมีสิทธิ์ใช้เชิงพาณิชย์ได้ทุกประการ ภายใต้สิทธิ Apache-2.0 แบบถาวรเหนือสถาปัตยกรรมต้นทาง โดยไม่มีข้อจำกัดด้านการใช้งาน ไม่มีเพดานรายได้ และไม่มีสัญญาอนุญาตที่ต้องไปเจรจาใหม่กับใคร ขณะที่ Qwen และ k2-fsa ยังคงถือลิขสิทธิ์ในงานของตนเอง เราไม่ได้เช่าโมเดลจากผู้ให้บริการรายใด และไม่ได้ขายต่อระบบสังเคราะห์เสียงของบุคคลที่สาม ทุกอย่างรันบนระบบ inference ของเราเอง ไม่มี API ของบุคคลที่สามอยู่ในเส้นทางให้บริการ นั่นคือเหตุผลที่เราคุม latency ต้นทุน และคุณภาพได้ในแบบที่ผู้ขายต่อทำไม่ได้ โมเดลการ์ดเปิดสาธารณะที่ huggingface.co/GuidenAI/genpio_voice ทั้งหมดนี้จึงไม่ต้องเชื่อเราเพียงคำพูด

AI ที่เช่ามามีเพดาน ของเราไม่มี

คุณได้เห็นส่วนผสมของข้อมูลและสัญญาอนุญาตไปแล้ว ต่อจากนี้คือความต่างที่เกิดจากการเป็นเจ้าของน้ำหนักโมเดลเอง ทีละบรรทัด เทียบกับเครื่องมือที่เช่าความสามารถเดียวกันมาจากคนอื่น

เครื่องมือที่ครอบ API คนอื่น

Genpio

Rows

Cost

จ่ายเจ้าของ API เป็นรายนาที ยิ่งไลฟ์มาก บิลยิ่งบาน

เราเป็นเจ้าของ inference เอง เพิ่มสตรีมแล้วต้นทุนไม่พุ่งตาม

Latency

latency ได้เท่าที่เจ้าของ API ให้มาในวันนั้น

เราจูน latency เอง ละเอียดถึงระดับเฟรม

Quality

เจอปัญหาคุณภาพ ทำได้แค่เปิด support ticket แล้วรอ

เจอปัญหาคุณภาพ เราแก้ที่ตัวโมเดลได้เลย

Scale

ไลฟ์ได้ทีละสตรีม และดับได้ทุกเมื่อเมื่อชน rate limit

เพิ่มสตรีมที่ร้อยพร้อมกันได้โดยไม่ต้องขออนุญาตใคร เพราะ GPU เป็นของเราเอง

เราสร้างเอง จึงปรับให้เข้ากับร้านคุณได้

หน้าของคุณ เรนเดอร์สดแบบเรียลไทม์

โคลนหน้าตาของคุณ หรือเริ่มจากพิธีกรที่ออกแบบตามแบรนด์ก็ได้ ลิปซิงก์ถูกสร้างขึ้นทีละเฟรม ไม่ใช่การตัดคลิปมาต่อกัน ปากจึงขยับตามคำพูด ไม่ใช่วิ่งไล่ตามคำพูด

เสียงของคุณ จากตัวอย่างสั้น ๆ

เสียงโคลนยังคงจังหวะการพูดและความอบอุ่นแบบคุณไว้ครบ มีเสียงสำเนียงท้องถิ่นกว่า 600 เสียง อ่านราคา ชื่อสินค้า และมุกตลกได้เหมือนเจ้าของภาษา ไม่ใช่เสียงอ่านคำแปล

รู้จักสินค้าของคุณทุกซอกทุกมุม

นำเข้าสินค้า ราคา คำถามที่พบบ่อย และจุดขาย พิธีกรจะตอบได้ตรงและไม่หลุดแบรนด์ แม้คนดูจะถามจี้

ทุกแพลตฟอร์ม พร้อมกัน

TikTok, YouTube, Shopee, Instagram และอื่น ๆ ไลฟ์พร้อมกันได้จากเวิร์กสเปซเดียว

จากคอมเมนต์ถึงยอดขาย ในเวลาไม่ถึงวินาที

สี่ขั้นตอน วนเป็นลูปเดียว ทำงานต่อเนื่องตราบใดที่ไลฟ์ยังไม่ปิด

ไม่ถึง 1 วินาที ตั้งแต่ต้นจนจบ

คำตอบนั้นเองที่ทำให้เกิดคอมเมนต์ถัดไป ลูปจึงเริ่มรอบใหม่

ฟัง

คอมเมนต์ คำถาม และรีแอคชันจากทุกแพลตฟอร์มที่เชื่อมต่อไว้ ไหลเข้ามาพร้อมกัน

เข้าใจ

โมเดลอ่านเจตนา อารมณ์ และสัญญาณการซื้อ เทียบกับแคตตาล็อก ราคา และโทนเสียงของแบรนด์คุณ

พูด

โมเดลเสียงของเราตอบด้วยเสียงที่โคลนจากคุณ ในภาษาที่ผู้ชมพิมพ์เข้ามาจริง ๆ

แสดง

โมเดลอวตารของเราเรนเดอร์คำตอบพร้อมลิปซิงก์ทีละเฟรม แล้วส่งขึ้นไลฟ์ทันที

ให้ผู้ช่วย AI ตั้งค่าไลฟ์ให้คุณ

Genpio รองรับ MCP โปรโตคอลที่ไคลเอ็นต์ AI ใช้เชื่อมต่อกับเครื่องมือภายนอก เชื่อมต่อครั้งเดียว ผู้ช่วยก็เปิดบัญชี เลือกแพ็กเกจที่พอดี เขียนสคริปต์ และเพิ่มสินค้าเข้าคลังให้ได้ ไลฟ์ครั้งแรกของคุณจึงเริ่มจากบทสนทนา ไม่ใช่การตั้งค่าทั้งบ่าย

  • ชี้ไคลเอ็นต์มาที่ Genpio — มี endpoint เดียว ไม่ต้องสร้าง API key วางลงใน ChatGPT, Claude, Codex หรือไคลเอ็นต์ที่คุณใช้อยู่
  • อนุมัติในเบราว์เซอร์ของคุณ — ผู้ช่วยจะส่งลิงก์และรหัสสั้น ๆ ให้ คุณล็อกอินบนหน้าเว็บของ Genpio แล้วกดอนุมัติ ผู้ช่วยไม่เห็นรหัสผ่านของคุณเลย
  • บอกสิ่งที่ต้องการ — เปิดบัญชี เลือกแพ็กเกจ สคริปต์สำหรับคืนนี้ หรือสินค้าที่ดึงจากลิงก์ร้านค้าโดยตรง คุณคุยไป ระบบตั้งค่าไป

Chat

ไคลเอ็นต์ MCP ใดก็ได้

ตั้งค่า Genpio สำหรับคืนนี้ และเพิ่มสินค้า 3 รายการนี้ให้หน่อย

เปิดลิงก์นี้แล้วกดอนุมัติรหัส 4F2C-91KD ที่เหลือเดี๋ยวจัดการให้

  • เชื่อมต่อบัญชีแล้ว
  • เลือกแพ็กเกจแล้ว ลิงก์ชำระเงินพร้อม
  • เขียนและบันทึกสคริปต์เปิดรายการแล้ว
  • นำเข้าสินค้า 3 รายการจากลิงก์ของคุณแล้ว
titledesc
ไม่เห็นรหัสผ่านของคุณการล็อกอินเกิดขึ้นบนหน้าเว็บของ Genpio ในเบราว์เซอร์ของคุณเอง
ไม่เก็บข้อมูลเข้าสู่ระบบสิ่งที่ผู้ช่วยได้กลับไปมีแค่รหัสอ้างอิงที่ใช้ได้เฉพาะใน Genpio
ไม่ตัดเงินจากบัตรของคุณผู้ช่วยส่งลิงก์ชำระเงินให้ได้เท่านั้น คุณเป็นคนชำระเงินเองบนหน้าชำระเงินที่ปลอดภัย

โครงสร้างพื้นฐานที่วางใจได้

ความปลอดภัยระดับองค์กร

เข้ารหัสระหว่างส่งด้วย TLS 1.3 และเข้ารหัสข้อมูลที่จัดเก็บด้วย AES-256 ส่วนการโคลนเสียงจะไม่ทำงานหากเจ้าของเสียงไม่ยินยอม รายการมาตรการทั้งหมดอยู่ในหน้าความปลอดภัยของเรา

อ่านหน้าความปลอดภัย

SLA อัปไทม์ 99.9%

เป็นตัวเลขที่ผูกพันตามสัญญาบนโครงสร้างพื้นฐานหลายภูมิภาคที่สลับระบบอัตโนมัติ ไม่ใช่แค่ความตั้งใจ ระบบส่งข้อมูลแบบ edge ทั่วโลกช่วยให้ latency ต่ำในวันที่รายได้ขึ้นอยู่กับไลฟ์

API เปิดและการเชื่อมต่อระบบ

เชื่อม Genpio เข้ากับ CRM, OMS, ระบบวิเคราะห์ และหน้าร้านของคุณ เอกสาร API เปิดให้อ่านได้โดยไม่ต้องมีคีย์

อ่านเอกสาร API

ทีมซัพพอร์ตเฉพาะคุณ

เริ่มต้นใช้งานแบบมีทีมดูแล อบรมการใช้งาน และทีมดูแลบัญชีที่รับผิดชอบผลลัพธ์ไปด้วยกันกับคุณ