Genpio

Công nghệ Genpio

Genpio tự huấn luyện mô hình giọng nói và avatar cho MC ảo, chạy trên GPU của chính mình. Bộ dữ liệu công khai: OpenSLR SLR94, SLR37, SLR41-44 và Google FLEURS.

Chúng tôi không đi ghép AI của người khác. Chúng tôi tự huấn luyện mô hình.

Phần lớn phần mềm livestream AI chỉ là lớp vỏ bọc quanh một API đi thuê. Mô hình avatar và mô hình giọng nói của Genpio là của chính chúng tôi, tự huấn luyện và chạy trên hạ tầng inference riêng. Nhờ vậy MC ảo trả lời trong chưa tới một giây, clone giọng từ một đoạn mẫu ngắn, và chạy hàng trăm buổi live cùng lúc trên cùng một mô hình.

Tốc độ phản hồi comment, Giọng đọc bản địa, Ngôn ngữ trong thư viện giọng, Buổi live cùng lúc, một mô hình, Hàng trăm

Hơn 85 ngôn ngữ, một lần huấn luyện.

Ai cũng nói được là mình tự huấn luyện mô hình. Còn đây là những gì thật sự có trong mô hình của Genpio, ghi rõ mã từng bộ dữ liệu để bạn tự kiểm tra tận nguồn. Hơn 85 ngôn ngữ được huấn luyện chung trong một lần chạy, và hơn 85 trong số đó có mặt trong thư viện giọng dưới dạng ngôn ngữ đầu ra.

Tất cả được huấn luyện cùng lúc trong một lần chạy, không bao giờ lần lượt từng bộ. Huấn luyện nối tiếp thì lượt sau sẽ ghi đè lượt trước, tới mức mô hình chỉ còn nói được ngôn ngữ nó học gần nhất. Một hỗn hợp dữ liệu, một lần huấn luyện, một mô hình. Mọi mã bộ dữ liệu ở trên đều là mã chính thức của OpenSLR, đã đối chiếu với danh mục của OpenSLR chứ không chép theo trí nhớ, nên không có gì phải tin suông. Thư viện giọng nói đầy đủ còn hỗ trợ nhiều ngôn ngữ hơn nữa.

Mỗi bộ dữ liệu trong hỗn hợp đều được liệt kê đầy đủ trên model card, kèm mã định danh, giấy phép, tần số lấy mẫu và số giờ.

Corpora

Mls

Nguồn người nói chính của cả lần huấn luyện. Bộ này không thêm ngôn ngữ mới vì mô hình vốn đã nói được cả tám thứ tiếng, nhưng nhờ hàng nghìn người đọc khác nhau mà một giọng giữ được nét riêng thay vì bị kéo về một kiểu giọng trung bình.

Multilingual LibriSpeech (SLR94)

Anh, Đức, Hà Lan, Pháp, Ý, Tây Ban Nha, Bồ Đào Nha, Ba Lan

Google

Âm thanh sạch nhất trong hỗn hợp, thu ở 48 kHz trong điều kiện phòng thu chứ không cào từ web. Dung lượng nhỏ, nhưng mỗi giờ đều dạy hẳn một ngôn ngữ mới chứ không chỉ trau chuốt thứ đã biết.

TTS phòng thu của Google (SLR37, 41-44)

Bengal, Java, Khmer, Nepal, Sunda

Google Indic

Khối dạy ngôn ngữ lớn nhất trong hỗn hợp: sáu ngôn ngữ Ấn Độ cộng tiếng Miến Điện, thu theo cùng chuẩn phòng thu. Đây là bảy mã riêng lẻ chứ không phải dải liền SLR63-80 như vẫn hay được viết, và trong đó không có tiếng Hindi lẫn Punjab — cả hai đến với mô hình qua FLEURS.

Dữ liệu cộng đồng của Google (SLR63-66, 78-80)

Malayalam, Marathi, Tamil, Telugu, Gujarati, Kannada, Miến Điện

Bible

Giá trị trên mỗi giờ cao nhất trong toàn bộ hỗn hợp. Tiếng Twi gần như xa lạ với mô hình trước đó, và đây là dữ liệu đạt chuẩn sách nói cho những ngôn ngữ Tây và Trung Phi mà hầu hết engine không đụng tới. Dùng năm trong sáu ngôn ngữ đã căn chỉnh của bộ này, trừ tiếng Ewe.

BibleTTS (SLR129)

Twi (Asante và Akuapem), Hausa, Lingala, Yoruba

Aishell

Một lượt tinh chỉnh chất giọng tiếng Quan Thoại, không phải dạy ngôn ngữ mới. Mô hình vốn đã nói thạo, nên 400 người nói thu âm sạch chỉ thay đổi giọng nghe ra sao, không thay đổi những gì nó biết.

AISHELL-1 (SLR33)

Tiếng Quan Thoại

Yoruba

Bộ dữ liệu nhỏ nhất ở đây, và là lượt thứ hai cho một ngôn ngữ mà BibleTTS đã dạy. Bốn mươi giờ tiếng Yoruba thu sạch trong phòng thu, từ một nhóm người nói khác, giúp cả một ngôn ngữ không bị một bộ dữ liệu duy nhất quyết định giọng nghe ra sao.

TTS đa giọng tiếng Yoruba (SLR86)

Yoruba

Fleurs

Lớp phủ bề rộng. Khoảng mười giờ dữ liệu đọc song song cho mỗi ngôn ngữ, và là lý do lần huấn luyện này vượt mốc tám mươi lăm ngôn ngữ thay vì dừng ở hai mươi lăm ngôn ngữ mà các bộ OpenSLR cộng lại mới có. Tiếng Hindi và Punjab đến từ đây chứ không phải từ các khối phòng thu.

Google FLEURS

102 ngôn ngữ, bao trùm và mở rộng tất cả những bộ trên

Tự huấn luyện trên OmniVoice. Trọng số thuộc về Genpio.

Genpio Voices do chính chúng tôi huấn luyện trên OmniVoice, một kiến trúc giọng nói dựa trên audio codebook, xây trên mô hình ngôn ngữ Qwen3-0.6B. Cả hai đều theo giấy phép Apache-2.0, và chúng tôi nói thẳng điều đó để không ai hiểu nhầm rằng Genpio tự nghĩ ra kiến trúc. Thứ chúng tôi huấn luyện là chính mô hình: tham số khởi tạo ngẫu nhiên trên kiến trúc đó, nên không kế thừa trọng số của bất kỳ bên thứ ba nào. Chúng tôi chọn bộ dữ liệu, dựng hỗn hợp, chạy huấn luyện, và sở hữu bộ trọng số đã huấn luyện, có đầy đủ quyền khai thác thương mại và không phải thương lượng giấy phép với ai, trong khi Qwen và k2-fsa vẫn giữ bản quyền với phần việc của họ. Chúng tôi không thuê mô hình của nhà cung cấp nào. Mô hình chạy trên GPU của chính chúng tôi và không bao giờ đi qua API bên thứ ba.

Trọng số của chúng tôi

Model card công khai, kiểm chứng được ngoài tên miền của chúng tôi: huggingface.co/GuidenAI/genpio_voice

bộ dữ liệu công khai, giờ gộp lại, ngôn ngữ, lần huấn luyện

Tất cả, Dạy ngôn ngữ mới, Bổ sung giọng nói, Tinh chỉnh chất giọng, Mở rộng bề ngang

đã cắt bớt

Độ dài thanh theo thang logarit. Con số là số giờ thô có sẵn, trước khi áp trần theo từng ngôn ngữ.

Kích thước bộ dữ liệu không phải là tỷ trọng khi huấn luyện. Multilingual LibriSpeech có lượng audio gấp khoảng 1.250 lần bộ dữ liệu nhỏ nhất trong hỗn hợp, và mức trần theo từng ngôn ngữ cố tình san phẳng khoảng cách đó, để những ngôn ngữ đang thật sự cần học không bao giờ bị các ngôn ngữ mô hình đã nói thạo lấn át.

Mô hình của Genpio được làm ra và cấp phép thế nào

Có, và chúng tôi nói rõ điều đó nghĩa là gì. Genpio Voices được huấn luyện nội bộ từ khởi tạo ngẫu nhiên trên kiến trúc OmniVoice (Apache-2.0), vốn được xây trên Qwen3-0.6B. Đây không phải bản fine-tune từ checkpoint của bất kỳ ai: không kế thừa trọng số mô hình của bên thứ ba nào, và model card đã công bố mang nhãn trained-from-scratch. Chúng tôi chọn bộ dữ liệu huấn luyện (OpenSLR SLR94, SLR37, SLR41-44, SLR63-66, SLR78-80, SLR86, SLR129, SLR33 và Google FLEURS, hơn 60 ngôn ngữ trong một lượt huấn luyện), dựng hỗn hợp và chạy huấn luyện. Nói cho chính xác, vì cả hai vế đều kiểm chứng được: chúng tôi sở hữu bộ trọng số mình đã huấn luyện và có mọi quyền dùng nó vào mục đích thương mại, dưới một giấy phép Apache-2.0 vĩnh viễn trên kiến trúc gốc, không giới hạn lĩnh vực sử dụng, không trần doanh thu và không có giấy phép nào phải đàm phán lại với ai; còn Qwen và k2-fsa vẫn giữ bản quyền với phần việc của họ. Chúng tôi không thuê mô hình của nhà cung cấp nào và không bán lại text-to-speech của bên thứ ba. Mọi thứ chạy trên hạ tầng inference của chính chúng tôi, không có API bên thứ ba nào trong đường phục vụ, và đó là lý do chúng tôi giữ được độ trễ, chi phí và chất lượng ở mức một bên bán lại không làm được. Model card công khai tại huggingface.co/GuidenAI/genpio_voice, nên không điều nào ở trên phải tin vào lời chúng tôi.

AI đi thuê luôn có trần. AI tự làm thì không.

Bạn đã xem dữ liệu và giấy phép. Còn đây là những gì thay đổi khi sở hữu trọng số, so từng dòng với một công cụ đi thuê lại đúng năng lực đó.

Công cụ đi thuê API

Genpio

Rows

Cost

Trả nhà cung cấp theo phút, thêm buổi live là hóa đơn phình thêm

Tự vận hành phần inference, nên thêm buổi live không làm chi phí nhân lên

Latency

Độ trễ ra sao tùy nhà cung cấp hôm đó

Tự tinh chỉnh độ trễ, tới từng khung hình

Quality

Một lỗi chất lượng đồng nghĩa với một ticket hỗ trợ và một quãng chờ dài

Một lỗi chất lượng là thứ chúng tôi sửa thẳng trong mô hình

Scale

Mỗi lần một phiên, chạm giới hạn API là tắt sóng

Thêm buổi live thứ một trăm mà không phải xin phép ai: GPU là của chúng tôi

Tự tay làm ra, nên chiều được theo bạn

Gương mặt của bạn, dựng trực tiếp trên sóng.

Clone chính bạn hoặc bắt đầu từ một MC ảo mang thương hiệu. Khẩu hình được tạo theo từng khung hình chứ không ghép từ clip có sẵn, nên miệng khớp lời nói chứ không chạy đuổi theo sau.

Giọng của bạn, từ một đoạn mẫu ngắn.

Giọng clone giữ nguyên nhịp nói và độ ấm trong giọng bạn. Với hơn 600 giọng bản địa, MC ảo đọc giá tiền, tên sản phẩm và câu chốt như người bản xứ, không nghe như đang đọc to một bản dịch.

Thuộc lòng file hàng của bạn.

Nhập sản phẩm, giá, FAQ và điểm bán hàng. MC ảo trả lời đúng và bám thông điệp, kể cả khi khách hỏi vặn.

Mọi nền tảng, cùng một lúc.

TikTok, YouTube, Shopee, Instagram và nhiều nền tảng khác, phát song song từ một nơi.

Từ comment tới chốt đơn trong chưa tới một giây

Bốn bước, một vòng lặp, chạy liên tục chừng nào buổi live còn sáng đèn.

dưới 1 giây, trọn vòng

Câu trả lời lại kéo theo comment tiếp theo, và vòng lặp bắt đầu lại.

Nghe

Comment, câu hỏi và thả tim đổ về cùng lúc từ mọi kênh đã kết nối.

Hiểu

Ý định, cảm xúc và tín hiệu muốn mua của khách được đối chiếu với file hàng, bảng giá và giọng văn thương hiệu của shop.

Nói

Mô hình giọng nói trả lời bằng giọng bạn đã clone, đúng ngôn ngữ người xem đang gõ.

Lên hình

Mô hình avatar dựng câu trả lời với khẩu hình khớp từng khung hình rồi đẩy thẳng lên sóng.

Nhờ trợ lý AI dựng buổi live giúp bạn.

Genpio hỗ trợ MCP, giao thức mà các ứng dụng AI dùng để kết nối với công cụ bên ngoài. Kết nối một lần là trợ lý có thể mở tài khoản, chọn gói, viết kịch bản và nạp sản phẩm vào thư viện, để buổi live đầu tiên bắt đầu bằng một cuộc trò chuyện chứ không phải cả buổi chiều ngồi cài đặt.

  • Trỏ ứng dụng AI tới Genpio — Một endpoint duy nhất, không cần tạo API key. Dán vào ChatGPT, Claude, Codex hay ứng dụng bạn đang dùng.
  • Bấm duyệt ngay trên trình duyệt — Trợ lý đưa bạn một đường link và một mã ngắn. Bạn đăng nhập trên trang của Genpio rồi bấm duyệt. Trợ lý không bao giờ thấy mật khẩu.
  • Cần gì thì nhờ trợ lý — Tài khoản, gói phù hợp, kịch bản cho tối nay, sản phẩm lấy thẳng từ link cửa hàng. Trợ lý lo phần cài đặt trong lúc bạn trò chuyện.

Chat

Ứng dụng MCP bất kỳ

Thiết lập Genpio cho tối nay và thêm ba sản phẩm này.

Bạn mở link này và duyệt mã 4F2C-91KD, phần còn lại để tôi lo.

  • Đã kết nối tài khoản
  • Đã chọn gói, link thanh toán sẵn sàng
  • Đã viết và lưu kịch bản mở màn
  • Đã nhập 3 sản phẩm từ link của bạn
titledesc
Không bao giờ thấy mật khẩu của bạnBạn đăng nhập trên trang của Genpio, ngay trong trình duyệt của mình.
Không giữ thông tin đăng nhậpKết nối chỉ trả về một mã định danh, ra khỏi Genpio là vô nghĩa.
Không tự trừ tiền thẻTrợ lý chỉ đưa bạn link thanh toán. Bạn tự hoàn tất trên trang thanh toán bảo mật.

Hạ tầng đủ vững để yên tâm lên sóng

Bảo mật chuẩn doanh nghiệp

TLS 1.3 khi truyền, AES-256 khi lưu, và không clone giọng khi chính chủ giọng chưa đồng ý. Danh sách đầy đủ các biện pháp kiểm soát nằm ở trang bảo mật.

Đọc trang bảo mật

SLA uptime 99.9%

Một con số cam kết, trên hạ tầng nhiều vùng có tự động chuyển dự phòng, không phải một lời hứa suông. Mạng phân phối toàn cầu giữ độ trễ thấp đúng lúc doanh thu đang trông vào buổi live.

API mở và tích hợp

Đấu nối Genpio vào CRM, OMS, công cụ phân tích và gian hàng của bạn. Tài liệu API công khai, đọc không cần key.

Đọc tài liệu API

Hỗ trợ chuyên trách

Ưu tiên onboarding, có đào tạo, và một đội phụ trách tài khoản cùng bạn chịu trách nhiệm về kết quả.