Chúng ta

Kỹ sư FPT nghiên cứu cách AI tái tạo giọng nói chỉ với 0,5s xử lý

Thứ sáu, 9/10/2026 | 11:26 GMT+7

Tạo 10 giây giọng nói chỉ với 0,5 giây xử lý trên GPU, DiFlow-TTS là hướng tiếp cận của nhóm nghiên cứu FPT Frontier Innovators và Đại học Alabama, Mỹ, nhằm cân bằng chất lượng âm thanh, tốc độ và tài nguyên tính toán.

Công trình nghiên cứu “DiFlow-TTS: Compact and Low-Latency Zero-Shot Text-to-Speech with Discrete Flow Matching” được Nguyễn Ngọc Sơn, kỹ sư thuộc FPT Frontier Innovators - chương trình nghiên cứu tài năng của Viện Quantum AI & Cyber Security (QACI), trình bày tại hội nghị Interspeech 2026 ở Sydney, Australia. Nghiên cứu hướng đến bài toán chuyển văn bản thành giọng nói theo mẫu giọng ghi âm ngắn, giúp người dùng tạo nội dung bằng giọng mong muốn mà không phải thu âm toàn bộ.

Theo Sơn, thách thức của công nghệ này nằm ở việc tạo giọng nói tự nhiên với yêu cầu tài nguyên phù hợp. Trong khi một số hệ thống hiện tại thường sử dụng các kĩ thuật cân bằng giữa độ chính xác khi mô hình hóa, tính linh hoạt và tốc độ suy luận, đồng thời đòi hỏi hơn một tỷ tham số, lượng lớn dữ liệu huấn luyện và nhiều bước tính toán để tạo ra âm thanh. Cũng từ đó, nhóm quyết định tìm hiểu phương pháp mới, xây dựng mô hình gọn nhẹ, xử lý nhanh, dùng ít dữ liệu mà vẫn giữ được chất lượng lời nói được tạo ra.

-7050-1791515319.png

Anh Nguyễn Ngọc Sơn, kỹ sư FPT sinh năm 2002, thành viên nhóm tác giả nghiên cứu DiFlow-TTS.

Nhóm tác giả DiFlow-TTS tìm lời giải bằng “Discrete Flow Matching”, kỹ thuật tạo sinh trực tiếp trên các biểu diễn rời rạc của lời nói, cũng là hướng tiếp cận chưa được khai thác trong tổng hợp giọng nói, có ý nghĩa quan trọng đối với cộng đồng nghiên cứu lĩnh vực này sau này. Bằng cách áp dụng kỹ thuật này, âm thanh được mã hóa thành những đơn vị thông tin để mô hình xử lý, thay vì trực tiếp tạo một dòng tín hiệu liên tục. Từ đó, hệ thống sẽ học được các thành phần như nội dung, ngữ điệu và đặc tính âm thanh một cách rõ ràng hơn.

“Thiết kế lấy cảm hứng từ cách con người nói một cách trôi chảy: trước tiên ta xác định điều muốn nói trong đầu, sau đó mới thể hiện nó qua ngữ điệu và giọng điệu bằng nhiều cách”, Sơn giải thích. Đây là điểm khác biệt trong cách nhóm xây dựng mô hình, hướng đến cải thiện nhấn nhá, lên xuống giọng,ngắt nghỉ và độ tự nhiên của giọng nói.

Để hiện thực hóa ý tưởng, nhóm tác giả thiết kế kiến trúc, cài đặt, huấn luyện, chạy thực nghiệm. Điều kiện và cũng là thử thách lớn nhất, yêu cầu mô hình được huấn luyện với khoảng 470 giờ dữ liệu, trong khi một số hệ thống đối chứng sử dụng tới 100.000 giờ. Hướng tiếp cận còn ít công trình tham khảo cũng khiến nhiều bước phải được tìm tòi qua thử nghiệm.

“Mình dành nhiều thời gian đọc tài liệu, thử nghiệm không ít lần, nhưng luôn nhận được sự hướng dẫn tận tình từ các thầy cô hướng dẫn”, Sơn chia sẻ. Những góp ý chuyên môn từ người hướng dẫn và đồng nghiệp giúp Sơn điều chỉnh hướng đi trong quá trình triển khai. Xem bài nghiên cứu được công bố TẠI ĐÂY.

-3369-1791515319.jpg

Đại diện nhóm nghiên cứu, anh Nguyễn Ngọc Sơn trình bài công trình DiFlow-TTS tại sự kiện Interspeech 2026.

Theo kết quả nhóm cung cấp, DiFlow-TTS có khoảng 120-160 triệu tham số và chỉ cần vài bước tính toán để tạo giọng nói. Trên máy chủ GPU, hệ thống mất khoảng nửa giây để sinh 10 giây âm thanh. Trong đánh giá nghe thử, mô hình được chấm cao nhất về độ tự nhiên và độ rõ lời trong số các phương pháp được so sánh. Kết quả cho thấy khả năng kết hợp chất lượng đầu ra với mô hình nhỏ và tốc độ xử lý nhanh, mở ra hướng giảm yêu cầu tài nguyên khi triển khai.

Hiện DiFlow-TTS vẫn ở giai đoạn nghiên cứu, đã được kiểm chứng trên các bộ dữ liệu tiếng Anh và thử nghiệm với giọng mẫu có tiếng ồn. Nhóm công khai mã nguồn, mô hình để cộng đồng tiếp tục phát triển. Các ứng dụng tiềm năng gồm trợ lý giọng nói, đọc sách, thuyết minh video và bài giảng trực tuyến.

Sau khi được công bố tại Interspeech 2026, Sơn và nhóm nghiên cứu muốn tiếp tục cải thiện độ giống giọng gốc và hướng đến những ứng dụng gần gũi hơn với người Việt. Những trao đổi với cộng đồng nghiên cứu quốc tế cũng mang lại cho Sơn thêm ý tưởng để hoàn thiện công trình, đưa kết quả thử nghiệm đến gần hơn với nhu cầu sử dụng thực tế.

Sơn Tra

Ý kiến

()