Một dự án Python mã nguồn mở để xây dựng tác tử giọng nói độ trễ thấp, với pipeline giọng nói mô-đun và API WebSocket tương thích OpenAI Realtime.
Kho lưu trữ này cung cấp một bộ công cụ tác tử giọng nói có tên Speech To Speech. Nó được xây dựng quanh một pipeline mô-đun gồm phát hiện hoạt động giọng nói, chuyển giọng nói thành văn bản, mô hình ngôn ngữ và chuyển văn bản thành giọng nói, đồng thời cung cấp pipeline đó qua một API WebSocket tương thích với OpenAI Realtime. README cũng cho biết hệ thống được thiết kế để thay thế linh hoạt từng thành phần và có thể chạy với mô hình cục bộ hoặc với các backend được lưu trữ nhưng tương thích OpenAI.
Dự án giải quyết nhu cầu xây dựng tác tử giọng nói độ trễ thấp mà không phải phụ thuộc vào một stack độc quyền duy nhất. Nó hướng tới những người muốn kết hợp nhận dạng giọng nói, suy luận và tổng hợp giọng nói nhưng vẫn được tự chọn mô hình và backend, bao gồm cả cấu hình hoàn toàn cục bộ và mã nguồn mở.
Ở mức khái niệm, hệ thống xử lý âm thanh qua bốn giai đoạn: trước hết phát hiện khi người dùng đang nói, sau đó chuyển lời nói thành văn bản, tiếp theo gửi văn bản tới mô hình ngôn ngữ, và cuối cùng chuyển phản hồi của mô hình trở lại thành âm thanh. README cho biết mỗi giai đoạn chạy tách biệt và giao tiếp qua hàng đợi, đồng thời việc chọn thành phần có thể cấu hình bằng các cờ CLI. README cũng nêu rằng vị trí dành cho mô hình ngôn ngữ dùng giao thức tương thích OpenAI, nên có thể trỏ tới nhà cung cấp được lưu trữ hoặc các máy chủ cục bộ như vLLM hay llama.cpp.
Dự án đang được chú ý vì gom nhiều chủ đề đang rất được quan tâm vào cùng một gói: AI cục bộ, tác tử giọng nói, mô hình mã nguồn mở và khả năng tương thích với các API kiểu OpenAI vốn được dùng rộng rãi. README cũng nhấn mạnh các điểm khởi đầu thực dụng như lệnh khởi động nhanh, vận hành cục bộ có thể dùng offline, nhiều lựa chọn backend, và việc đã được dùng trong sản xuất làm backend hội thoại cho hàng nghìn robot Reachy Mini, điều này làm tăng độ tin cậy và mức độ hiện diện của dự án.
README gợi ý nhiều lựa chọn thành phần tương đương hơn là các đối thủ một-đổi-một trực tiếp: Silero VAD cho phát hiện hoạt động giọng nói, Parakeet TDT, Whisper, Faster Whisper, Lightning Whisper MLX và Paraformer cho nhận dạng giọng nói, cùng Qwen3-TTS, Kokoro, Pocket TTS và ChatTTS cho tổng hợp giọng nói. Ở cấp độ hệ thống, hướng thay thế chính được mô tả là dùng một backend LLM khác tương thích OpenAI, chẳng hạn nhà cung cấp được lưu trữ hoặc máy chủ cục bộ như vLLM hay llama.cpp, thay vì pipeline đóng gói sẵn của repository này.
Do AI giải thích · dựa trên README của từng kho