NVIDIA Nemotron VoiceChat trên Apple Silicon: giọng nói song công với công cụ
Từ Moshi và PersonaPlex đến VoiceChat: cách giọng nói song công xử lý ngắt lời và công cụ MCP, cùng những tình huống phù hợp với pipeline lệnh nhỏ hơn trên Android.
Nhận dạng có phân tách người nói, nhân bản giọng nói zero-shot, tổng hợp giọng nói dài hạn — chạy trên Apple Silicon, Android, Windows và Linux nhúng. Không cần API đám mây, không tính phí theo phút, không có dữ liệu nào rời khỏi thiết bị.
Bộ nhớ riêng tư cho các cuộc trò chuyện
brew install speechimplementation("audio.soniqo:speech:0.0.9")Từ Moshi và PersonaPlex đến VoiceChat: cách giọng nói song công xử lý ngắt lời và công cụ MCP, cùng những tình huống phù hợp với pipeline lệnh nhỏ hơn trên Android.

Một phiên thực tế chạy NVIDIA Nemotron VoiceChat 11B cục bộ: một lượt nói, một lần ngắt lời giữa câu, và một lệnh gọi công cụ MCP hoàn chỉnh vào Apple Reminders. RTF 0,92 trên M5 Pro, không có gì rời khỏi máy.

Nói ra — Android thực hiện: vòng lệnh hoàn chỉnh từ giọng nói đến hành động thật trên thiết bị và câu trả lời bằng giọng nói, trên một chiếc điện thoại với 1.2 GB RAM. Silero VAD, Parakeet STT, tool call FunctionGemma và Pocket TTS.

Tour 4 phút qua thư viện mã nguồn mở: chuyển văn bản thời gian thực với Nemotron Streaming, thoại-sang-thoại cục bộ với PersonaPlex và nhân bản 48 kHz với VoxCPM2 — tất cả chạy trên laptop.
Mỗi nhóm bao gồm nhiều trường hợp con được ghép từ các thành phần Soniqo. Đưa âm thanh vào và nhận lại hội thoại, bản ghi hoặc giọng nói được tạo — cục bộ, theo thời gian thực.
Xây dựng giao diện ưu tiên giọng nói — từ speech-to-speech song công đến các pipeline tổng hợp kích hoạt bằng từ khoá, tất cả chạy cục bộ.
Biến âm thanh thành văn bản có cấu trúc — streaming thời gian thực cho phụ đề trực tiếp và đọc chính tả, độ chính xác cao theo lô cho lưu trữ, có phân tách để đặt tên cho từng người nói.
Tổng hợp giọng nói bằng bất kỳ chất giọng nào — nhân bản giọng trong vài giây, đọc sách nói hàng giờ, hoặc dựng podcast nhiều người nói, hoàn toàn ngoại tuyến.
Các pipeline trường hợp sử dụng ở trên được ghép từ những mô hình này. Chọn một thành phần để xem kiến trúc, CLI, Swift API và benchmark. Tất cả đều chạy trên Apple Silicon, hầu hết cũng chạy trên Android và Linux.
52 langs, RTF 0.06, 4-/8-bit
Native CoreML: 1.40% WER, 6 s model load
MLX INT5: 128K offline context, RTF 0.028
Small, medium, large-v3, and turbo exports
32× real-time on Neural Engine
120M, 25 langs, streaming partials + EOU, ~232 MB on-device
1,672 languages, 300M–7B
14 langs, INT5 default, RTF 0.015
8 langs, INT5 default, RTF 0.074
Word-level timestamps, 80 ms
Streaming with punctuation
9 langs, zero-shot cloning, bf16 / 8-bit
12 Hz codec LM, faster than real-time
48 kHz, 30 langs, voice design + cloning
Zero-shot cloning, emotion + tempo controls, RTF 1.0
99M, 31 langs, 44.1 kHz
CoreML voice cloning, TTFT 0.27s, RTF 0.59
600+ langs, NAR diffusion cloning
Hindi emotion TTS + raw reference cloning
Style markers + zero-shot cloning
Zero-shot cloning in 16 flow steps, RTF 0.57
4B conversational cloning, emotion tags, RTF 0.78
54 voices, iOS-ready, 10 langs
English, ~130 ms streaming TTFA
90-min podcasts / audiobooks
9 langs, 5 baked voices, streaming
IndexTTS2, CosyVoice, Chatterbox Flash, Qwen3-TTS ICL
SpeechBrain ECAPA, 107 languages, 21M
Masked WeSpeaker + native PLDA/VBx, ~32 MB
Community-1 + Pyannote + Sortformer
WeSpeaker / CAM++ for ID
Silero v6.2.1, Pyannote, FireRedVAD
End-of-turn detection, 23 langs, 3.5 ms per pause
KWS Zipformer, 26× real-time
44.1 kHz stereo, variable-length music
Text → 30 s music, RTF 0.36
Open-Unmix + HTDemucs v4, 4 stems
DeepFilterNet3, 48 kHz real-time
Two-stream echo cancellation, 16 ms latency
Sidon denoise + dereverb → 48 kHz
48 kHz audio super-resolution
Streaming on-device LLM
Structured tool / function-call grammar
Many-to-many translation, 400+ languages
Streaming speech translation, FR/ES/PT/DE → EN
Moshi-family full-duplex speech-to-speech
Asymmetric duplex speech-to-speech, INT5 / INT8