3步掌握开源语音转换工具:从零到实战

发布时间:2026/7/27 22:56:37

3步掌握开源语音转换工具:从零到实战
3步掌握开源语音转换工具从零到实战【免费下载链接】speech-to-speechBuild local voice agents with open-source models项目地址: https://gitcode.com/gh_mirrors/sp/speech-to-speechSpeech To Speech 是一个开源语音转语音项目能够构建本地语音助手系统。这个低延迟、完全模块化的语音代理流水线采用 VAD → STT → LLM → TTS 架构通过兼容 OpenAI Realtime 的 WebSocket API 暴露服务。每个组件都可替换LLM 槽位支持 OpenAI 兼容协议可连接托管提供商、HF Inference Providers或在你自己的硬件上运行 vLLM 或 llama.cpp 服务器实现完全本地化、完全开放的技术栈。核心功能概览 Speech To Speech 的核心价值在于其模块化设计和低延迟特性。项目采用四阶段流水线架构每个阶段都有多个可互换的后端实现语音活动检测 (VAD)使用 Silero VAD v5 检测语音边界和对话轮次语音转文本 (STT)转录用户语音支持实时部分转录语言模型 (LLM)生成响应流式传输文本和工具调用文本转语音 (TTS)合成音频并流式传输回客户端支持的后端组件组件后端平台安装方式VADSilero VAD v5全部内置STTParakeet TDT默认CUDA/CPU通过 nano-parakeetApple Silicon通过 MLX内置STTWhisper通过 TransformersCUDA/CPU内置STTFaster WhisperCUDA/CPUfaster-whisperSTTLightning Whisper MLXApple Siliconwhisper-mlxSTTParaformerCUDA/CPUparaformerLLMOpenAI 兼容 API托管提供商或自托管服务器内置LLMTransformersCUDA/CPU内置LLMmlx-lmApple SiliconmacOS 内置TTSQwen3-TTS默认GGML/CUDALinuxmlx-audiomacOS内置TTSKokoro-82MCUDA/CPUApple Silicon非 macOSkokoromacOS内置TTSPocket TTSCPU/CUDApocketTTSChatTTSCUDA/CPUchatttsTTSMMS TTSCUDA/CPUfacebook-mms快速上手指南 环境要求与安装项目需要 Python 3.10 环境。安装非常简单pip install speech-to-speech默认安装包含标准实时路径Parakeet TDT 用于 STTOpenAI 兼容 API 用于语言模型Qwen3-TTS 用于语音输出非 macOS 平台默认使用 GGML 后端Apple Silicon 使用 mlx-audio基础使用示例设置 OpenAI API 密钥并启动服务export OPENAI_API_KEYyour_api_key_here speech-to-speech这将启动一个 OpenAI Realtime 兼容服务器监听ws://localhost:8765/v1/realtime。从源码目录你可以在另一个终端中测试python scripts/listen_and_play_realtime.py --host 127.0.0.1 --port 8765运行模式选择Speech To Speech 支持多种运行模式适应不同场景模式传输方式适用场景realtime默认WebSocketOpenAI Realtime 协议构建基于标准语音 API 的应用或设备local本地麦克风和扬声器直接与流水线对话无需客户端websocketWebSocket 原始 PCM构建自定义客户端无需 Realtime 协议socketTCP 原始 PCM模型在远程服务器运行使用简单麦克风/播放客户端Docker 部署安装 NVIDIA Container Toolkit 后使用 Docker Compose 一键部署docker compose upCompose 文件将启动 llama.cpp 服务器使用 Gemma 4启动 TCP socket 服务器并暴露端口8080、12345和12346。高级配置详解 ⚙️如何快速配置语音识别模型Speech To Speech 提供了灵活的模型配置选项。以下是几个实用配置示例使用本地 llama.cpp 服务器# 终端1启动 llama.cpp 服务器 llama-server -hf ggml-org/gemma-4-E4B-it-GGUF -np 2 -c 65536 -fa on --swa-full # 终端2使用本地 LLM 服务器 speech-to-speech \ --mode realtime \ --stt parakeet-tdt \ --llm_backend responses-api \ --tts qwen3 \ --model_name ggml-org/gemma-4-E4B-it-GGUF \ --responses_api_base_url http://127.0.0.1:8080/v1 \ --responses_api_api_key \ --responses_api_stream \ --enable_live_transcriptionmacOS 优化配置speech-to-speech --local_mac_optimal_settings此设置自动配置添加--device mps为所有模型使用 MPS设置 Parakeet TDT 用于 STT设置 MLX LM 作为 LLM 后端设置 Qwen3-TTS 用于 TTS默认使用 mlx-audio 和 6bit MLX 变体设置--mode local多语言支持配置语言支持取决于你选择的 STT 和 TTS 后端组件后端语言支持STTParakeet TDT默认25 种欧洲语言STTWhisper 系列广泛的多语言覆盖取决于选择的检查点STTParaformer取决于选择的 FunASR 检查点默认面向中文TTSQwen3-TTS默认多语言默认--qwen3_tts_language autoTTSKokoro多种语言/语音映射取决于后端可用性TTSChatTTS英语和中文TTSMMS TTS通过 MMS 检查点实现广泛的多语言覆盖单语言配置示例中文speech-to-speech \ --stt whisper-mlx \ --stt_model_name large-v3 \ --language zh \ --llm_backend mlx-lm \ --model_name mlx-community/Qwen3-4B-Instruct-2507-bf16自动语言检测speech-to-speech \ --stt parakeet-tdt \ --language auto \ --llm_backend mlx-lm \ --model_name mlx-community/Qwen3-4B-Instruct-2507-bf16可选后端安装额外后端通过 pip extras 安装pip install speech-to-speech[kokoro] # 非 macOS 上的 Kokoro-82M TTS pip install speech-to-speech[pocket] # Pocket TTS pip install speech-to-speech[chattts] # ChatTTS pip install speech-to-speech[facebook-mms] # MMS TTS pip install speech-to-speech[faster-whisper] # Faster Whisper STT pip install speech-to-speech[whisper-mlx] # macOS 上的 Lightning Whisper MLX STT pip install speech-to-speech[paraformer] # 通过 FunASR 的 Paraformer STT pip install speech-to-speech[mlx-lm] # macOS 上的 mlx-vlm 视觉模型支持最佳实践与性能优化 实时 API 集成Speech To Speech 的实时模式通过 WebSocket 使用 OpenAI Realtime 协议传输音频支持实时转录和低延迟对话轮次。服务器暴露/v1/realtime端点任何 OpenAI Realtime 兼容客户端都可以连接图将 OpenAI Realtime 客户端端点从托管的 OpenAI 切换到自托管的 speech-to-speech 服务器服务器实现了核心 Realtime 事件集入站包括input_audio_buffer.append、session.update、conversation.item.create、response.create和response.cancel出站包括语音开始/停止、流式转录、音频增量、工具调用和response.done。LLM 后端选择策略LLM 是流水线中计算最密集、延迟最高的组件。大型模型的单次前向传播可能主导端到端响应时间因此根据硬件和延迟预算选择合适的后端至关重要本地推理transformers在 CUDA/CPU 上mlx-lm在 Apple Silicon 上自托管服务器responses-api和chat-completions可指向本地 vLLM 或 llama.cpp 服务器提供商 API相同后端适用于 OpenAI、HF Inference Providers、OpenRouter 和其他 OpenAI 兼容提供商性能调优建议设备选择使用--device参数为所有组件设置统一设备或为每个组件单独指定设备VAD 参数调优调整--thresh、--min_speech_ms、--min_silence_ms以优化语音检测模型量化对于 Apple Silicon使用 MLX 量化变体bf16、4bit、6bit、8bit平衡性能和质量流水线池大小通过--num_pipelines调整实时流水线池大小优化并发处理常见问题解决Qwen3-TTS CUDA 兼容性问题在 Linux 上Qwen3-TTS GGML 后端来自faster-qwen3-tts[ggml]。如果机器没有 PyPI wheel 期望的 CUDA 12 运行时请在安装speech-to-speech之前从 Hugging Face wheelhouse 安装匹配的 wheel# CUDA 13.x pip install qwentts-cpp-python0.3.1cu130 \ -f https://huggingface.co/datasets/andito/qwentts-cpp-python-wheels/tree/main/whl/cu130 # CUDA 12.4 pip install qwentts-cpp-python0.3.1cu124 \ -f https://huggingface.co/datasets/andito/qwentts-cpp-python-wheels/tree/main/whl/cu124 # 仅 CPU 回退 pip install qwentts-cpp-python0.3.1cpu \ -f https://huggingface.co/datasets/andito/qwentts-cpp-python-wheels/tree/main/whl/cpu pip install speech-to-speechDeepFilterNet 兼容性注意DeepFilterNet 用于 VAD 中的可选音频增强需要numpy2并且与需要numpy2的 Pocket TTS 冲突。仅在不使用 Pocket TTS 的环境中手动安装。项目架构与扩展Speech To Speech 采用模块化设计便于扩展和定制。主要目录结构src/speech_to_speech/ ├── LLM/ # 语言模型相关实现 ├── STT/ # 语音转文本处理器 ├── TTS/ # 文本转语音处理器 ├── VAD/ # 语音活动检测 ├── api/ # API 接口实现 ├── arguments_classes/ # 命令行参数类 ├── connections/ # 连接管理 ├── pipeline/ # 流水线核心逻辑 └── utils/ # 工具函数每个组件都有对应的参数类位于src/speech_to_speech/arguments_classes/目录下允许通过命令行参数进行细粒度控制。开发与贡献对于本地开发git clone https://gitcode.com/gh_mirrors/sp/speech-to-speech.git cd speech-to-speech uv sync pytest ruff check项目欢迎问题和 PR。对于较大的更改建议先开一个 issue 讨论方法。Speech To Speech 已在数千个 Reachy Mini 机器人中作为对话后端投入生产使用证明了其稳定性和实用性。通过灵活的配置选项和模块化设计Speech To Speech 为构建本地语音助手提供了强大而灵活的基础设施无论是用于研究、开发还是生产部署都能满足不同场景的需求。【免费下载链接】speech-to-speechBuild local voice agents with open-source models项目地址: https://gitcode.com/gh_mirrors/sp/speech-to-speech创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

yuzu模拟器深度解析:从技术架构到性能优化的完整指南

yuzu模拟器深度解析:从技术架构到性能优化的完整指南

2026/7/27 22:46:37

yuzu模拟器深度解析:从技术架构到性能优化的完整指南 【免费下载链接】yuzu 任天堂 Switch 模拟器 项目地址: https://gitcode.com/GitHub_Trending/yu/yuzu yuzu模拟器作为当前最先进的任天堂Switch开源模拟器,凭借其卓越的跨平台兼容性和持续优…

制造业智能体自适应场景迭代优化:从经验驱动到数据驱动的端到端演进路径拆解

制造业智能体自适应场景迭代优化:从经验驱动到数据驱动的端到端演进路径拆解

2026/7/27 22:46:37

进入2026年7月,制造业AI Agent(人工智能智能体)正经历从“概念验证”到“产线级规模化复制”的质变。根据最新的行业实践观察,工业智能体不再单纯追求大模型的参数规模,而是转向以解决具体工业痛点为核心的自适应迭代。…

制造业AI模型场景适配迭代方案:从RAG检索增强到Agent多智能体协同的工业落地路径

制造业AI模型场景适配迭代方案:从RAG检索增强到Agent多智能体协同的工业落地路径

2026/7/27 22:46:37

2026年7月27日,制造业AI模型的应用已跨越“实验室跑分”阶段,正式进入场景深度适配与效能迭代的“深水区”。随着大模型落地从通用通用对话转向垂直领域的业务闭环,制造业正经历一场由技术牵引向场景价值回归的变革。在工业生产的复杂环境下&…

Uniworld-V2:扩散模型与MLLM协同优化的图像编辑框架

Uniworld-V2:扩散模型与MLLM协同优化的图像编辑框架

2026/7/27 23:56:54

1. 项目概述:Uniworld-V2图像编辑增强框架 在当前的AI图像生成与编辑领域,扩散模型虽然展现出强大的创造力,但在精细控制与语义一致性方面仍存在显著挑战。Uniworld-V2创新性地结合了扩散负感知微调(Diffusion Negative-aware Fin…

北美鸟类图像识别数据集构建与深度学习应用

北美鸟类图像识别数据集构建与深度学习应用

2026/7/27 23:56:54

1. 北美鸟类图像识别数据集概述 作为一名长期从事计算机视觉与生态学交叉研究的从业者,我深知高质量专业数据集对算法研发的重要性。这个包含200种北美鸟类、共计11,788张高质量标注图像的数据集,正是我们团队经过三年野外采集与专业标注构建的核心资源。…

嵌套学习:AI记忆革命与持续学习新范式

嵌套学习:AI记忆革命与持续学习新范式

2026/7/27 23:56:54

1. 从Transformer到嵌套学习:AI记忆革命的底层逻辑 2017年诞生的Transformer架构彻底改变了人工智能的发展轨迹,其核心的注意力机制让模型能够动态关注输入的不同部分,在自然语言处理等领域取得了突破性进展。然而当我们站在2024年回望&#…

Molili:自然语言控制电脑的AI数字员工实战指南

Molili:自然语言控制电脑的AI数字员工实战指南

2026/7/27 23:56:54

1. Molili:一款真正能帮你干活的AI数字员工 上周我在家加班时遇到个尴尬场景:急需从办公室电脑调取一份合同,但人已经在通勤路上。正当我纠结要不要折返时,同事发来条消息:"试试Molili,微信就能控制你…

浅拷贝和深拷贝两种不同的对象复制

浅拷贝和深拷贝两种不同的对象复制

2026/7/27 23:56:54

浅拷贝和深拷贝两种不同的对象复制 在软件开发中,对象复制是一个常见且重要的操作。无论你是在处理数据结构、传递参数,还是实现缓存,理解如何正确地复制对象都至关重要。然而,许多开发者对浅拷贝(Shallow Copy&#x…

Agent架构设计:Planning与动态任务规划

Agent架构设计:Planning与动态任务规划

2026/7/27 23:46:54

Agent架构设计:Planning与动态任务规划 很多 Agent 的问题,不是不会调用工具,而是不知道什么时候该停下来规划。 简单任务中,边思考边执行没有问题。但当任务涉及多个模块、多个步骤时,Agent 很容易陷入一种状态&…

[具身智能-649]:个人电脑搭建 RTSP 服务完整方案(Windows / Ubuntu 双平台,适配 RDK X5 rtsp2display 调试)

[具身智能-649]:个人电脑搭建 RTSP 服务完整方案(Windows / Ubuntu 双平台,适配 RDK X5 rtsp2display 调试)

2026/7/27 8:45:59

目标:电脑作为RTSP 服务端,循环推送 H264/H265 视频流; RDK X5 通过 rtsp2display 拉流预览,完全不需要在开发板编译 live555。 提供两套成熟方案: ✅ 方案 A:FFmpeg(最简单,优先推…

PDF合并与动态水印的工程化方案:2026国内免费工具实测对比

PDF合并与动态水印的工程化方案:2026国内免费工具实测对比

2026/7/27 8:42:17

一、背景与测试方案 在实际项目交付中,PDF文件合并与版权保护水印的叠加是一个高频但容易被低估的技术需求。典型的处理链路涉及:多源PDF的文件流合并、页面级水印渲染(含透明度混合与图层叠加)、输出文件体积控制。看似简单的操作…

PDF拆分压完图糊了?2026国内免费实测,档案员都在用的组合方案

PDF拆分压完图糊了?2026国内免费实测,档案员都在用的组合方案

2026/7/27 14:56:57

说实话,提到PDF拆分再压缩,我真是被折腾得够呛。 上个月公司年度合同归档,一份300多页的PDF总合同,需要按年份拆分成三个独立文件,再分别压缩到10MB以内方便邮件发送各部门确认。我心想这还不简单?先找个海…