免费 & 开源 · macOS 15+

语音 AI,全程留在你的 Mac。

声巢把你的 Apple Silicon Mac 变成私人的语音工作室——52 种语言的音频转写、以假乱真的语音合成,完全离线运行,由 MLX 加速。无云端、无订阅、无需注册。

Apple Silicon · 内置中文 / English · 拖进 Applications 就能用

  • 100% 本地运行
  • 无需账号
  • 无遥测
  • MIT 许可
你要的全都有,多余的一个都不装

一个应用,装下完整的语音工作室。

所有推理都在你的机器上本地运行——你的音频、你的模型、你的规则。

52 种语言转写

Qwen3-ASR 自动检测语种,原生输出标点。Fun-ASR-Nano 覆盖中文、七种方言——甚至歌词。

三种说话方式

用一小段参考音频克隆声音、从 9 个预设音色里挑一个,或用自然语言描述来全新设计一个音色。

流式合成

生成一开始就同步播放——不用等整段渲染完,随时一键停止。

内置字幕

一键拿到纯净文稿、带时间戳的时间轴、随时可当字幕用的 SRT——没有讨厌的序号。

省心的模型管理器

从 ModelScope 或 HuggingFace 下载——国内还能选 HF-Mirror 加速——实时显示进度、速度,支持断点续传。

为 Apple Silicon 而生

MLX 优化的社区模型在 Apple Silicon 上原生运行。Python 运行时和 ffmpeg 都内置——不用额外装任何东西。

为什么我们做它

你的声音,理应默认是私密的。

零云端。零追踪。

Whisper、ElevenLabs、Google Cloud——几乎每一家语音 API 都会把你的音频上传到别人的服务器。声巢不。所有处理都在你的 Mac 上完成。没有账号、没有遥测、代码里根本不存在任何上传通道。

把 Apple Silicon 的威力用起来。

声巢为你 Mac 里的那颗芯片打造。MLX——苹果自家的机器学习框架——让开源模型在 Metal 原生加速下跑起来。Qwen3-ASR 几分钟就能转写数小时音频。Qwen3-TTS 在 Apple Silicon 上流式合成比实时还快。

社区构建,值得信赖。

声巢里的每一个模型都是 mlx-community 免费开源构建的——经过量化、测试,在 HuggingFace 上公开分享。从 ModelScope 或 HuggingFace 下载,国内用户可选 HF-Mirror 加速。支持断点续传,进度看得见。

挑一个模型。或者全都跑。

每个模型都是 mlx-community 的免费社区构建,为 Apple Silicon 量化,应用内直接管理。

语音转文字

两个模型都自带标点——不需要额外的后处理管线。

Qwen3-ASR 1.7B 精度首选

多语言长音频转写的精度首选。

52 种语言与方言自动语种检测原生时间戳内置标点

Fun-ASR-Nano 0.8B 速度首选

日常中文转写的速度首选。

中文 + 7 种方言歌词识别轻量快速内置标点

文字转语音

三个变体共用一个 12 Hz 语音分词器——第一次下载模型时自动拉取。

Qwen3-TTS · 基础版 声音克隆

给一小段参考音频,声巢自动转写参考文本并匹配音色。

零样本克隆自动转写参考文本

Qwen3-TTS · 预设音色 9 个音色

Serena、Vivian、Uncle_Fu、Dylan、Eric、Ryan、Aiden、Ono_Anna、Sohee——覆盖普通话、方言、英语、日语、韩语。

普通话北京 & 四川话English日本語한국어

Qwen3-TTS · 音色设计 描述一下就生成

一句话设定性别、年龄、音调、语速、情绪、音色特点、用途七个维度。

七维度设计自然语言

从下载到说出第一句话只需要几分钟。

1

安装

把声巢拖进 Applications。Python 运行时和 ffmpeg 都内置了——别的什么都不用装。

2

选模型

从目录里挑一个模型,看着进度条一条条走——支持断点续传。

3

开始创作

拖入音频开始转写,或输入文字来听。每一个字节都留在你的 Mac 上。

下载 声巢

免费、开源、永远本地运行。下载来自 GitHub Releases。

Apple Silicon

MLX 加速。Python 运行时和 ffmpeg 均已内置——不用额外装任何东西。

需要 macOS 15.0 或更高 · 约 75 MB 下载 · 模型在首次启动时另行下载

查看所有版本 →

问题,都答好了。

声巢真的是离线的吗?

是的。仅在首次下载模型时需要联网。之后转写和合成完全在你的 Mac 上运行——飞行模式下也能用。

我的音频会上传到云端吗?

不会。没有账号、没有遥测、也没有任何上传通道。音频文件由应用内置引擎在本地处理。

哪些 Mac 能运行声巢?

任何 Apple Silicon Mac,macOS 15 或更高版本。MLX 加速内置——不需要其他硬件。

声巢要收费吗?

完全免费。声巢是开源软件(MIT 许可),模型目录里的每个模型也都是社区免费构建的版本。

能导出 SRT 字幕吗?

能。转写结果可以导出带原生模型时间戳的 SRT 字幕,还能导出带时间轴的文本和纯文稿。

声巢支持多少种语言?

Qwen3-ASR 支持 52 种语言和方言,自动检测语种。Fun-ASR-Nano 专攻中文、七种方言和歌词识别。

macOS 提示「声巢已损坏,无法打开」.

这是 Gatekeeper 的 quarantine 属性 — `.dmg` 从网络下载时自动打上,不是真的损坏。打开终端运行:sudo xattr -r -d com.apple.quarantine /Applications/voxNest.app。输入 Mac 密码确认后重新启动即可。