Cactus Compute 发布开源语音识别模型 Whistle,面向手机、可穿戴设备、机器人、汽车和微控制器等端侧设备。

模型文件仅 16.9MB,直接在 CPU 上运行,并与其端侧工具调用模型 Needle 共用同一套 C++ 推理引擎,可以把语音转写和后续工具调用放进同一个本地执行链路。


  • 模型大小约为 Whisper base 的 1/9: Whistle 为 16.9MB,Whisper base 为 145.3MB;在 Apple M4 Pro CPU 的 10 秒音频测试中,Whistle 首 token 延迟为 11.1ms,Whisper base 为 73.2ms,解码速度分别为 1319 token/s 和 266 token/s。
  • 支持 7 种语言和本地实时转写: 当前支持英语、德语、法语、西班牙语、意大利语、荷兰语和波兰语,并提供词级时间戳、语言检测和语音嵌入向量;单次最多处理 30 秒音频,也提供流式转写接口。
  • 语音输入可以直接接到 Needle 的工具调用: Whistle 与 Needle 使用相同的 .cact 模型格式和运行时,同一个二进制可以先完成语音转写,再直接根据转写结果生成工具调用 JSON,开发者无需单独拼接 ASR 和本地 Agent 推理服务。


📎相关链接:

https://cactuscompute.com/blog/whistle