MINARA

语音

用语音和 Minara 对话并听它回答 : 网页终端与各消息平台均支持,回复边生成边逐句朗读。

Minara 在所有聊天界面支持语音。网页终端里用麦克风按钮口述消息,回复会 边生成边朗读(首句不到一秒即可听到)。在消息平台上发送语音条,agent 会 转写、用文字回答,开启后还会附带一条语音回复。

配置

语音使用可插拔的语音服务,设置其一:

  • ELEVENLABS_API_KEY : 设置后优先使用(合成延迟最低,Scribe 听写)。
  • OPENAI_API_KEY : 回退方案,也是唯一能产出 OGG/Opus 语音条的服务 (Telegram、飞书、WhatsApp 会渲染为原生语音气泡)。

消息平台语音回复用 MESSAGING_VOICE_REPLY=1 开启,入站转写用 MESSAGING_INBOUND_TRANSCRIBE=1 开启。语音消息会持久化进聊天记录: 你的消息保留原始录音,回复保留当时朗读的音频。

平台支持

平台接收语音发送语音回复说明
网页终端每个聊天界面都有麦克风按钮 + 流式朗读
Telegram原生语音条(OGG/Opus)
Discord音频附件
Slack音频文件上传
WhatsAppCloud API audio 类型;Opus 渲染为语音条
飞书 / LarkOpus 上传渲染为语音气泡
MatrixMSC3245 语音消息
Mattermost是(音频文件)客户端内联播放器
BlueBubbles(iMessage)是(音频文件)
Google Chat是(音频文件)入站下载需要服务账号媒体权限(计划中)
微信公众号优先使用微信自带转写;AMR 回退需要 ffmpeg
企业微信双向 AMR : 需要 ffmpeg(VOICE_FFMPEG_PATH
LINE仅文字发送音频需要公网媒体 URL(计划中)
Signal是(音频文件)入站语音待接 signal-cli 附件存储(计划中)
Email / Gmail是(mp3 附件)无入站消息通道
Microsoft Teams仅文字文件发送需要 consent 卡片流程(计划中)
钉钉仅文字机器人 webhook 无媒体上传(计划中)
QQ仅文字语音为 Silk 编码,标准 ffmpeg 无法编码

标注"计划中"的平台,凡入站语音能到达 agent 的,都会以文字回复。

本页目录