语音
用语音和 Minara 对话并听它回答 : 网页终端与各消息平台均支持,回复边生成边逐句朗读。
Minara 在所有聊天界面支持语音。网页终端里用麦克风按钮口述消息,回复会 边生成边朗读(首句不到一秒即可听到)。在消息平台上发送语音条,agent 会 转写、用文字回答,开启后还会附带一条语音回复。
配置
语音使用可插拔的语音服务,设置其一:
ELEVENLABS_API_KEY: 设置后优先使用(合成延迟最低,Scribe 听写)。OPENAI_API_KEY: 回退方案,也是唯一能产出 OGG/Opus 语音条的服务 (Telegram、飞书、WhatsApp 会渲染为原生语音气泡)。
消息平台语音回复用 MESSAGING_VOICE_REPLY=1 开启,入站转写用
MESSAGING_INBOUND_TRANSCRIBE=1 开启。语音消息会持久化进聊天记录:
你的消息保留原始录音,回复保留当时朗读的音频。
平台支持
| 平台 | 接收语音 | 发送语音回复 | 说明 |
|---|---|---|---|
| 网页终端 | 是 | 是 | 每个聊天界面都有麦克风按钮 + 流式朗读 |
| Telegram | 是 | 是 | 原生语音条(OGG/Opus) |
| Discord | 是 | 是 | 音频附件 |
| Slack | 是 | 是 | 音频文件上传 |
| 是 | 是 | Cloud API audio 类型;Opus 渲染为语音条 | |
| 飞书 / Lark | 是 | 是 | Opus 上传渲染为语音气泡 |
| Matrix | 是 | 是 | MSC3245 语音消息 |
| Mattermost | 是 | 是(音频文件) | 客户端内联播放器 |
| BlueBubbles(iMessage) | 是 | 是(音频文件) | |
| Google Chat | 否 | 是(音频文件) | 入站下载需要服务账号媒体权限(计划中) |
| 微信公众号 | 是 | 是 | 优先使用微信自带转写;AMR 回退需要 ffmpeg |
| 企业微信 | 是 | 是 | 双向 AMR : 需要 ffmpeg(VOICE_FFMPEG_PATH) |
| LINE | 是 | 仅文字 | 发送音频需要公网媒体 URL(计划中) |
| Signal | 否 | 是(音频文件) | 入站语音待接 signal-cli 附件存储(计划中) |
| Email / Gmail | 否 | 是(mp3 附件) | 无入站消息通道 |
| Microsoft Teams | 否 | 仅文字 | 文件发送需要 consent 卡片流程(计划中) |
| 钉钉 | 否 | 仅文字 | 机器人 webhook 无媒体上传(计划中) |
| 否 | 仅文字 | 语音为 Silk 编码,标准 ffmpeg 无法编码 |
标注"计划中"的平台,凡入站语音能到达 agent 的,都会以文字回复。