Skills Plugins MCP Prompt Model 导航 博客 资讯 我的中心
工具与能力 #asr#audio#deepseek-harness#dsh#dsh-plugin#opensource

dsh-audio-copilot

为 DSH 提供 ASR 音频转写和 TTS 语音合成,让纯文本 Agent 能听能说;支持 Windows SAPI 与 OpenAI 兼容端点。

ai-yucheng @ai-yucheng ⬇ 2 ★ 1 main

安装

dsh plugin --profile web add github:ai-yucheng/dsh-audio-copilot
下载安装清单

需要可复现安装时,可在仓库后追加 #commit 固定提交。

为 DSH 提供 ASR 音频转写和 TTS 语音合成,让纯文本 Agent 能听能说;支持 Windows SAPI 与 OpenAI 兼容端点。

该插件未提供要点说明,请参考仓库 README。

asraudiodeepseek-harnessdshdsh-pluginopensource
  1. 安装并启动 DeepSeek Harness:npx @deepseek-ai/dsh web
  2. 在终端执行上面的安装命令(CLI 会解析插件并核验来源)
  3. 用 dsh plugins list 确认已安装,必要时重启 Harness 生效

插件以当前 dsh 进程的权限运行,安装时可能执行代码。请先通读仓库源码与许可证,确认无破坏性命令与越权访问;本站只做索引,不对第三方插件安全性作担保。

代码仓库github.com/ai-yucheng/dsh-audio-copilot
许可证MIT
主要语言main
下载量2
GitHub 星标1
最近推送2026-08-20
收录日期2026-09-19
分类工具与能力

事实信息来自公开插件目录快照(2026-10-01),介绍文案由本站再加工。

以下为插件仓库 README 全文(原始内容,由公开目录抓取整理)。

# dsh-audio-copilot · 语音工作台

> 给纯文本模型补上"听"和"说"的能力——DeepSeek Harness(DSH)音频插件。
> Audio Copilot: give your text-only agent ears and a voice.

[![License: MIT](https://img.shields.io/badge/license-MIT-blue.svg)](LICENSE)
[![DSH](https://img.shields.io/badge/DSH-0.1.0--rc.7-4D6BFE.svg)](https://github.com/deepseek-ai/deepseek-harness)
[![GitHub](https://img.shields.io/badge/GitHub-ai--yucheng-181717?logo=github)](https://github.com/ai-yucheng/dsh-audio-copilot)
[![npm version](https://img.shields.io/npm/v/dsh-audio-copilot?logo=npm&color=cb3837)](https://www.npmjs.com/package/dsh-audio-copilot)
[![npm downloads](https://img.shields.io/npm/dm/dsh-audio-copilot?logo=npm&color=cb3837)](https://www.npmjs.com/package/dsh-audio-copilot)

纯文本模型(如 DeepSeek)无法直接理解音频,也无法朗读。本插件补上这两块,并附赠一个**语音输入按钮**:

| 工具 / 能力 | 做什么 |
|---|---|
| 🎤 **语音输入按钮** | 聊天输入框旁的麦克风按钮:点击录音 → 自动转文字 → 填入输入框,说完即发 |
| `audio_probe` | 用 ffprobe 读音频元数据:容器 / 时长 / 编码 / 采样率 / 声道 |
| `audio_transcribe` | 音频 / 录音 → 文字(OpenAI 兼容 ASR 端点,可接 Whisper / SenseVoice / GLM-ASR) |
| `audio_tts` | 文字 → 语音文件(**默认 Windows 本地 SAPI,免 key 免联网**;可选 Edge 在线 / OpenAI 兼容端点) |
| `audio_ask` | 带时间锚定的音频问答:转写 → 关键词定位 → 返回命中片段与时间戳 |

## ✨ 特性

- 🎤 **语音输入按钮**:浏览器端麦克风录音 → host 转写 → 自动填入输入框(需浏览器麦克风权限 + 已配置 ASR key)
- **开箱即用**:`audio_tts` 默认走 Windows 自带语音(SAPI),零配置零 key,离线可用
- **可插拔**:ASR / TTS 全部 OpenAI 兼容,可配任意端点,不锁定厂商
- **三引擎 TTS**:
  - `sapi`(默认):Windows 本地语音,免费离线,中文"Microsoft Huihui"、英文"Microsoft Zira/David"
  - `edge`:微软在线 TTS,免 key(需网络可达 speech.platform.bing.com)
  - `openai`:任意 OpenAI 兼容 `/audio/speech` 端点
- **失败要大声**:缺 key / 缺 ffmpeg / 端点错误都给可操作的错误信息
- **对齐官方规范**:Config schema 校验、effect 注册、纯 ESM、`inject: ['tools']`、`dsh.client` 浏览器半

## 📦 安装

前置:Node.js ≥ 20、`ffprobe`/`ffmpeg` 在 PATH(Windows 装 ffmpeg 后两者都有)。

```sh
# 方式一:本地源码(开发/迭代)
cd <插件父目录>
dsh plugin --profile web add ./dsh-audio-copilot

# 方式二:npm(发布后)
dsh plugin --profile web add dsh-audio-copilot
```

验证:

```sh
dsh --profile web --dump-config | grep audio-copilot
```

**硬刷新浏览器(Ctrl+Shift+R)** 或重启 DSH 后,四个工具进入 agent 工具列表。

## ⚙️ 配置

在 profile 的 `cordis.patch.yml` 里覆盖(所有键都有默认值,不配也能用 TTS):

```yaml
- id: audio-copilot
  config:
    # ASR:OpenAI 兼容 /audio/transcriptions 端点
    asrBaseUrl: https://open.bigmodel.cn/api/paas/v4
    asrModel: glm-4v-asr
    asrApiKeyEnv: ZHIPU_API_KEY
    # TTS 引擎:sapi | edge | openai
    ttsEngine: sapi
    ttsBaseUrl: https://open.bigmodel.cn/api/paas/v4
    ttsModel: glm-tts
    ttsApiKeyEnv: ZHIPU_API_KEY
    ttsVoice: Microsoft Huihui Desktop
```

| 键 | 默认 | 说明 |
|---|---|---|
| `asrBaseUrl` | `https://open.bigmodel.cn/api/paas/v4` | ASR 端点根(OpenAI 兼容) |
| `asrModel` | `glm-4v-asr` | ASR 模型名 |
| `asrApiKeyEnv` | `ZHIPU_API_KEY` | 持 key 的环境变量名 |
| `ttsEngine` | `sapi` | TTS 引擎:`sapi`(本地)/ `edge`(在线)/ `openai`(兼容端点) |
| `ttsBaseUrl` | `https://open.bigmodel.cn/api/paas/v4` | openai 引擎端点 |
| `ttsModel` | `glm-tts` | openai 引擎模型 |
| `ttsApiKeyEnv` | `ZHIPU_API_KEY` | openai 引擎 key 环境变量 |
| `ttsVoice` | `Microsoft Huihui Desktop` | 默认音色 |
| `maxAudioBytes` | `26214400` | 转写文件大小上限 |
| `transcribeTimeoutMs` | `120000` | ASR 超时 |
| `ttsTimeoutMs` | `90000` | TTS 超时 |
| `maxSegments` | `20` | audio_ask 返回的命中片段上限 |

## 🎯 使用示例

在会话里对模型说:

- 「把这个录音转成文字:`C:\meeting.wav`」
- 「读一下这段总结的语音版」
- 「这个会议录音里,3 分钟的时候说了什么?」
- 「把这段代码用语音念出来」

## 🛠 开发

```sh
pnpm install
pnpm run build      # tsc → dist/index.js(纯 ESM)
pnpm run typecheck  # tsc --noEmit
```

依赖对齐:`@deepseek-ai/dsh-tools` 锁定 `0.1.0-rc.7`(与你 DSH 同版本线,避免装两份模块)。

## 📄 License

MIT

数据来源:公开的 DeepSeek Harness 插件目录与各插件 GitHub 仓库。本站为独立第三方目录,与 DeepSeek、幻方(High-Flyer)及插件作者均无隶属或背书关系。

每日精选 Skill 推荐,免费送到你邮箱

输入邮箱,每天接收一个精选 AI Agent 技能推荐。完全免费,持续更新。

提交后我们会发送一封确认邮件,点击邮件里的链接才会开始收信。

完全免费,取消任意时间。我们不会发送垃圾邮件。