DSH HUB
首页插件商店插件包社区排行榜资源发布指南
插件源码
返回插件目录

WizisCool /

WizisCool/dsh-ears

已验证

Voice input plugin for DeepSeek Harness (DSH) with text polishing. Supports local GPU Whisper and STT(ASR) API | 一款支持润色整理的 DeepSeek Harness 语音输入插件,为 DSH 提供语音输入能力,支持本地 GPU Whisper 和主流语音识别转写 API

★ 21 Stars3 Forks2 IssuesN/A 社区评分0 已确认安装
查看 GitHub项目主页
README来源: master@8570e629

dsh-ears

dsh-ears

一款支持润色整理的 DeepSeek Harness 语音输入插件。

简体中文 · English

dsh >= 0.1.2-rc.1 npm version npm downloads MIT

https://github.com/user-attachments/assets/1363768e-a393-44bd-a008-1ce2055cac41


dsh-ears 为 DeepSeek Harness 提供语音输入与 LLM 润色整理能力。支持浏览器 Web Speech、本地 Whisper 以及主流语音识别(ASR)API 服务。

安装

前置依赖:DeepSeek Harness >=0.1.2-rc.1,以及 Node.js ^22.19.0 || >=24.0.0。

通过 npm 安装

dsh plugin --profile web add dsh-ears

仍在使用 dsh 0.1.1? dsh 0.1.2 包含破坏性更新,dsh-ears 0.3.0 不再兼容 dsh 0.1.1。请安装 0.3.0 以前的插件版本:

dsh plugin --profile web add "dsh-ears@<0.3.0"

从源码安装

git clone https://github.com/WizisCool/dsh-ears.git
cd dsh-ears
pnpm use:platform
pnpm install
pnpm build
dsh plugin --profile web add "$PWD"
# Windows 的 cmd 请使用 "%CD%";PowerShell 直接使用 $PWD

pnpm use:platform 将 node_modules 切换到当前平台的 native 依赖树(Windows / Linux 各自独立),首次克隆和跨平台切换后都需要运行。

安装完成后刷新 Web UI,输入框右侧会显示麦克风图标。

更新

dsh plugin --profile web add dsh-ears

add 会从 npm 拉取最新版本,任何已装版本都可以直接运行。更新后需要重启 dsh web 加载新的服务端代码,再刷新 Web UI;也可以在设置页的"关于"面板检查新版本。

卸载

dsh plugin --profile web remove dsh-ears

卸载后刷新 Web UI。

使用

  1. 点击麦克风图标,或按下 Ctrl+Shift+Space(可在设置页更改)
  2. 开始说话
  3. 再次按下快捷键或点击麦克风,停止录音并开始转写
  4. 开启润色后,原始转写会先写入草稿,润色完成后再更新,期间的手动编辑会被保留
  5. 检查内容后手动发送

转写结果始终写入可编辑草稿,不会自动发送。如果所选后端尚未就绪,麦克风图标会变灰,悬停即可查看原因。

识别后端

后端 工作方式 需要什么
Web Speech 浏览器实时识别 默认后端;Chromium 内核浏览器
本地 Whisper 录音结束后本地转写 在设置页下载 GGML 模型
Groq Groq Whisper API API key
Deepgram 预录音频或实时音频流 API key、模型名(如 nova-3)
阿里云百炼 DashScope 同步转写 API key、模型名;单次最长 300 秒
腾讯云 录音文件识别或实时语音识别 AppID、SecretID、SecretKey、engine_type
小米 MiMo 语音识别 API,支持标准 API 或 Token Plan API key、模型名(如 mimo-v2.5-asr);Token Plan 需选择区域集群
硅基流动 (CN) 语音转写 API API key、模型名(如 FunAudioLLM/SenseVoiceSmall)
火山引擎 录音文件识别(大模型)或单向流式语音识别 API key(新版控制台 X-Api-Key)、资源 ID
自定义 OpenAI 兼容 发送到指定 /audio/transcriptions 端点 端点地址、API key、模型名

本地 Whisper:基于 @fugood/whisper.node 本地运行 whisper.cpp,无需 Python、FFmpeg 或外部依赖。支持在设置页下载管理 GGML 模型(tiny(默认)至 turbo),并可选 default(自动)、vulkan 或 cuda 加速。

火山引擎:仅支持新版控制台的 API Key(X-Api-Key)鉴权(不支持旧版 AppID + Access Token),可在控制台 API Key 管理页面获取。

润色

默认开启。提供方和模型都留空时使用 dsh 的默认 Agent 模型(包括默认推理设置);也可以从 dsh 已配置的模型中选择。LLM 凭据复用 dsh 现有配置。支持设置推理强度。

默认提示词会删除口头禅、修正 ASR 错字、处理自我纠正和口头列举。可在设置页自定义提示词或查看默认内容。润色失败或取消时保留原始转写。

设置

安装后在 Web UI 的设置页出现 dsh-ears 面板,分为四个标签页:

标签页 可配置项
常规 设置页显示名称、语音快捷键开关与组合键、提示音开关、最长录音时间(1–600 秒,默认 120 秒)
识别 后端选择、语言、本地 Whisper 模型和加速方式、云服务提供方及各提供方凭据
润色 开关、LLM 提供方和模型、推理强度、自定义提示词(最长 4000 字)
关于 版本号、许可证、dsh 兼容范围、检查更新

已知限制

  • Web Speech 后端依赖浏览器实现,音频可能被发送到浏览器厂商的服务端处理,不是完全的本地/离线方案。
  • 百炼单次录音最长 300 秒。
  • Deepgram Flux 系列模型需要 Listen V2 协议,当前不支持。
  • 本地 Whisper 单次音频限制 24 MB,转写超时 120 秒。
  • 加速方式(default / vulkan / cuda)在首次 native 加载后锁定,切换需重启 dsh web。

本地开发

pnpm use:platform
pnpm install
dsh plugin --profile web add "$PWD"
# Windows 的 cmd 请使用 "%CD%";PowerShell 直接使用 $PWD
pnpm check          # 类型检查
pnpm test           # 运行测试
pnpm build          # 构建
pnpm dev:config     # 构建并生成 HMR 配置
pnpm dev:web        # 启动 dsh web

开发时在另一个终端运行 pnpm dev:watch 实时重编译。

修改前端 UI 代码只需刷新浏览器;修改服务端、设置注册、Remote 或 schema 代码需重启 dsh web 再刷新。

文档

  • CHANGELOG
  • CONTRIBUTING
  • SECURITY
  • LICENSE

License

MIT

友链

  • LINUX DO — 新的理想型社区

Star History

Star History Chart
—/ 5

暂无评分

已验证 DSH bundle

Commit 8570e6297a8c

社区评论

还没有评论,来写第一条。

DSH HUB

社区维护的 DSH 插件索引。不是 GitHub 或 DeepSeek AI 的官方产品。

社区资源API关于