概览
dsh-voice-input
README / ZH
插件文档
目录摘要
dsh.pub 核对固定版本的组合包契约、运行时事实与分发语义;完整 README 请查看源仓库。
在 GitHub 阅读完整 READMELIMITATIONS
已知限制
- **本地方案在 CPU 上是 0.7× 实时**:5.55 秒语音约 7.5 秒转完。短句听写没问题,长录音要等;想更快就按 `local-asr/README.md` 里写的方式开 GPU。 - **本地服务要自己启动** —— 但现在可以是页面里的一下:`local-asr/start.ps1` 是前台进程,关掉窗口服务就停了。装好 `localAsrDir` 后,设置页的「启动本机 Whisper」会把它拉起来并轮询到就绪;没装的话页面会如实报告「本机 8081 / 8080 / 8000 / 9000 上都没有转写服务在监听」。 - **Ollama 目前不能转写**:它的音频接口要求模型带音频投影(audio / mmproj),而 0.34 的官方模型库里没有这样的模型(`gemma3n:e2b` 实测是纯文本转换)。插件的上传前校验会把这件事讲清楚。 - **「服务起来了」和「能转写」是两件事**:`ollama.start` 会在 15 秒内如实回答「本来就在跑 / 刚起来 / 起不来」,但一台跑着 4 个文本模型的 Ollama 依然一个字都转不了。所以选完 Ollama,页面会接着读一遍模型清单,没有能听的模型就直接给红字结论 + 「改用本机 Whisper」按钮;录音失败时状态条也给同一个按钮。 - **Ollama 的对话模型不适合直接转写**:`/v1/audio/transcriptions` 在 Ollama 那边走的是聊天模板,所以插件会在没配置「提示词」时补一句「只输出转写文本」。若你改了提示词,请保留这句话。 - **`model_info` 探测有预算**:模型超过 16 个时,只判定前 16 个(当前配置的模型优先),其余标为「未检测」而不是「仅文本」。 - **新建会话的第一屏没有麦克风**:`conversation.input.left` 与 shell 自带的回形针按钮受同一条约束(`sessionId === undefined` 时不渲染)。选中工作区/进入会话后即出现。 - **转录不进会话记录**:转写只是写进输入框,和键盘输入没有区别;插件不保存音频,也不保存历史记录。 - **不能用语音操作模型侧的会话**:录音是浏览器交互,模型无法替你按下麦克风。它只能回答「为什么不能用」。 - **浏览器引擎不显示电平**:`SpeechRecognition` 自己占着麦克风,拿不到音频流,所以那条路径用脉冲点代替电平条。 - **取消是即时的,上传不是**:转写请求一旦发出无法撤回(没有取消上传的按钮),Esc 只在录音阶段有效。 - 已经加载过客户端 bundle 的 profile 需要**刷新页面**才能拿到新版本。
