Overview
dsh-voice-input
README / EN
Package documentation
Registry summary
dsh.pub verifies the pinned bundle contract, runtime facts, and distribution semantics. The complete README remains in the source repository.
Read the full README on GitHubLIMITATIONS
Known limitations
- **本地方案在 CPU 上是 0.7× 实时**:5.55 秒语音约 7.5 秒转完。短句听写没问题,长录音要等;想更快就按 `local-asr/README.md` 里写的方式开 GPU。 - **本地服务要自己启动** —— 但现在可以是页面里的一下:`local-asr/start.ps1` 是前台进程,关掉窗口服务就停了。装好 `localAsrDir` 后,设置页的「启动本机 Whisper」会把它拉起来并轮询到就绪;没装的话页面会如实报告「本机 8081 / 8080 / 8000 / 9000 上都没有转写服务在监听」。 - **Ollama 目前不能转写**:它的音频接口要求模型带音频投影(audio / mmproj),而 0.34 的官方模型库里没有这样的模型(`gemma3n:e2b` 实测是纯文本转换)。插件的上传前校验会把这件事讲清楚。 - **「服务起来了」和「能转写」是两件事**:`ollama.start` 会在 15 秒内如实回答「本来就在跑 / 刚起来 / 起不来」,但一台跑着 4 个文本模型的 Ollama 依然一个字都转不了。所以选完 Ollama,页面会接着读一遍模型清单,没有能听的模型就直接给红字结论 + 「改用本机 Whisper」按钮;录音失败时状态条也给同一个按钮。 - **Ollama 的对话模型不适合直接转写**:`/v1/audio/transcriptions` 在 Ollama 那边走的是聊天模板,所以插件会在没配置「提示词」时补一句「只输出转写文本」。若你改了提示词,请保留这句话。 - **`model_info` 探测有预算**:模型超过 16 个时,只判定前 16 个(当前配置的模型优先),其余标为「未检测」而不是「仅文本」。 - **新建会话的第一屏没有麦克风**:`conversation.input.left` 与 shell 自带的回形针按钮受同一条约束(`sessionId === undefined` 时不渲染)。选中工作区/进入会话后即出现。 - **转录不进会话记录**:转写只是写进输入框,和键盘输入没有区别;插件不保存音频,也不保存历史记录。 - **不能用语音操作模型侧的会话**:录音是浏览器交互,模型无法替你按下麦克风。它只能回答「为什么不能用」。 - **浏览器引擎不显示电平**:`SpeechRecognition` 自己占着麦克风,拿不到音频流,所以那条路径用脉冲点代替电平条。 - **取消是即时的,上传不是**:转写请求一旦发出无法撤回(没有取消上传的按钮),Esc 只在录音阶段有效。 - 已经加载过客户端 bundle 的 profile 需要**刷新页面**才能拿到新版本。
