概览
dsh-attention-health
README / ZH
插件文档
目录摘要
dsh.pub 核对固定版本的组合包契约、运行时事实与分发语义;完整 README 请查看源仓库。
在 GitHub 阅读完整 READMELIMITATIONS
已知限制
- **文件修改清单不完整**:只覆盖经 DSH 文件工具(`str_replace_editor` / `write` / `edit`) 完成的修改。**通过 `pwsh` / `bash` 直接写文件的操作不会出现在日志中**。 - **"关键决策与未决问题"是启发式抽取**(已实现,不是"没做")。日志里没有"决策"事件, 只能按关键词从助手文本与问答回答里抽句。词表刻意偏"取舍 / 结论"语境(宁可少抽也不要噪音), 所以**非工程领域可能漏抽**;漏掉的内容由「用户请求主线」与附录原文兜底。 - **压缩过的会话评分有上限**:经历 1 次模型摘要 → 最高 79 分、2 次 → 65、≥3 次 → 50。 压缩是"续命"(有损),不该把分数送回满分(那会把"续命"记成"治愈")。 - **重复工具调用检测过于保守**:只做精确匹配(同工具 + 同参数)。 实测 71 个会话中该信号**从未触发**(因为 DSH 自带的 `repeat-tool-reminder` 会在 3 次时提醒模型,模型通常会改)。近似重复(改了个路径)检测不到。 - **退化检测是启发式的**,分两类信号(判据的实测依据见下一节): - **输出退化**:代码块围栏不闭合、同行复读、段落逐字重复、符号堆砌(表格框线字符已排除, 且**先剥掉代码、要求命中串以非 ASCII 符号为主** —— 见下文二次复核)。 原「中英严重混杂」判据**已删除** —— 全量 25 次命中、25/25 全是误报。 - **思考退化**:行重复率 ≥0.7 且行数 ≥30(打转)、单块 ≥10 万字符(异常长)、 **`usage.reasoningTokens` ≥ 16,000(真实计量,与字符数无关)**。 - 立场不变:**宁可漏报也不误报**(误报会让用户忽略提示,比不提示更糟)。 - **评分是启发式指标**:阈值与扣分力度是内部校准出来的,**没有做回溯验证**, 用途是**比较同一会话的变化趋势**,不是精确测量 —— 交接文档与界面都写明了这一点 (阈值校准留痕见下一节)。 - **`contextWindow` 依赖日志里的 `request/context` 事件**。若会话从未记录该事件, 无法计算占用百分比。 - **验证范围是单机、单 DSH 版本**(2026-09-20 补;2026-09-23 扩到 `rc.3`):全部阈值与判据是在 **一台机器**、`dsh 0.1.5-rc.2` / `0.1.5-rc.3`(两者都实测过)+ `cordis 4.0.2` 上、 用 79 个真实会话标定与回归的。换机器 / 换模型 / 官方改契约后,结论可能不再成立 —— 遇到不符请带着会话日志提 issue。 - **成本口径是估算,不是账单**:单价来自官方公开价目表(可被 `prices.json` 覆盖), 「每轮」按实测平均请求数换算;官方调价或改缓存规则后需要更新价表。 ---
