skills/skill-optimizer/SKILL.md
持续优化 skills 与 subagents 的方法论编排器。诊断 9 维短板→设计 bounded 编辑→validation-gated 验证→保留或回滚。用于优化现有 SKILL.md / agent.md、修触发准确性、补失败模式、收窄误触发、回归检查。系统可自动调用,亦可 /skill-optimizer 手动触发。
npx skillsauth add lazygophers/ccplugin skill-optimizerInstall this skill globally with one command. Works with Claude Code, Cursor, and Windsurf.
3 of 9 scanners reported clean
Some scanners were skipped, did not run, or reported a non-clean status. Review each row below.
双重触发(系统自动 +
/skill-optimizer手动)。基于 darwin-skill 9 维 rubric + Microsoft SkillLens(arXiv 2605.23899)utility-grounded 评估 + SkillOpt(arXiv 2605.23904)validation-gated text-space 优化。完整维度表 / loop 细节 / 论文证据见references/。
/darwin-skill。| 场景 | 用本 skill | 不用本 skill |
|------|-----------|-------------|
| 优化现有 SKILL.md / agent.md | ✅ | — |
| skill 不触发(false negative) | ✅ 补 description 关键词 | — |
| skill 误触发(false positive) | ✅ 收窄 when_to_use | — |
| 失败模式 / 检查点缺失 | ✅ 补 dim3/dim4 | — |
| 质量回归(改坏了) | ✅ 跑原 eval 场景对比 | — |
| 从零创建新 skill | ❌ | → /skill-author |
| 深度自主评分 + 可视化卡片 + 多轮 hill-climbing | ❌ | → /darwin-skill(本 skill 可路由) |
| 人物 / 主题视角蒸馏 | ❌ | → /huashu-nuwa |
与 darwin 的分工:darwin 是重型自动引擎(git ratchet + judge swarm + results.tsv + visual card + MAX_ROUNDS hill-climbing);本 skill 是轻量方法论编排器——诊断 + 单轮 bounded 编辑 + validation gate,需要 darwin 深度评分时 Skill 工具路由。
双重触发语义:未设 disable-model-invocation,故 Claude 在用户提及 skill 质量问题时自动加载;用户亦可 /skill-optimizer <skill-name> 显式触发。description + when_to_use 遵守项目底线(< 512 / < 128)。
.claude/skills/*/SKILL.md + .claude/agents/*.md。grep -nE "(在 Claude Code|Claude Code skill|Cursor only|Codex 中|~/\.claude/skills/[a-z]|/plugin install\b)" <target>
命中 → P0 先修 runtime drift(详见 darwin references/runtime-neutrality.md)。🔴 CHECKPOINT:诊断表展示给用户,确认优化方向 + 优先级后再设计编辑。方向错后续全返工。
SkillOpt 编辑词表(bounded add/delete/replace,非自由重写):
| 操作 | 适用 | 例子 | |------|------|------| | add | dim3 失败分支缺失 / dim4 检查点缺失 / dim9 反例缺失 | 补 if-then 三段式 fallback 表 | | delete | dim7 冗余 / AI 腔废话 / 时间敏感信息 | 删「说白了/换句话说/综上」 | | replace | dim1 description 太泛 / dim5 软化措辞 / dim2 步骤模糊 | 「建议/可以考虑」→ 具体参数 |
单变量约束:一轮只动一个维度(或一个相关簇)。多维度同改 → 归因失效。
编辑粒度:优先最小可验证改动(HL-1:4 行 🔴 CHECKPOINT 撬动 dim4 +3)。避免整段重写——除非 Phase 2.5 触发(见下)。
仅当 dim8 实测表现 ≤ 4 / 10,或 ≥ 3 个维度同时 ≤ 4,单点修补已不够时,整段重写。必须用户确认,且重写版仍走 Phase 3 validation gate。
设计 held-out 测试(Phase 1 已备,禁用训练过的 prompt):
test prompt 样例集(本 skill 自测用,他 skill 仿此结构):
before/after 对比:spawn 独立子 agent 各跑一遍(带 skill vs 不带 baseline),盲评。
接受准则(严格提升才保留):
dry_run 降级:子 agent 不可用时退化为干跑(模拟执行思路),results 标注 dry_run;dry_run > 30% → ⚠️ 评估失效警告。
optimize/<skill>-YYYYMMDD)。references/optimization-log.md(note 列写失败原因:归因不明 / Δ<0 / 触发变差)。subagent frontmatter ≠ skill frontmatter,诊断时适配:
| 维度 | skill 适配 | subagent 适配 |
|------|-----------|--------------|
| dim1 frontmatter | name/description/when_to_use/disable-model-invocation | name/description/tools/model(body=system prompt,禁依赖继承的 CC prompt) |
| dim3 失败模式 | skill 正文 if-then | body 须要求工具失败显式标注 [工具失败:原因],否则主对话把错误摘要当有效数据消费 |
| dim4 检查点 | 🔴 视觉标记 | subagent 无用户交互,检查点上移到委派 prompt |
| dim7 架构 | progressive disclosure | tools 字段最小化(不列继承全部)+ 嵌套 ≤ 5 层 |
| 实测 | test prompt 对比 | 委派真实任务,验返回摘要是否含错误混入 |
subagent 工具继承例外(即使列了也不给):AskUserQuestion / EnterPlanMode / ExitPlanMode / ScheduleWakeup / WaitForMcpServers。Explore/Plan 跳过 CLAUDE.md——若规则必须到达,委派 prompt 重述。
| 触发条件 | 一线修复 | 仍失败兜底 |
|----------|---------|-----------|
| 改完 skill 行为没变 | 新 session 或重新 /skill-name invoke(invoke 后 session 不重读文件) | 见 skill-author Phase 6 |
| validation gate Δ<0 | 回滚,查是否多变量同改 | 降为单变量重试;仍负 → 标记 known limitation |
| judge 分歧大(共识度低) | 加第 3 个 judge 或换 full_test 实测 | 标注「评估不可信」,人审 |
| dry_run > 30% | 补 full_test(spawn 真实子 agent 跑 test prompt) | 评估失效,仅出建议不改盘 |
| 触发词变更致下游 break | 回滚触发词,body 内补关键词 | 新建 skill 而非原地改(破坏性变更) |
| 9 维评分无法归因 | 拆为更小编辑单元 | 路由 /darwin-skill 做 MAX_ROUNDS hill-climbing |
| runtime 红灯命中 | P0 先修 runtime drift | 见 darwin runtime-neutrality.md |
| # | 反模式 | 后果 | 正例 |
|---|--------|------|------|
| 1 | 同 context 自评自改 | 乐观偏差(46.4% 准确率) | spawn 独立子 agent 评分 |
| 2 | 跳过 test prompt 直接评分 | dim8 凭空打分(权重 23%) | Phase 1 强制备 2-3 prompts |
| 3 | 轮内改多个维度 | 归因失效 | 每轮 1 维度(或 1 相关簇) |
| 4 | dry_run 比例高当满分 | 分数虚高,0 revert | 强制 ≥ 1 full_test |
| 5 | 凭「必须」措辞代替视觉标记 | LLM 扫标记优先于语义 | 🔴 / 🛑 标记 |
| 6 | 两列 fallback(症状/解法) | 缺兜底路径 | 三段式(触发/一线/兜底) |
| 7 | 硬凑 MAX_ROUNDS | over-engineering | Δ<2 连续 2 轮即停 |
| 8 | 静默跳过 git/tsv 异常 | ratchet 完整性破坏 | 异常先告知用户 |
| 9 | 单独优化 dim2 不看相关簇 | 已被前轮 dim3 修复推到顶 | HL-3 看相关簇短板 |
| 10 | 改 subagent body 不加错误标注 | 主对话消费错误摘要 | [工具失败:原因] 显式标注 |
| 11 | 整段重写不走 gate | 无法归因 + 可能 break | 重写仍走 Phase 3 |
| 12 | runtime 钉死单一平台 | 其他 agent 拒装 | 中立 badge + 措辞 |
完整素材见 references/:
| 文件 | 维度 | 主源 | |------|------|------| | dimensions.md | 9 维 rubric 全表 + HL-1~4 + 相关簇 | darwin-skill 本地 + SkillLens | | workflow.md | SkillOpt validation-gated loop + git ratchet + judge 独立性 | SkillOpt (arXiv 2605.23904) + darwin | | sources.md | 3 论文 + darwin 引用 + 实证数据 | arXiv / GitHub(2026-06-26 curl 核实) |
tools
UI/UX 与布局设计——做界面布局/结构/导航/组件/交互的设计决策。触发:做UI/UX/布局/排版/导航/组件/交互/栅格/响应式/图表选型/字体配对。按媒介路由 HTML/Web、原生 App(iOS/Android/桌面)、CLI、TUI。需后端动态系统不适用;配色/主题/色板走姊妹 skill design-color。
tools
主题与配色设计——做颜色搭配/调色板/主题/品牌色阶/暗模式的设计决策。触发:选配色/调色/主题/色板/品牌色/暗模式/对比度/色盲/UI风格。按媒介路由 HTML/Web(CSS变量)、原生App(平台token)、CLI(ANSI)、TUI(真彩/256/16降级)。保证可访问性(对比度/色盲安全)。需后端动态系统不适用;UI/UX 布局/组件/交互走姊妹 skill design-uiux。
tools
跨任意组件(plugin/skill/agent/command)的验证驱动优化循环纪律 skill。当用户要优化某个已有组件却无明确方向、或要防止改了反而更差(自评乐观偏差 / 多维同改归因失效 / 为凑分加废话膨胀)、或要把一套通用「评分→单变量改→改后验证严格更好才留否则回滚→触顶停」的纪律套到任意组件上时使用。管优化过程本身的纪律(validation gate / ratchet / 独立验证 / 触顶停),不评单组件深度(交 skill-dev),不查插件接线(交 plugin-dev)。仅手动 /optimize-any 触发。
data-ai
两层规则记忆 (基于 .skein/spec)。planning 时 recall 召回相关规则、task finish 后 sediment 沉淀学习 + prune 自动精简过期/重复/断链规则。core 常驻硬规 + recall 按需召回, 经判定门自动写盘 (不逐次问用户)。产出 .skein/spec 下 core/recall 规则文件 + index。另支持空仓 bootstrap 播种规则基线、记忆大面积失效 (大重构/换栈) 时 reconstruct 可逆归档后按项目类型分型重建、maintain 手动体检 (超预算/stale/断链/重复/废弃, --apply 自动修复)、auto-fix (Stop hook 写 .pending-fix 标记 → main 派 skein-specer bg 跑 maintain --apply 全自动修, 断链只报告)。