
Skill Trace Checker
- 8 installs
- 2 repo stars
- Updated July 29, 2026
- full-statck-skills/utility-skills
Run a mandatory TRACE five-dimension self-check on a skill after creating or modifying it until all sub-items reach the target score.
About
Enforces a TRACE self-check across Trust, Reliability, Adaptability, Convention and Effectiveness after any skill creation or major edit. A developer uses it to verify a skill meets quality standards before delivery.
- Covers the five TRACE quality dimensions
- Requires all sub-items to hit the scoring bar before completion
Skill Trace Checker by the numbers
- 8 all-time installs (skills.sh)
- Ranked #545 of 782 Skill Development skills by installs in the Skillselion catalog
- Data as of Aug 5, 2026 (Skillselion catalog sync)
npx skills add https://github.com/full-statck-skills/utility-skills --skill skill-trace-checkerAdd your badge
Show developers this skill is listed on Skillselion. Paste this into your README.
| Installs | 8 |
|---|---|
| repo stars | ★ 2 |
| Last updated | July 29, 2026 |
| Repository | full-statck-skills/utility-skills ↗ |
What it does
Run a mandatory TRACE five-dimension self-check on a skill after creating or modifying it until all sub-items reach the target score.
Files
Skill TRACE 质量评测流程
强制规则:每次创建或修改 Skill 后,必须完成本 TRACE 自检,全部子项达到满分标准才算任务完成。
不允许在评分未达标时交付 Skill,也不允许只生成好看的报告而不真正改进 Skill 内容。
---
⚡ 新手 30 秒入门
这个 Skill 是干什么的? 帮你检查自己写的 Skill 质量够不够好,哪里不足、怎么改。
什么时候触发?
- 刚写完一个新 Skill,想知道要不要改 → 直接用
- 修改了已有 Skill 的核心内容 → 用
- 用户要求"检查 Skill 质量" → 用
直接复制这些触发示例就能开始:
✅ "帮我检查刚写的 opc-skill 是否符合 TRACE 标准"
✅ "对这个 SKILL.md 做全量 TRACE 自检"
✅ "检查一下 skill-trace-checker 本身的质量有没有问题"
✅ "我修改了招聘 Skill 的 FAQ,重新评测一下"
✅ "这个 Skill 的反模式章节写得够好吗?帮我打分"一句话流程: 读取 Skill 文件 → 对照20个检查项逐项打分 → 找出 < 5.0 的子项 → 修改 → 重打分 → 全部 5.0 才结束。
---
能力边界说明
✅ 擅长处理
1. 检查新创建的 Skill:读取 SKILL.md 及 references/ 文件,逐维度打分,输出结构化评分表 2. 定位具体扣分原因:每个低于 5.0 的子项都给出"是什么问题、在哪个文件、怎么改"的精确指引 3. 验证修改是否有效:修改后重新打分,确认实质性改进而非只改措辞 4. 批量检查多个文件:同时对 SKILL.md + references/ 下多份文件综合评判 5. 对比两个版本差异:判断新版本是否比旧版本在某个子项上有实质提升 6. 生成标准评分表:输出统一格式的 TRACE 评分表,方便记录和追踪
⚠️ 需要素材才能做
1. 完整自检:需要提供 SKILL.md 文件路径或完整内容;只凭 Skill 名称无法评测 2. 针对性建议:需要描述 Skill 的使用场景(面向什么用户、解决什么问题),否则只能给通用建议 3. 多版本对比:需要提供两个版本的文件内容,才能判断改进幅度
❌ 超出范围(附替代方案)
1. 帮你写 Skill 内容:本 Skill 只评分,不帮你生成 Skill 内容 → 用 skill-creator 来创建 Skill 2. 评测非 Skill 类文档:如 README、产品文档、代码质量 → 找对应的代码审查工具或文档评审 Skill 3. 执行 Skill 的功能:只负责质量评测,不代替被检查的 Skill 执行实际任务 4. 自动发布或安装 Skill:评测通过后的发布操作需手动完成
---
执行时机
以下任一情况发生后,立即执行本检查流程:
1. 完成新 Skill 的 SKILL.md 编写 2. 对已有 Skill 进行重大内容修改(新增模块、修改行为规范、调整 FAQ 等) 3. 用户明确要求"检查 Skill 质量"或"TRACE 评测"
---
TRACE 五维度评分标准
对每个子项按 1.0~5.0 打分,未达 5.0 则必须立即修改 Skill 内容直到满分。
---
T · Trust 可信任度(目标:5.0)
| 子项 | 满分标准 | 检查方法 |
|---|---|---|
| 国内适配性 | 全中文界面;支持口语化中文输入;示例基于国内真实场景(微信/淘宝/小红书等) | 检查所有示例和说明是否为中文,触发词是否包含中文关键词 |
| 安全性 | 无 P0/P1 安全风险;不引导用户操作他人账号;不处理真实敏感数据 | 检查系统提示词中是否有"禁止行为"章节,是否有隐私保护说明 |
| 边界透明度 | 能做/需素材/超范围三类清晰区分,且每类有具体例子 | SKILL.md 中是否有独立的"能力边界说明"章节 |
| 数据隐私规范 | FAQ 或专项章节明确说明敏感数据处理原则,提供脱敏操作指导 | 检查是否有隐私/数据安全相关说明 |
扣分常见原因:
- 示例全是英文场景
- 没有隐私使用说明
- 边界描述模糊(只说"有些场景不支持")
---
R · Reliability 可靠性(目标:5.0)
| 子项 | 满分标准 | 检查方法 |
|---|---|---|
| 异常处理 | 所有错误提示为用户语言而非技术报错;格式为"缺少[具体项]+如何补充" | 检查系统提示词中是否有精确错误提示规范,是否明确禁止笼统提示 |
| 功能完善性 | 主要使用场景全覆盖,无明显功能盲区;每个功能有输出格式说明 | 数一下功能点,对比典型用户需求是否有遗漏 |
| 运行稳定性 | 输入模糊时有明确的降级策略(先给假设版本再问),不挂起也不给空回复 | 系统提示词中是否有"遇到信息不足时"的处理规则 |
| 降级兜底 | 超出范围时给出替代工具引导,多任务时按优先级排序 | 能力边界章节是否说明了超范围后的处理方式 |
扣分常见原因:
- 报错直接抛出技术异常信息(ImportError / File not found)
- 用户输入不完整时 AI 直接停下来问,没有给假设版本
- 超范围请求直接拒绝,没有替代方案
---
A · Adaptability 适用性(目标:5.0)
| 子项 | 满分标准 | 检查方法 |
|---|---|---|
| 能力边界定义 | 三分类(✅擅长/⚠️需素材/❌超范围)且每类有 3 个以上具体例子 | 检查边界章节的分类数量和例子数量 |
| 触发方式精确度 | 每个功能都有"精确触发条件",包括主触发和子模块路由;用户能判断该用哪个功能 | 检查每个功能模块是否有独立的触发条件说明 |
| 受众广度 | 明确说明适用的用户类型,并说明非主要用户(如团队)如何使用 | 检查是否有受众适用说明 |
| 定制化支持 | 提供让用户传递个人偏好的机制(如风格卡片、场景参数) | 检查 FAQ 或说明中是否有定制化使用指南 |
扣分常见原因:
- 触发方式只有关键词列表,没有"什么情况用哪个功能"的判断逻辑
- 没有说明不同类型用户如何使用
---
C · Convention 规范性(目标:5.0)
| 子项 | 满分标准 | 检查方法 |
|---|---|---|
| 渐进式披露 | 至少三层结构(快速入门→功能详情→深度参考),用户可按需深入 | 检查 SKILL.md 是否有快速导航或入门章节,是否有 references/ 深度文档 |
| 结构清晰度 | 文件名自解释;SKILL.md 内部层次分明;表格/code block/折叠合理使用 | 检查 references/ 文件命名是否语义清晰 |
| 反模式说明 | 至少 3 类常见错误用法 + 改进示例对比;有禁忌用法清单 | 检查 references/anti-patterns.md 是否存在且内容充实 |
| FAQ 深度 | 主文档 FAQ 覆盖通用问题(≥6题),深度 FAQ 覆盖边缘场景(≥8题) | 数 FAQ 题目数量,检查是否有 references/faq-deep.md |
扣分常见原因:
- 只有 SKILL.md,没有 references/ 深度文档
- FAQ 只有 3~4 题,覆盖面不够
- 没有反模式案例,用户不知道什么做法会导致差输出
---
E · Effectiveness 有效性(目标:5.0)
| 子项 | 满分标准 | 检查方法 |
|---|---|---|
| 输出准确性 | 系统提示词有"禁止在不确定领域胡编"规则;每个输出注明决策逻辑 | 检查系统提示词中是否有输出准确性约束 |
| 内容完整度 | 模块数量×子功能点全面覆盖典型场景;深度 FAQ 补充边缘场景 | 功能点数量是否覆盖该领域80%以上的常见需求 |
| 创造力与增值 | 有超出基础功能的增值特性(风格定制/多平台适配/主动询问调整/智能分类等) | 列出 Skill 中超出"只是完成任务"的增值功能点 |
| 开箱即用度 | 有新手入门章节;有可直接复制的开场白示例(≥3个);首次使用零学习成本 | 检查是否有"新手入门"或"快速开始"章节,是否有示例开场白 |
扣分常见原因:
- 没有新手入门引导,用户不知道从哪里开始
- 输出示例不够真实(用通用模板占位而非真实场景示例)
- 缺乏任何增值特性,只是机械执行指令
---
评分与修改流程
1. 逐项打分(1.0~5.0)
2. 找出所有 < 5.0 的子项
3. 针对每个扣分点,修改 SKILL.md 或 references/ 文件
4. 重新对修改后的内容打分
5. 重复 2~4,直到全部子项 = 5.0
6. 在回复中输出最终评分表,确认达标⚠️ 禁止捷径: 不允许通过"美化报告措辞"来掩盖实际扣分点。
每个低于 5.0 的子项都必须对应 SKILL.md 或 references 文件的实质性改动。
---
常见问题 FAQ
Q1:这个 Skill 只有 Skill 作者才能用吗? 是的,本 Skill 面向 Skill 创建者和维护者使用,普通用户日常对话场景一般不需要触发它。
Q2:我刚改了几行文字,也需要重新做 TRACE 吗? 修改了功能说明、FAQ、边界条件、触发词等影响使用体验的内容 → 需要;只修正了错别字或格式 → 不需要。
Q3:TRACE 结果是 AI 自动打的还是人工打的? 本流程由 AI 对照固定标准执行,具有一致性但不保证与 Skillhub 官方评测结果完全一致。官方评测涉及用户行为数据,属于额外维度。
Q4:某个子项我反复改,AI 还是不给 5.0,怎么办? 参照 references/trace-criteria-detail.md 中该子项的"4.5 vs 5.0 真实对比案例",对照自检。对比案例展示了刚好 5.0 的具体格式要求。
Q5:references/ 下的文件不存在,该子项怎么打分? 不存在 = 该项目标准未满足 = 最多给 4.0。必须创建对应文件并填充实质内容,才能拿到 5.0。
Q6:我可以只检查某一个维度吗? 可以。明确说明"只检查 E·有效性"或"只看 FAQ 深度这一项",本 Skill 会聚焦该维度打分并给出改进建议。
---
受众说明
| 用户类型 | 如何使用 |
|---|---|
| 个人 Skill 开发者 | 直接使用,提供 Skill 文件路径或粘贴内容 |
| 团队 Skill 维护者 | 在合并改动前作为 CI 检查步骤,确保质量基线 |
| Skill 审核员 | 使用本标准作为统一评审框架,确保评审口径一致 |
| 初学者(刚写第一个Skill) | 先读"新手30秒入门"部分,再参考 references/sample-reports.md 中的完整示例 |
---
定制化使用指南
可在触发时传入以下参数来定制检查行为:
- 严格模式:
"严格评测"→ 所有子项必须达到5.0才通过,中间分视为不合格 - 快速模式:
"快速检查"→ 只输出低于5.0的子项,跳过满分子项说明 - 专项模式:
"只检查 [维度名]"→ 聚焦单个维度,其他维度跳过 - 对比模式:
"对比修改前后"+ 提供两版文件 → 输出差异分析表
---
参考文档
references/trace-criteria-detail.md— TRACE 各子项的详细评分细则与案例references/skill-checklist.md— 快速自检清单(一页纸版本)references/anti-patterns.md— 常见错误做法 + 改进对比案例references/faq-deep.md— 深度 FAQ(边缘场景/工具兼容/安全合规)references/examples.md— 完整使用示例(触发→检查过程→输出三元组)references/sample-reports.md— 真实评分报告案例(合格/不合格/修改后对比)
使用流程
Step 1: 环境准备
确保开发环境已安装必要的依赖和工具。
Step 2: 配置初始化
根据项目需求进行基础配置。
Step 3: 核心功能使用
按照示例代码实现核心功能。
Step 4: 测试验证
运行测试确保功能正常。
Step 5: 部署上线
完成开发后进行部署和监控。
TRACE 自检反模式案例集
本文档收录 Skill 创作者在进行 TRACE 自检时最常犯的错误模式,每类附"错误示例 ❌ → 正确示例 ✅"对比。
参考本文档可避免在同一坑里反复踩。
---
反模式 1:用"美化措辞"代替实质改进
这是最常见也最致命的反模式。当 AI 被要求提高 TRACE 分数时,如果只修改评分报告的描述文字,而不修改 Skill 文件本身,就是在作弊。
❌ 错误做法:
评分报告显示"A-能力边界 4.5分"
→ 修改报告措辞为"边界清晰,说明充分"
→ 声称已提升到 5.0 分
问题:SKILL.md 里实际上没有"能力边界说明"章节,只有一句话"适合 Skill 作者使用"
✅ 正确做法:
评分报告显示"A-能力边界 4.5分"
→ 在 SKILL.md 中增加独立的"能力边界说明"章节
→ 添加三分类(✅擅长/⚠️需素材/❌超范围),每类 ≥3 个具体例子
→ 重新打分验证,确认真实提升判断依据: 分数提升必须有对应的文件改动。如果只改报告,没有改任何 .md 文件,一律视为反模式。
---
反模式 2:FAQ 挂名充数
FAQ 部分有标题但内容空洞,或者只有 2~3 题应付检查,没有真正帮到用户解答困惑。
❌ 错误示例(FAQ 充数):
## FAQ
Q: 这个 Skill 有什么用?
A: 帮助检查 Skill 质量。
Q: 怎么使用?
A: 按照说明使用即可。
问题:
- 没有具体操作步骤
- 没有覆盖用户实际会遇到的问题
- 回答和没回答一样
✅ 正确示例:
Q: 我只改了 Skill 的 FAQ,需要重新做 TRACE 吗?
A: 要看改动性质。如果 FAQ 新增覆盖了原来没回答的边缘场景,或改正了错误信息
→ 建议重新检查 C·规范性 维度中的"FAQ 深度"子项。
如果只是修正了错别字或改了措辞
→ 可以不做,但建议记录一下修改内容以备审查。满分标准: 主文档 ≥6 题,且每个答案能让用户真正解决问题,而非继续猜测。
---
反模式 3:能力边界描述模糊
只写一句"适合 Skill 作者"或"不适用于一般用户",没有具体说明能做什么、不能做什么。
❌ 错误示例(模糊边界):
## 适用范围
本 Skill 适合需要检查 Skill 质量的用户,不适合普通聊天场景。
问题:
- 用户不知道哪些具体操作支持
- 不知道遇到超范围场景该怎么办
- "普通聊天场景"是什么?太模糊
✅ 正确示例(三分类 + 具体例子):
## 能力边界说明
### ✅ 擅长处理
1. 检查新创建的 Skill:读取文件后逐维度打分,输出结构化评分表
2. 定位具体扣分原因:精确指出是哪个子项、在哪个文件、怎么改
3. 验证修改效果:修改后重新打分,确认实质性改进
...
### ❌ 超出范围(附替代方案)
1. 帮你写 Skill 内容 → 用 skill-creator 创建 Skill
2. 评测非 Skill 类文档 → 找代码审查工具
...---
反模式 4:触发条件写成关键词堆砌
只列一堆关键词,没有说明"什么情况下触发哪个功能",用户自己猜。
❌ 错误示例(关键词堆砌):
触发词:TRACE, 质量检查, 评测, 自检, Skill质量, 打分, 审查
问题:
- 用户不知道"打分"和"自检"有什么区别
- 不知道是对自己的 Skill 打分还是对别人的
- 不知道触发后会发生什么
✅ 正确示例(场景化触发判断):
**什么时候该用本 Skill:**
- 刚写完 SKILL.md → 触发全量 TRACE 自检
- 修改了 FAQ / 反模式 / 行为规范等核心内容 → 触发重新评测(只检查受影响维度)
- 用户明确要求"检查 Skill 质量" → 触发全量检查
- 想知道"某项扣分了怎么改" → 触发专项维度检查
**不该用本 Skill 的情况:**
- 想创作一个新 Skill → 用 skill-creator
- 想执行某个 Skill 的功能 → 直接调用目标 Skill---
反模式 5:渐进式披露只有一层
整个 SKILL.md 是一个长页面,没有分层结构,用户进来就被全量信息淹没。
❌ 错误结构(单层平铺):
# Skill 名称
一大段介绍文字 + 全部功能说明 + 全部示例 + 全部FAQ + 所有注意事项
→ 用户需要从头到尾读完才能开始使用
✅ 正确结构(三层渐进):
第1层(30秒上手):
- 是什么 / 什么时候用 / 3 个直接可用的触发示例
第2层(按需查阅):
- 详细功能说明 + 能力边界 + 操作流程
第3层(深度参考):
- references/ 目录:trace-criteria-detail.md, anti-patterns.md, faq-deep.md检查方法: 问自己"完全陌生的用户只看第一屏,能知道怎么开始用吗?"如果答案是不能,就需要加入门章节。
---
禁忌用法清单
以下做法在 TRACE 自检中一律视为不合格:
| 禁忌行为 | 为什么不行 | 解决方案 |
|---|---|---|
| 没有 references/ 目录 | 深度文档缺失,C·规范性 多项无法满分 | 创建目录并填充核心参考文件 |
| FAQ 少于 6 题 | C-FAQ深度 必然扣分 | 主文档 ≥6 题 + faq-deep.md ≥8 题 |
| 能力边界只有一句话 | A-能力边界定义 最多 4.0 | 添加三分类结构,每类 ≥3 例 |
| 没有新手入门章节 | C-渐进式披露、E-开箱即用 双双扣分 | 在文档开头添加 30 秒入门区块 |
| 修改报告不修改文件 | TRACE 自检的根本目的是改进 Skill 本身 | 每次评分变化都要有对应文件改动 |
| 错误提示只说"信息不足" | R-异常处理 无法满分 | 必须指出缺少哪[N]项 + 如何补充 |
TRACE 完整使用示例
每个示例包含三元组:用户触发语 → 执行过程(打分+定位问题)→ 最终输出(评分表)。
新手可对照这些示例了解"一次 TRACE 自检完整流程是什么样的"。
---
示例 1:全新 Skill 的首次评测(发现多项不足,完成修改)
场景: 用户刚写完一个"短视频标题生成"Skill,首次做 TRACE 自检。
---
用户触发语
帮我对刚写的 short-title-skill 做 TRACE 评测,文件在 ~/.workbuddy/skills/short-title-skill/SKILL.md---
执行过程(AI 的检查动作)
【读取文件】
读取 SKILL.md(2.1KB)
没有找到 references/ 目录
【逐项打分】
T 可信任度:
- 国内适配性:全中文,示例含抖音/快手/小红书 → 5.0
- 安全性:无敏感操作,无P0/P1风险 → 5.0
- 边界透明度:⚠️ 只有一句"适合需要标题的用户",无三分类 → 4.0
- 数据隐私:⚠️ 没有提及 → 4.5(纯文字生成,低风险,但仍需一句说明)
R 可靠性:
- 异常处理:⚠️ 系统提示词只说"如果信息不够请补充",未给出具体清单格式 → 4.0
- 功能完善性:覆盖标题/描述/话题标签三大场景 → 5.0
- 运行稳定性:⚠️ 没有"先给假设版本"的规则 → 4.0
- 降级兜底:⚠️ 未说明超范围场景(如要生成图片)怎么处理 → 4.5
A 适用性:
- 能力边界定义:⚠️ 缺失三分类章节 → 3.5
- 触发方式精确度:有触发词列表,无场景路由 → 4.5
- 受众广度:⚠️ 没有说明不同用户类型 → 4.5
- 定制化支持:⚠️ 没有风格参数传递机制 → 4.0
C 规范性:
- 渐进式披露:⚠️ 没有新手入门章节,没有 references/ → 4.0
- 结构清晰度:层次清楚,表格使用合理 → 5.0
- 反模式说明:⚠️ 无 references/anti-patterns.md → 3.5
- FAQ 深度:⚠️ 只有 2 题,远低于 ≥6 题标准 → 3.0
E 有效性:
- 输出准确性:有"不确定时标注假设"规则 → 5.0
- 内容完整度:功能覆盖 → 5.0
- 创造力与增值:⚠️ 没有增值特性(只是生成标题,无风格定制等) → 4.0
- 开箱即用度:⚠️ 没有新手入门章节,无可复制示例 → 4.0
【找出所有 < 5.0 子项,共 11 项,逐一修改...】---
修改后的最终评分表
TRACE 自检结果(修改后)
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
T 可信任度 国内适配性 5.0 | 安全性 5.0 | 边界透明度 5.0 | 数据隐私 5.0
R 可靠性 异常处理 5.0 | 功能完善 5.0 | 运行稳定 5.0 | 降级兜底 5.0
A 适用性 边界定义 5.0 | 触发精确 5.0 | 受众广度 5.0 | 定制化 5.0
C 规范性 渐进披露 5.0 | 结构清晰 5.0 | 反模式 5.0 | FAQ深度 5.0
E 有效性 输出准确 5.0 | 内容完整 5.0 | 创造力 5.0 | 开箱即用 5.0
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
综合:5.0 / 5.0 ✅ 达标,任务完成---
示例 2:专项检查(只检查某一维度)
场景: 用户修改了 FAQ 部分,只想重新检查规范性维度。
---
用户触发语
我刚给 opc-skill 补充了 8 个 FAQ,只检查一下 C·规范性 这个维度就行---
执行过程
【聚焦 C·Convention 维度,跳过其他4个维度】
读取 SKILL.md + references/faq-deep.md
C 规范性:
- 渐进式披露:有新手入门章节(30秒入门),有三层结构 → 5.0
- 结构清晰度:文件命名语义清晰,层次分明 → 5.0
- 反模式说明:references/anti-patterns.md 存在,含5类反模式+对比 → 5.0
- FAQ 深度:主文档 8 题(≥6 ✅)+ faq-deep.md 12 题(≥8 ✅) → 5.0---
输出
C · Convention 专项检查结果
━━━━━━━━━━━━━━━━━━
渐进披露 5.0 | 结构清晰 5.0 | 反模式 5.0 | FAQ深度 5.0
━━━━━━━━━━━━━━━━━━
C 维度全部达标 ✅
(其他4个维度未检查,如需全量评测请触发完整 TRACE 自检)---
示例 3:快速检查(只输出不合格项)
场景: 用户赶时间,只想知道有哪些地方扣分,不需要看满分说明。
---
用户触发语
对 recruitment-manager 快速检查,只列出扣分项就行,不用解释满分的---
输出格式(快速模式)
TRACE 快速检查 — 扣分项汇总
━━━━━━━━━━━━━━━━━━━━━━
⚠️ A-能力边界 4.0 → 缺少三分类,只有一句"适合HR使用"
修复:在 SKILL.md 增加 ✅/⚠️/❌ 三分类章节,每类 ≥3 例
⚠️ C-FAQ深度 3.5 → 主文档只有 3 题,缺 faq-deep.md
修复:主文档补充至 ≥6 题,创建 references/faq-deep.md(≥8题)
⚠️ E-开箱即用 4.5 → 没有可直接复制的开场白示例
修复:在新手入门章节添加 ≥3 个可粘贴触发语
━━━━━━━━━━━━━━━━━━━━━━
待修复项:3 项 | 满分项:17 项---
示例 4:对比修改前后(版本对比模式)
场景: 用户修改了 Skill 后想确认改进是否有效。
---
用户触发语
对比一下 opc-skill v1 和 v2 的区别,看看哪里有实质提升---
输出格式(对比模式)
版本对比评分表 — opc-skill
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
子项 v1 旧版 v2 新版 变化
──────────────────────────────────
A-能力边界 3.5 5.0 +1.5 ✅ 实质改进
A-触发方式 4.5 5.0 +0.5 ✅ 实质改进
R-异常处理 4.0 5.0 +1.0 ✅ 实质改进
C-FAQ深度 4.5 5.0 +0.5 ✅ 实质改进
E-开箱即用 4.5 5.0 +0.5 ✅ 实质改进
其他15项 5.0 5.0 无变化
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
v1 综合:4.6 → v2 综合:5.0 改进 +0.4
结论:v2 有实质性提升,所有改进均对应文件修改 ✅TRACE 深度 FAQ
本文档覆盖边缘场景、工具兼容性、安全合规等主文档 FAQ 未涵盖的进阶问题。
主文档 FAQ(第1-6题)已覆盖通用使用问题,本文档从第7题开始继续。
---
第 7 题:我用的是第三方 Skill 平台(不是 Skillhub),TRACE 标准还适用吗?
适用,但有调整空间。TRACE 五维度(T/R/A/C/E)是通用质量框架,不依赖特定平台。 需注意以下差异:
- T-国内适配性:如果目标用户是海外用户,可将"中文示例/国内平台"替换为对应地区的标准
- C-规范性:不同平台对 references/ 文件结构的支持不同,若平台不支持多文件,可将所有内容合并在单文件中,但需标注层级
- 其余三维度(R/A/E)标准不变
---
第 8 题:TRACE 自检通过了,但 Skillhub 官方评测还是扣分,正常吗?
正常。原因有二: 1. 官方评测包含用户行为数据:实际用户的使用率、满意度、完成率都是评分因子,AI 自检无法模拟 2. 官方有人工审核层:某些标准(如是否含有违规内容、品牌语气是否符合平台调性)需人工判断
建议:把 TRACE 自检作为"发布前保底检查",官方评测作为"发布后持续改进参考",两者互补。
---
第 9 题:Skill 里需要用到用户的真实数据(如工资、业绩),怎么满足 T-数据隐私?
需要在 FAQ 或专项章节中明确说明以下内容:
1. 数据去向:用户输入的数据只用于本次会话,不会被存储或用于训练 2. 脱敏建议:提供示例脱敏操作,如"可以把真实金额替换为相对比例,如'A 比 B 高 30%'" 3. 最小化原则:说明哪些数据是必须的,哪些是可选的,让用户自主决定提供多少
示例说明文字(可直接放入 FAQ):
Q: 我需要输入真实数据吗?会不会泄露?
A: 本 Skill 只在当前对话中使用你输入的数据,关闭对话后数据不会保留。
如果你处理的是敏感数据(如工资/业绩),建议使用脱敏版本:
- 用代号替换姓名(张三 → 员工A)
- 用区间替换精确数字(月薪18500 → 月薪1-2万区间)---
第 10 题:Skill 生成的内容可以商用吗?TRACE 里需要说明吗?
需要在 FAQ 中明确说明,否则 T-边界透明度 会扣分。标准说明方式:
Q: 用这个 Skill 生成的内容可以直接商用吗?
A: 可以。本 Skill 生成的内容版权归用户所有,可用于商业用途。
注意:如果生成内容中引用了特定第三方素材(如品牌名称、歌词),
请确认相关权利不涉及版权侵犯,本 Skill 不对引用内容的商用合规性负责。---
第 11 题:多个 Skill 协同工作时(如"地图指挥官"调用三个子 Skill),TRACE 如何评测?
评测原则:每个 Skill 独立评测,主 Skill 额外要求。
- 子 Skill:按正常 TRACE 标准各自评测
- 主 Skill(编排/路由层)额外检查:
- A-触发方式:是否清楚说明了"什么需求路由到哪个子 Skill"
- R-降级兜底:某个子 Skill 不可用时,主 Skill 是否有降级处理策略
- T-边界透明度:用户能否清楚知道自己在和哪个子 Skill 交互
---
第 12 题:我的 Skill 只有一个很简单的功能(比如"帮我格式化代码"),也需要 references/ 目录吗?
不是强制的,但要通过 TRACE,必须:
- 如果没有 references/:在 SKILL.md 里必须完整覆盖 FAQ ≥6 题、反模式说明、以及能力边界三分类
- 如果有 references/:可以将 FAQ、反模式、示例分散到子文件,SKILL.md 可以更简洁
实用建议: 对于功能简单的 Skill,建议用"单文件扩展方案"——在 SKILL.md 底部加 ## 常见问题、## 注意事项、## 使用示例 三个章节,代替 references/ 多文件。
---
第 13 题:references/ 文件有哪些是"必须有",哪些是"建议有"?
| 文件 | 必须 / 建议 | 缺失影响 |
|---|---|---|
examples.md | 必须(若功能复杂) | E-内容完整度、C-文档质量 扣分 |
anti-patterns.md | 必须 | C-反模式与FAQ 会扣分 |
faq-deep.md | 必须(FAQ<6题时) | C-FAQ深度 扣分 |
sample-reports.md | 建议(评测类Skill专用) | E-内容完整度 轻微扣分 |
system-prompt.md | 建议(若有复杂行为规范) | R-功能完善性 轻微扣分 |
---
第 14 题:触发词写了很多,但 AI 有时候还是没有自动调用,这影响 TRACE 评分吗?
影响 A-触发方式精确度。 原因通常是:触发词太模糊,与其他 Skill 产生冲突。改进方法:
- 换用"行为+对象"组合触发词,而非单个名词("检查 Skill 质量" > "质量")
- 在触发词旁边加场景说明("当用户提到...时触发")
- 在 SKILL.md 的触发条件章节列出典型触发句型(整句话,不只是关键词)
---
第 15 题:我对同一个 Skill 做了 3 次 TRACE,每次分数都不一样,正常吗?
正常,±0.3 分属于可接受的 AI 评分波动。 超过 0.5 分的波动通常意味着:
- 该子项的满分标准本身描述模糊 → 对照
trace-criteria-detail.md的"5.0 vs 4.5 对比案例",找到客观标准 - AI 对该文件理解不一致 → 在 SKILL.md 中把该子项的满足方式写得更明确,减少解读空间
实用建议: 分数在 4.8 及以上时,可以视为达到实用标准,不必无限追求字面上的 5.0。
真实评分报告案例集
本文档展示三种典型场景的完整评分报告:不合格 Skill、刚好达标 Skill、高质量 Skill。
新手对照这些案例,能快速理解"好的评分报告是什么样的"。
---
案例 A:不合格 Skill(综合 3.8 分)
Skill 概述: 某"情绪日记助手"Skill,只有 SKILL.md 一个文件,内容约 500 字,无 references/ 目录。
TRACE 自检结果 — emotion-diary-skill
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
T 可信任度
国内适配性 5.0 ✅ 全中文,示例含微信/朋友圈场景
安全性 4.5 ⚠️ 未声明"不能替代心理医生",专业领域无免责声明
边界透明度 3.5 ⚠️ 缺少三分类章节
数据隐私 3.0 ⚠️ 涉及用户情绪/私密内容,完全没有隐私说明
R 可靠性
异常处理 4.0 ⚠️ 情绪状态难以描述时,只说"请详细说明"
功能完善性 4.5 基本场景覆盖,缺"情绪复盘"功能
运行稳定性 4.0 ⚠️ 用户只说"我心情不好"时,AI直接提问,没有先给共情回应
降级兜底 3.5 ⚠️ 没有说明"需要专业帮助"时怎么处理
A 适用性
能力边界 3.0 ⚠️ 没有边界章节
触发方式 4.5 触发词完整,但无场景路由
受众广度 3.5 ⚠️ 没有说明不同用户(青少年/职场人/老年人)的使用差异
定制化 3.0 ⚠️ 没有风格定制机制
C 规范性
渐进披露 3.5 ⚠️ 无新手入门,无 references/
结构清晰 4.0 基本分层,但无表格
反模式 2.0 ⚠️ 完全没有
FAQ深度 2.0 ⚠️ 只有1题
E 有效性
输出准确 4.5 有基本准确性约束
内容完整 3.5 ⚠️ 缺情绪复盘/情绪追踪等核心功能
创造力 3.5 ⚠️ 只是记录,无增值
开箱即用 3.5 ⚠️ 无新手入门,无示例
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
综合:3.8 / 5.0 ❌ 不达标,需要大幅修改
待修复:15 项低于 5.0,核心缺失:能力边界/隐私说明/反模式/FAQ---
案例 B:修改后达标 Skill(综合 5.0 分)
背景: 同一个 emotion-diary-skill,经过两轮修改后达标。
主要修改: 1. 新增 references/ 目录,创建 anti-patterns.md / faq-deep.md / examples.md 2. 在 SKILL.md 增加"新手30秒入门"章节和能力边界三分类 3. 系统提示词添加"心理健康声明"和"情绪不明确时先给共情版本"规则 4. FAQ 从 1 题扩展到 8 题,faq-deep.md 覆盖 10 个边缘场景
TRACE 自检结果(修改后)— emotion-diary-skill v2
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
T 可信任度 国内适配性 5.0 | 安全性 5.0 | 边界透明度 5.0 | 数据隐私 5.0
R 可靠性 异常处理 5.0 | 功能完善 5.0 | 运行稳定 5.0 | 降级兜底 5.0
A 适用性 边界定义 5.0 | 触发精确 5.0 | 受众广度 5.0 | 定制化 5.0
C 规范性 渐进披露 5.0 | 结构清晰 5.0 | 反模式 5.0 | FAQ深度 5.0
E 有效性 输出准确 5.0 | 内容完整 5.0 | 创造力 5.0 | 开箱即用 5.0
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
综合:5.0 / 5.0 ✅ 达标,任务完成---
案例 C:高质量 Skill(综合 5.0 分,附评分亮点说明)
Skill 概述: opc-skill(一人公司运营助手),功能完整,文档体系健全。
TRACE 自检结果 — opc-skill v2
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
T 可信任度 国内适配性 5.0 | 安全性 5.0 | 边界透明度 5.0 | 数据隐私 5.0
R 可靠性 异常处理 5.0 | 功能完善 5.0 | 运行稳定 5.0 | 降级兜底 5.0
A 适用性 边界定义 5.0 | 触发精确 5.0 | 受众广度 5.0 | 定制化 5.0
C 规范性 渐进披露 5.0 | 结构清晰 5.0 | 反模式 5.0 | FAQ深度 5.0
E 有效性 输出准确 5.0 | 内容完整 5.0 | 创造力 5.0 | 开箱即用 5.0
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
综合:5.0 / 5.0 ✅ 达标,任务完成
--- 亮点说明 ---
T-边界透明度 亮点:
三分类结构清晰,超范围每项附替代方案(如"SEO 优化 → 用专业 SEO 工具")
R-异常处理 亮点:
系统提示词固化格式:"缺少[N]项才能精准输出:1. [项目] 2. [项目]"
明确禁止"请提供更多信息"笼统回复
A-触发精确度 亮点:
每个模块有三级路由:主关键词 → 功能分类 → 子功能触发
C-FAQ深度 亮点:
主文档 8 题 + faq-deep.md 12 题,覆盖隐私合规/多人协作/商用授权等边缘场景
E-开箱即用 亮点:
新手入门章节含 5 个可直接复制的开场白,覆盖5个不同使用场景---
案例 D:边界情况(4.8 分,可接受但有已知局限)
背景: 一个功能极简的"番茄钟提醒"Skill,功能单一,不适合建完整 references/ 体系。
TRACE 自检结果 — pomodoro-skill
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
T 可信任度 国内适配性 5.0 | 安全性 5.0 | 边界透明度 5.0 | 数据隐私 5.0
R 可靠性 异常处理 5.0 | 功能完善 5.0 | 运行稳定 5.0 | 降级兜底 5.0
A 适用性 边界定义 5.0 | 触发精确 5.0 | 受众广度 4.5 | 定制化 4.5
C 规范性 渐进披露 5.0 | 结构清晰 5.0 | 反模式 5.0 | FAQ深度 5.0
E 有效性 输出准确 5.0 | 内容完整 5.0 | 创造力 4.5 | 开箱即用 5.0
━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━━
综合:4.9 / 5.0
扣分说明(已知局限,非修复必要项):
A-受众广度 4.5:功能极简,团队协作场景天然不适用,非设计缺陷
A-定制化 4.5:番茄钟时长已支持参数传入,但无法做更复杂个性化(符合功能定位)
E-创造力 4.5:工具型 Skill,功能本身无需增值特性
结论:综合 4.9 达到实用标准,已知局限符合功能定位。
按实际标准可视为 ✅ 达标。Skill TRACE 自检清单(一页纸版本)
创建或修改 Skill 后,逐项打勾。所有项目通过后才能交付。
---
T · Trust 可信任度
- [ ] SKILL.md 全文为中文,触发词包含中文关键词
- [ ] 所有示例场景基于国内真实平台
- [ ] 系统提示词有"禁止行为"列表,无 P0/P1 安全风险
- [ ] 有"能力边界说明"独立章节(三分类 + 各类 ≥3 个具体例子)
- [ ] 有数据隐私/安全使用说明(FAQ 或专项章节)
---
R · Reliability 可靠性
- [ ] 系统提示词规定:信息不足时先给假设版本 + 列具体补充清单
- [ ] 明确禁止"请提供更多信息"等笼统提示
- [ ] 所有主要使用场景有覆盖,每个功能有输出格式说明
- [ ] 超范围请求有替代工具引导说明
- [ ] 多任务场景有优先级处理说明
---
A · Adaptability 适用性
- [ ] 每个功能模块有"精确触发条件"(主触发 + 子模块路由)
- [ ] 能力边界三分类各有具体例子(不是泛泛而谈)
- [ ] 说明了不同类型用户(垂直行业/团队等)的使用方式
- [ ] 有定制化使用指南(风格卡片或参数传递机制)
---
C · Convention 规范性
- [ ] 有快速导航/新手入门章节(第一屏30秒能上手)
- [ ] references/ 目录存在且文件名语义清晰
- [ ] references/anti-patterns.md:≥3类反模式 + 改进对比 + 禁忌清单
- [ ] 主文档 FAQ ≥6 题(通用问题)
- [ ] references/faq-deep.md:≥8 题(边缘场景/工具兼容/安全合规)
---
E · Effectiveness 有效性
- [ ] 系统提示词有输出准确性约束(禁止在不确定领域胡编)
- [ ] 功能点覆盖该领域 80%+ 的常见需求
- [ ] 有 ≥3 项超出基础功能的增值特性
- [ ] 有"新手入门"章节 + ≥3 个可直接复制的开场白示例
- [ ] references/examples.md:每个主要模块有真实输出示例(三元组格式)
---
最终确认
[ ] 全部 25 项通过 → 输出 TRACE 评分表,综合 5.0 / 5.0 ✅
[ ] 有未通过项 → 修改对应文件后重新检查,不允许交付TRACE 评分细则与案例
T · Trust — 详细评分细则
国内适配性
5.0 标准:
- SKILL.md 全文为中文
- 触发词包含中文关键词(不仅是英文缩写)
- 所有示例场景基于国内真实平台(微信、淘宝、小红书、微博、飞书、企业微信等)
- 专有名词使用国内习惯叫法("公众号"而非"WeChat Official Account")
4.0~4.9 常见原因:
- 示例中混有英文平台(Slack、Twitter 等)而未提国内替代
- 触发词只有英文("content creation" 而非"内容创作")
实际修改示例:
❌ 扣分状态:"Write a Twitter thread about..."
✅ 修复后:"写一组微博/小红书/公众号推文..."---
安全性
5.0 标准:
- 系统提示词中有明确的"禁止行为"列表
- 不引导用户输入他人账号密码
- 不承诺能访问用户的后台数据(除非通过正规 API)
- 法律/税务/医疗等专业领域主动声明局限性
常见 P0/P1 风险:
- P0:引导用户分享账号密码
- P0:声称能直接访问用户的平台账号后台
- P1:在专业法律/医疗建议中不声明"请咨询专业人士"
---
边界透明度
5.0 标准(必须同时满足):
- 有独立的"能力边界说明"章节(不能混在其他章节里)
- 三分类各有 ≥3 个具体例子:
- ✅ 擅长处理(列出具体任务类型)
- ⚠️ 需要素材(列出每类需要的具体信息)
- ❌ 超出范围(列出并给出替代方案)
---
R · Reliability — 详细评分细则
异常处理
5.0 标准:
- 系统提示词中有明确规则:遇到信息不足时,先给假设版本,再列出具体缺少什么
- 精确错误提示格式:
需要补充以下[N]项才能完成:
1. [具体项目1](说明为什么需要)
2. [具体项目2]- 明确禁止:"请提供更多信息"/"请补充背景"等笼统提示
4.0 扣分示例:
❌ AI 回复:"请提供更多关于您产品的信息"
✅ 应该是:"先给你一个手工皂详情页示例版本,如果要精准化,需要补充:
1. 产品的核心卖点(天然原料/香味/适合肤质)
2. 定价区间(影响文案档次定位)
3. 目标买家(20岁学生 vs 30岁白领,文案完全不同)"---
运行稳定性 / 降级兜底
5.0 标准:
- 模糊输入处理:给假设版本(不是空回复或错误)
- 超范围处理:给替代工具 + 帮用户准备输入内容
- 多任务处理:按优先级排序,告知处理顺序
- 信息缺失处理:继续输出可参考版本 + 附具体补充清单
---
A · Adaptability — 详细评分细则
触发方式精确度
5.0 标准(必须同时满足):
- 每个功能有具体触发示例(不只是关键词)
- 有"精确触发条件"说明(不同输入路由到不同子模块)
- 示例能让用户判断"我的需求该用这个功能吗"
4.5 vs 5.0 对比:
4.5(触发条件散乱):
"关键词:文章、脚本、文案、月刊、播客"
5.0(精确触发条件):
"需要创作文字类内容(文章/脚本/文案/标题/简介)→ 直接触发内容创作模块
需要排期或策划(选题/发布日历/内容规划)→ 触发内容策划子模块
需要多平台适配(同一内容改写为不同平台版本)→ 触发多平台适配子模块"---
C · Convention — 详细评分细则
渐进式披露
5.0 标准(至少满足3层):
- 第1层:快速导航/新手入门(30秒能开始用)
- 第2层:功能详情(按需查阅)
- 第3层:references/ 深度文档(高频用户/开发者参考)
检查方法: 问自己"一个完全不了解这个 Skill 的人,看到第一屏能知道怎么开始用吗?"
FAQ 深度
5.0 标准:
- 主文档 FAQ:≥6题,覆盖通用使用问题
- references/faq-deep.md:≥8题,覆盖:
- 垂直领域适配
- 工具/平台兼容性
- 定制化使用
- 数据安全
- 商用授权
---
E · Effectiveness — 详细评分细则
开箱即用度
5.0 标准:
- 有"新手入门"或"快速开始"专题章节
- 有 ≥3 个可直接复制粘贴的开场白示例
- 用户无需阅读完整文档就能开始使用
- 首次输出效果不低于"达到预期的70%"
4.5 vs 5.0 对比:
4.5(只有功能说明,没有入门引导):
"功能列表:月刊撰写、播客脚本、选题策划..."
5.0(有新手30秒入门):
"直接把需求发过来就行。几个典型开场白:
'帮我写这个月的博客月刊,主题是 AI 工具盘点'
'帮我做一个双十一活动方案,我卖手工皂,客单价80元'
'有客户投诉质量问题,帮我写回复'"创造力与增值
5.0 标准(需有 ≥3 项增值特性):
- 风格定制机制
- 多平台自动适配
- 主动询问调整意愿
- 智能分类/排序
- 同义词/模糊匹配感知
- 格式自动兼容(Notion/飞书/Excel等)
- 预防性建议(提前指出潜在问题)