
System Study
- 9 installs
- 739 repo stars
- Updated July 27, 2026
- yunshu0909/yunshu_skillshub
Helps with ai & agent building tasks.
About
system-study is a Claude Code skill for ai & agent building. It helps solo builders move faster with AI-assisted coding.
- system-study
- AI & Agent Building
- AI-coding skill
System Study by the numbers
- 9 all-time installs (skills.sh)
- Ranked #12,152 of 16,546 AI & Agent Building skills by installs in the Skillselion catalog
- Data as of Aug 2, 2026 (Skillselion catalog sync)
npx skills add https://github.com/yunshu0909/yunshu_skillshub --skill system-studyAdd your badge
Show developers this skill is listed on Skillselion. Paste this into your README.
| Installs | 9 |
|---|---|
| repo stars | ★ 739 |
| Last updated | July 27, 2026 |
| Repository | yunshu0909/yunshu_skillshub ↗ |
What it does
Helps with ai & agent building tasks.
Files
System Study — 系统化学习材料生成
你要学一个新领域。AI 自主调研 + 搭体系 + 产出 HTML 学习材料。
和已有 skill 的本质区别:
- vs long-research:那个是"有困惑 → 求结论";这个是"想学 → 求体系"
- vs case-radar:那个给散点案例集;这个给系统化全貌
- vs readable-output:那个处理已有素材;这个自己挖素材 + 自己建体系(最后可调用它做出稿,但不是核心)
这个 skill 的差异化命门:除了"骨架 + 案例 + 工程化"这些教科书必讲的部分,强制产出"争议焦点 + 盲区清单"两块——这是普通学习材料没有的,是用户研究 → 内容/产品的金矿。
---
5 阶段流程总览
| 阶段 | 名称 | 介入次数 | 产物 | 详细操作 |
|---|---|---|---|---|
| 1 | 题目收敛 | 1 次(必) | 01-题目确认.md | reference/stage-1-topic-narrow.md |
| 2 | 调研计划 | 1 次(默认) | 02-调研计划.md | reference/stage-2-research-plan.md |
| 3 | Sub-agent 并行调研 | 0 次 | 03-调研笔记/A-E.md | reference/stage-3-subagent-templates.md ⭐ |
| 4 | 体系搭建+大纲确认 | 1 次(默认) | 04-体系大纲.md | reference/stage-4-synthesis.md |
| 5 | HTML 学习材料 | 0 次 | 05-学习材料.html | reference/stage-5-html-spec.md |
默认严格逻辑:阶段 1/2/4 都问用户。但用户可一次性说"全程不打扰、直接出 HTML",跳过 2、4。阶段 1 永远不能省——题目错了后面全白干。
用户授权"全程不打扰"快速通道
如果用户在阶段 1 / 2 / 任何阶段说出"你直接来吧 / 直接给我结果就行 / 你自己定 / 你判断 / 全程不打扰"——主线程立即切换到快速通道:
1. 阶段 1 依然要问(用 AskUserQuestion 弹切片)——题目永远不能 AI 替用户拍 2. 阶段 2 仍然写 `02-调研计划.md` 存档,但不再问用户,直接进阶段 3 3. 阶段 4 仍然写 `04-体系大纲.md` 存档,但不再问用户,直接进阶段 5 4. 在 PLAN.md 标注"用户已授权全程不打扰"——这是审计线索
切换条件:用户的话里明确包含"直接 / 不打扰 / 自己定 / 自己判断 / 你来"等授权词。模糊表达(如"看着办")不算——继续按默认严格流程问。
---
核心设计原则(5 条)
这 5 条是从首发实战提炼的、贯穿整个 skill 的设计哲学。所有 stage 都遵循:
1. 必经卡点不省——阶段 1 题目收敛永远不能省。其他卡点用户可授权跳过,但题目错了全白干。 2. 强制要异见,禁止和稀泥——Agent E 不接受"两边都对"。每个议题必须给 X/10 倾向分。 3. 盲区清单独立成块——还没共识的、还在打架的、AI 互相复读的,独立段落,不混在其他内容里。 4. 用户研究视角主导——不走"基础→进阶→高阶"教材路线,按"我能拿来做什么"组织。允许带判断、带视角,不需要装客观。 5. HTML 独立写,不调 readable-output——学习材料需要侧栏导航 + 章节折叠 + 争议高亮 + 盲区独立区,长文阅读结构不够用。
---
5 个 Sub-agent 阵容(A-D 灵活 + E 必选)
详细 prompt 模板见 reference/stage-3-subagent-templates.md。
| Agent | 固定职责 | 主题适配方式 |
|---|---|---|
| A 骨架 | 官方文档 + 学派 / 主流方法 | 视主题决定具体源(提示词→Anthropic/OpenAI 文档;记忆系统→各家 memory 文档;MCP→协议文档+实现) |
| B 前沿 | 新形态、新趋势、最新讨论 | 视主题灵活——一句话定义"这领域最新的是什么" |
| C 真物 | 顶级案例 / 真实代码 / 原文拆解 | 必须看原文;案例数量按可信源能找到几个定 |
| D 生态 | 工具景观 / 工程化 / 应用场景 | 直接对接用户的产品决策 |
| E 争议+盲区 | 必选,强制双轨陈述 + 给倾向分 + 盲区清单 | 差异化命门——和市面学习材料的核心区别 |
主线程拿到题目后,根据主题情况微调每个 sub-agent 的具体调研范围(不是改职责类型,是改"查哪些源"),再批量派出。
---
工作流(主线程要做什么)
Step 0:建工作目录
<主题>学习/ # 默认目录名,可改
├── PLAN.md # 总控
├── 01-题目确认.md
├── 02-调研计划.md
├── 03-调研笔记/
│ ├── A-{骨架切片名}.md
│ ├── B-{前沿切片名}.md
│ ├── C-{真物切片名}.md
│ ├── D-{生态切片名}.md
│ └── E-争议与盲区.md
├── 04-体系大纲.md
└── 05-学习材料.htmlStep 1:题目收敛
- 用
AskUserQuestion(multiSelect: true)给用户 4 个切片选项让她勾 - 切片描述要具体到"覆盖什么",不要泛泛
- 用户全选也行(这次提示词学习就是 4 个全选)
- 写
01-题目确认.md记录主题 + 学习视角
Step 2:调研计划
- 列出每个 sub-agent 要查的源(官方文档、社区、案例库、争议议题)
- 给用户审一遍,可砍可加
- 用户说"开跑"就进入 Step 3
- 写
02-调研计划.md
Step 3:派 5 个 Sub-agent 并行
- 每个 sub-agent 用一个独立的 Agent 调用(subagent_type: general-purpose)
- 一次性在同一个 message 里发出全部 5 个(并行)
- prompt 模板见 reference/stage-3-subagent-templates.md
- 必须包含的硬约束(见 anti-patterns.md):
- 分段写入文件(每完成 1-2 节就 Write 一次)
- 反 AI 文废话清单
- 来源可追溯
- 争议必须双轨 + 给倾向
Step 4:合成 + 大纲确认
- 读全部 5 份调研笔记
- 设计 8 篇章节结构(导读 / 骨架 / 实战 / 进阶 / 案例 / 工程化 / 争议 / 盲区 / 附录)
- 写
04-体系大纲.md - 给用户过一遍坐标系
Step 5:HTML 产出
- 按 stage-5-html-spec.md 的设计 token 和组件规范
- 单文件 HTML,所有 CSS 内嵌
- 必须包含:左侧固定导航 / 4 种 callout / 案例 details 折叠 / 争议带倾向分 / 盲区清单
- 一次写完,不要分多次 Write(防止截断时被中间状态打断)
---
关键硬约束(一定要看 anti-patterns.md)
1. Sub-agent 必须分段写入文件——不能等最后一次性写。socket 崩溃会丢全部内容。 2. Agent E 强制双轨 + 给倾向分——"两边都对"不接受。 3. 案例类 Agent 强制 3+ 个原文片段 + 可信度评级——AI 总结的二手案例不接受。 4. AI 文废话黑名单——明显套话密度高的中文博客跳过。 5. 主线程做合成,不下放给 sub-agent——sub-agent 只产物料。 6. PLAN.md 主控——每次状态变化更新进度表。
---
灵活参数
| 参数 | 默认 | 可调 |
|---|---|---|
| 切片数量 | 4(A-D)+ 1(E)= 5 | 3-6(E 必含) |
| 介入级别 | 阶段 1/2/4 各一次 | 用户可授权全跳过 2 和 4 |
| 产物目录名 | <主题>学习/ | 用户可改 |
| HTML 风格 | 浅色暖白 | 可扩深色 / 暗紫调(暂未实现) |
| Sub-agent 派出方式 | 一次性 5 个并行 | 不要分两批 |
---
不适用于(边界划清)
- "X 行不行 / 为什么 Y / 评估 X 可行性" →
long-research - "X 领域有哪些好玩案例 / 看看大家在玩什么" →
case-radar(散点 vs 体系) - "把这堆素材整理成 HTML" →
readable-output(处理已有素材 vs 自己挖素材) - "写文章 / 出初稿" →
writing-assistant - "做设计稿 / UI 原型" →
design-exploration/macos-product-design - "PRD / 需求文档" →
prd-doc-writer
---
参考实例
首发实战:项目根目录 提示词学习/(2026-05-14 跑通的真实案例)
- 主题:提示词学习(4 切片全选)
- 实际耗时:~30 分钟
- 产物:5 份调研笔记 ~180KB → HTML 学习材料 120KB(1635 行)
- 卡点教训:见 anti-patterns.md 的"Agent B socket 崩溃"案例
后续每跑一个新主题,建议在 examples-index.md 里记一笔,作为后续主题的参考。
反模式 — 从首发实战中提取的卡点教训
2026-05-14 首发实战"提示词学习"主题跑下来真实遇到的卡点,固化成必避反模式。
---
反模式 1:Sub-agent 没分段写入文件 ⭐⭐⭐
实战来源:首发跑 5 个 sub-agent 并行,Agent B(Agent 时代提示词)跑到 40 个 tool 调用、约 5 分钟时 socket 断连,0 token 返回。问题不是 sub-agent 没工作——它做了大量调研——但因为没分段写入文件,所有内容全丢,必须从头补跑。
避免方法:每个 sub-agent 的 prompt 末尾必须包含这条强制约束:
**分段写入文件**——每完成 1-2 个章节就用 Write 工具更新文件,
不要等到最后一次性写完(防止 socket 中断丢内容)补跑时增加强调:
注意:前一次任务因网络中断未完成(已损失内容)。
这次必须**边查边写、分段更新文件**——
每完成 1-2 个章节就 Write 一次,不要等最后一次性写完。---
反模式 2:Sub-agent 写"AI 文废话"
实战发现:默认 sub-agent prompt 不约束时,产物会出现:
- "在 AI 时代,提示词工程..."
- "我们必须重视..."
- "通过深入研究,我们发现..."
- "随着大模型的发展..."
这些套话密度高、信息密度低,纯属浪费 token。
避免方法:每个 sub-agent prompt 必含:
**拒绝 AI 文式套话**——"在 AI 时代..."、"我们必须..."、"通过..."、
"随着...的发展"等模板句直接跳过,用干货密度高的列表/表格进一步:让 Agent E 显式扫"AI 互相复读的虚胖共识"——这部分既是反模式过滤,也是用户的盲区金矿。
---
反模式 3:案例 Agent 产出二手概括
实战观察:如果不强制"必须看到原文",sub-agent 容易写:
- "Cursor 大概是这样的 system prompt..."
- "据社区抓包,Devin 的 prompt 强调..."
- "Aider 的 prompt 包含搜索/替换..."
——全是 AI 的概括,没有原文支撑,可信度低。
避免方法:案例类 Agent prompt 必含:
1. **来源不明的不要写**——宁可少几个案例
2. **拒绝"AI 总结的二手案例"**——必须看到原文片段
3. 每个案例至少 3 个原文片段引用
4. 原文片段保留英文,点评用中文
5. 每个案例必须给可信度评级(4 档:官方公开 / 开源可见 / 泄露较可信 / 二手不可考)---
反模式 4:Agent E 和稀泥
实战观察:不强制时,Agent E 会写:
- "两边都有道理..."
- "具体情况具体分析..."
- "需要根据场景判断..."
——这是垃圾产出。Agent E 的核心价值是给倾向,不是平衡报道。
避免方法:Agent E prompt 必含:
**禁止和稀泥**——"两边都对"不接受,必须给倾向(X/10 分)
每个观点必须有代表人物/源
盲区至少 5 条,按"极金/强金/金"评级---
反模式 5:主线程把"合成"下放给 sub-agent
实战体会:8 篇章节的整合(特别是各章之间的承接、对用户启示的提炼)必须主线程做。如果让 sub-agent 帮忙写"导读"或"对用户启示",会丢锐度——sub-agent 看不到全局,写不出整合视角。
避免方法:
- 主线程亲自读 5 份笔记
- 主线程亲自设计 8 篇结构
- 主线程亲自写 HTML
- Sub-agent 只产原料,不参与最终产物组装
---
反模式 6:在 Stage 5 分多次 Write HTML
实战体会:单文件 HTML ~120KB 是 Write 工具能一次性处理的。如果分多次写(先写头部、再追加内容),容易在 Edit 时被 markdown 转义、空格问题打断。
避免方法:
- 主线程在 Stage 4 把所有内容在脑里组织好
- Stage 5 一次性 Write 全部 HTML
- 如果担心截断,先把内容主体在脑里草拟,确认完整后再开 Write 工具
---
反模式 7:跳过 Stage 1 题目收敛
实战体会:用户说"我想学 X"时,X 几乎总是太大("提示词" / "记忆系统" / "MCP")。如果 AI 替用户拍切片,调研方向可能错——错了之后所有调研都白费。
避免方法:
- 永远用 AskUserQuestion 让用户勾切片,不要 AI 替用户决定
- 例外只有一种:用户在初始消息已经明确给出切片范围
- 即使用户说"你直接开始",也要先用 AskUserQuestion 弹一下切片选项
---
反模式 8:5 个 sub-agent 分两批派
实战体会:如果先派 3 个、看结果再派 2 个,主线程会被前 3 个的结果"污染"——后 2 个的 prompt 会带前 3 个的视角倾向。
避免方法:5 个 sub-agent 必须在同一个 message 里一次性派出(5 个 Agent 调用块并列)。
---
反模式 9:在 sub-agent prompt 里塞太多约束
实战体会:Agent E 那次扫得很好——因为 prompt 里给了明确"双轨陈述 + 倾向分 + 盲区清单"3 个结构性约束。但反模式是塞 20 条约束——超过 5-7 条后 sub-agent 会"指令稀释",反而不听话。
避免方法:每个 sub-agent prompt 的"强制要求"段不超过 6-8 条,每条具体可执行。
---
反模式 10:在调研规模上过度承诺
实战观察:用户全选 4 个切片时,调研规模大,5 个 sub-agent 出来素材 180KB。主线程要明确"调研规模 vs 用户体感":
- 4 切片全选 → 30-50 分钟(用户能接受)
- 6+ 切片 → 60+ 分钟,且 sub-agent 数量爆炸 → 体验恶化
避免方法:阶段 1 切片设计时不要超过 4 个(AskUserQuestion 物理限制也是 4)。Agent E 永远独立,不并入这 4 个切片。
---
反模式 11:调研笔记和 HTML 没标日期
为什么重要:AI 领域半年就过时——Anthropic 半年砍一次 prefill、OpenAI 半年发 5 个模型、Cognition vs Anthropic 多 agent 之争 24 小时反转。没有日期的学习材料是定时炸弹——半年后你不知道哪些结论还有效。
避免方法:
1. 每份调研笔记开头标日期:
# A-官方与学派
> 调研日期:YYYY-MM-DD
> 调研员:Agent A2. HTML hero 区必须显眼标日期:
<div class="hero">
<h1>{主题} 系统学习</h1>
<div class="meta">
<span>📅 调研日期:YYYY-MM-DD</span>
...
</div>
</div>3. 每个争议议题标"我的初判 + 日期":方便后续单独更新某个议题,而不是整份重做
4. anti-patterns 适用日期:本反模式清单也要标——本版本基于 2026-05-14 实战提炼,2026 年下半年可能有新卡点
---
反模式 12:主线程没把 Agent A 的异见点喂给 Agent E
实战发现:Agent A 调研官方文档时会发现"各家说法不一致"的点(写在产物末尾的"⚠️ 异见点清单"),但派 sub-agent 是并行的——Agent E 派出去时,Agent A 还没产出异见点清单。
避免方法:
主线程在派 Agent E 时,先列出 8-10 个议题(从 stage-3 §Agent E 主题适配表里挑),不依赖 Agent A 反馈。Agent A 跑完后如果发现新异见点,主线程在 Stage 4 合成时手动并入 Agent E 笔记(不是再派一个 Agent)。
---
检查清单(每次跑 skill 前过一遍)
- [ ] Stage 1:用 AskUserQuestion 让用户勾切片
- [ ] Stage 2:写
02-调研计划.md并给用户审 - [ ] Stage 3:5 个 sub-agent 在同一 message 一次性派出
- [ ] 每个 sub-agent prompt 含"分段写入文件"强制约束
- [ ] 每个 sub-agent prompt 含"反 AI 文废话"约束
- [ ] 案例类 sub-agent 含"3+ 原文片段 + 可信度评级"
- [ ] Agent E 含"禁止和稀泥 + 倾向分 + 盲区清单"
- [ ] Stage 4:主线程亲自读 5 份笔记并设计大纲
- [ ] Stage 5:一次性 Write 全部 HTML,不分多次
- [ ] PLAN.md 每个阶段切换时更新
- [ ] 所有调研笔记开头标日期(YYYY-MM-DD)
- [ ] HTML hero 区显眼标调研日期
- [ ] Agent E 议题不依赖 Agent A 反馈,主线程预先列 8-10 个
实例索引
每跑一个新主题,记一笔在这里——作为后续主题的参考和效果迭代依据。
---
#1 提示词学习(首发实战)
- 日期:2026-05-14
- 主题:提示词全维度学习
- 切片:4 个全选(实战写作+Claude 实践 / Agent 时代 / 顶级案例 / 工程化管理)
- 介入次数:3 次(题目收敛 / 调研计划 / "授权直接跑")
- 总耗时:~30 分钟(含 sub-agent 并行)
- 产物:
- 调研笔记:5 份 ~180KB
- HTML:120KB,1635 行
- 位置:项目根目录
提示词学习/ - 卡点教训:Agent B socket 断连(已固化为反模式 1:分段写入)
- 质量自评:高
- 后续衍生(首发用户场景):
- 多个研究衍生方向(争议篇 10 + 盲区篇 6)
- 对用户研究方向的 5 条具体建议(生态篇)
- 这份 skill 本身(流程封装)
注:每个用户的"后续衍生"会不同——做产品的人衍生为产品决策、做内容的人衍生为选题素材、做研究的人衍生为论文方向。skill 不假设用户身份,争议+盲区永远是金矿。
---
模板(之后跑新主题时填)
## #N {主题名}
- **日期**:YYYY-MM-DD
- **主题**:{完整主题描述}
- **切片**:{勾选了几个 / 哪些}
- **介入次数**:{几次}
- **总耗时**:{分钟数}
- **产物**:
- 调研笔记:{大小}
- HTML:{大小,行数}
- **位置**:{相对项目根目录路径}
- **卡点教训**:{遇到的新坑,建议是否补进 anti-patterns.md}
- **质量自评**:{高/中/低}
- **后续衍生**:
- {产生了哪些选题 / 产品决策 / 文章}---
通用主题推荐路线
按"主题适配表覆盖度 + 通用价值"排序。用户实际选哪个,根据自己研究方向决定。
| 优先级 | 主题 | 适合什么用户 |
|---|---|---|
| 高 | Claude Code Skills 全貌 | 在做 Skills 开发的用户、AI 编程方向 |
| 高 | AI 编程工具生态 | 关注 AI 编程产品方向、做产品决策 |
| 高 | 记忆系统 | 关注 Agent 长程记忆、想做相关产品 |
| 中 | MCP 生态 | 关注协议层、做工具集成 |
| 中 | Agent 评估方法论 | 做 LLM 应用、需要 eval 闭环 |
| 中 | Subagent 设计模式 | Agent 时代核心议题 |
| 低 | Long-context 工程 | 偏技术,受众面窄 |
| 低 | Multi-modal prompting | 视觉/音频 prompt 工程 |
每次跑完一个主题,回来更新这个清单。
Stage 1:题目收敛(必经卡点,禁止 AI 拍)
这一步如果错了,后面所有调研都白干。所以必须用 AskUserQuestion 让用户勾选,不要让 AI 替用户做决定。
---
操作流程
Step 1.1:判断主题是否需要收敛
用户说"我要学 X"时,X 几乎总是太大。判断标准:
- 如果 X 是"一个具体技术 / 一个具体工具 / 一个具体产品"(如"learn how to use Aider")→ 可能不需要收敛,确认一次即可
- 如果 X 是"一个领域 / 一类技术 / 一个概念"(如"提示词" / "记忆系统" / "MCP")→ 必须收敛
Step 1.1.5:判断主题宽窄(拆切片前必做)
这一步在拆切片之前——决定后面是拆 4 个标准切片还是 2-3 个窄切片。
判断流程:
1. 主题在适配表里("提示词" / "记忆系统" / "MCP" / "Claude Skills")→ 宽主题,4 切片 2. 主题是适配表里某个子切片(如 "CLAUDE.md" 是"记忆系统"的子切片之一、"prefill 边界" 是"提示词"的子切片之一)→ 按窄主题独立处理,2-3 切片。不要扩成父主题。 3. 主题不在表里且范围明显窄(单一工具 / 单一概念 / 单一议题)→ 窄主题,2-3 切片 4. 主题不在表里但范围广(如"AI 编程工具生态")→ 宽主题,4 切片,主线程现造 4 切片
窄主题处理规则:
| 调整项 | 标准(宽) | 窄主题 |
|---|---|---|
| 切片数 | 4 | 2-3 |
| Agent B 体量 | 2000-4000 字 | 1000-1500 字(退化为 A 的 2026 补丁,详见 stage-3 Agent B) |
| Agent E 议题数 | 8 | 5-6(但每个深挖,详见 stage-3 Agent E) |
| Stage 4 章节数 | 8 篇 | 5-6 篇(详见 stage-4 Step 4.2.5) |
| HTML 体量预估 | 100-150KB | 60-80KB |
关键原则:不要为凑长度稀释内容密度。窄主题 60-80KB 是合理的,硬凑到 120KB 反而垃圾。
Step 1.2:拆切片
根据主题领域,给出 4 个核心切片(覆盖完整领域)。每个切片要:
- 互斥(不重叠)
- 完备(覆盖该领域大部分内容)
- 具体(不是抽象类别,是用户能 get 到的方向)
拆切片的方法论
按"4 个不同维度"切:
1. 基础维度:基础概念 / 主流方法 / 学派 2. 新形态维度:当下最新的形态 / 趋势 / 新概念 3. 真物维度:可看到的真实代码 / 顶级案例 / 大厂实现 4. 应用维度:工具生态 / 工程化 / 产品落地
具体落地时切片名要贴主题:
| 主题 | 切片 | 具体覆盖(用作 AskUserQuestion description) |
|---|---|---|
| 提示词 | 实战写作 + Claude 实践 | 怎么写出能用的 prompt,含 Claude 特定技巧(XML 标签、prefill、role、思考块、example placement) |
| 同上 | Agent 时代 | system prompt 设计、tool description 写法、subagent 协调、context 工程、记忆与状态管理 |
| 同上 | 顶级公开案例 | Cursor / Claude Code / Devin / v0 / Bolt / Lovable / Replit / Aider / Cline 等被泄露或公开的真实 system prompt |
| 同上 | 工程化管理 | 提示词模板/变量/版本控制/A/B 测试/评估指标,与提示词管理产品相关 |
| 记忆系统 | Memory tool 基础 | 各家 memory tool API(Anthropic / OpenAI)、自动注入机制、view/create/str_replace 接口 |
| 同上 | Agent 长程记忆 | 跨 session 持久化、ASSUME INTERRUPTION 范式、状态文件分层(CLAUDE.md / NOTES.md / TodoWrite) |
| 同上 | CLAUDE.md 模式 | 项目级记忆文件、自学习上下文设计、记忆 protocol 的 prompt 注入 |
| 同上 | 记忆系统产品对比 | Letta / Mem0 / Zep / Cognee / MemGPT 的设计哲学、商业模式、技术路线 |
| MCP | MCP 协议规范 | Protocol spec、transport 层(stdio / SSE / streamable HTTP)、capabilities 协商 |
| 同上 | Server 开发 | SDK 使用、tool/resource/prompt 三件套、错误处理、安全模型 |
| 同上 | 顶级 MCP server | 官方 reference servers + 热门第三方 servers 源码拆解 |
| 同上 | 生态与 Skills 关系 | Marketplace 生态、各 client 集成、Skills 和 MCP 的边界与互补 |
| Claude Skills | 基础概念 | Skills 是什么、frontmatter 规范、reference/ 目录用法、和 subagent 的关系 |
| 同上 | 编排模式 | Skills 内部如何调用 sub-agent、AskUserQuestion 协议、阶段化流程 |
| 同上 | 顶级 Skills 案例 | 公开仓库里的 Skills 拆解(用户自己的 + 社区精选) |
| 同上 | Plugin Store 生态 | Anthropic Plugin Store 商业模式、分发机制、各家 fork 的 Skills 集合 |
Step 1.3:用 AskUserQuestion 问
{
question: "你最关心 <主题> 的哪些切片?(可多选)",
header: "主题切片",
multiSelect: true,
options: [
{ label: "切片 1 名字", description: "具体覆盖什么的解释" },
{ label: "切片 2 名字", description: "..." },
{ label: "切片 3 名字", description: "..." },
{ label: "切片 4 名字", description: "..." }
]
}注意 AskUserQuestion 最多 4 个选项。不要再加第 5 个——"争议+盲区"是 Agent E 必含,不需要让用户选。
Step 1.4:处理用户回答
- 全选:4 个切片都做,调研规模大,预计 30-60 分钟
- 选 1-2 个:聚焦深入,调研规模中,预计 20-40 分钟
- 选 3 个:和全选差不多
不管选几个,Agent E(争议+盲区)必选。
Step 1.5:写 01-题目确认.md
# 阶段 1 产物:题目确认
## 确认时间
{YYYY-MM-DD}
## 主题
{主题描述} — {勾选切片数量} 个切片
## 切片详情
### 切片 1:{名字}
{具体覆盖什么}
### 切片 2:{名字}
...
## 学习视角
**用户研究视角**为主:
- 不走教材路线,按"我能拿来做什么"组织
- 允许带判断、带视角
- 重点输出:争议焦点 + 盲区清单
## 副作用预期(根据用户场景填)
- 直接用:{用户的产品 / 工作 / 研究方向}
- 间接用:{派生研究 / 后续探索 / 素材库}
- 可发布:{根据用户场景选填——文章 / 内部分享 / 课程 / 否}---
反模式(一定要避免)
❌ AI 替用户拍主题
"我猜你应该是想学 X 的 Y 方面"——禁止。让用户自己勾。
❌ 切片太抽象
"基础 / 进阶 / 高级"——这是教材式切片,不是研究视角。不要用。
❌ 切片太碎
切到 8 个、10 个——AskUserQuestion 最多 4 个选项,物理限制。
❌ 跳过题目确认直接调研
即使用户说"你直接来吧"——也必须先弹 AskUserQuestion 让她勾切片。题目错了全白干。
---
例外(明确边界)
唯一可以省略 AskUserQuestion 的情况:用户初始消息里完整、精确地给出 4 个切片。例如:"我要学提示词,从①实战写作、②Agent 时代、③顶级案例、④工程化四个角度"——4 个切片都点名,完全等价于已经勾选。
这种情况直接写 01-题目确认.md 记录即可,不需要再弹 AskUserQuestion。
但请注意——以下情况仍然要弹 AskUserQuestion,不算例外:
- 用户只说出 2-3 个方向(如"主要想看实战写作和 Agent 时代")—— 弹一次让她确认是否还想加其他切片
- 用户表述模糊(如"全方位学一下")—— 弹一次让她明确
- 用户给出的切片名和适配表不完全对应 —— 弹一次让她从适配表选最接近的
判定原则:宁可多弹一次确认,不要 AI 替用户拍。99% 的情况下用户说"我要学 X"就完了——这种就要弹。
Stage 2:调研计划
给用户审一遍"我打算查什么",让她可砍可加。默认要问(用户可一次性授权跳过)。
---
操作流程
Step 2.1:根据勾选切片列计划
按 5 个 Agent(A-E)分别列:
- 每个 Agent 的负责切片
- 必查源(具体到 URL 或仓库名)
- 产物结构
Step 2.1.5:切片重叠预防(重要)
5 个 sub-agent 的产物不能重叠。特别是 Agent A / B / C 在某些主题(如 Claude Skills、提示词)上极易撞车——A 讲基础概念,B 讲新形态时会重述基础;C 拆解案例时又会重述基础。
预防动作:在 02-调研计划.md 里明确写出"Agent 边界"段:
## Agent 边界(避免重叠)
- **Agent A** 只讲规范定义、官方文档、学派方法——**不讲编排/产品/案例**
- **Agent B** 讲新形态/趋势——**假设读者已掌握 A 的定义**,不重述
- **Agent C** 拆解案例时——**假设读者已掌握 A 的定义 + B 的形态**,重点在原文
- **Agent D** 讲生态/工程化——**不重述工具的功能列表**,只讲核心立场
- **Agent E** 不重述任何"事实"——只讲争议、异见、盲区把这段直接复制粘贴到每个 sub-agent prompt 的"产物结构"段之前,告诉它"你不许讲什么"。
Step 2.2:写 02-调研计划.md
模板:
# 阶段 2 产物:调研计划
## Sub-agent 分工总览
| Agent | 负责切片 | 核心使命 | 产物文件 |
|---|---|---|---|
| A | {主题骨架} | {一句话} | `03-调研笔记/A-{切片名}.md` |
| B | {主题前沿} | {一句话} | `03-调研笔记/B-{切片名}.md` |
| C | {主题真物} | {一句话} | `03-调研笔记/C-{切片名}.md` |
| D | {主题应用} | {一句话} | `03-调研笔记/D-{切片名}.md` |
| E | 争议+盲区 | 找异见、找盲区、给倾向 | `03-调研笔记/E-争议与盲区.md` |
**Agent E 是关键差异化 Agent**——其他 4 个 Agent 跑下来是普通学习材料,E 让产物对用户独有价值。
## Agent A:{切片名}
### 必查源
- {官方源 1}
- {官方源 2}
- ...
### 产物结构
{列点}
### 强制要求
{Agent 专属约束}
[Agent B / C / D / E 同结构]
## 通用反幻觉要求(所有 Agent 共享)
1. 引用必须可追溯——给出 URL 或文档定位
2. "据说""普遍认为"必须追问出处
3. AI 文识别——明显套话密度高的中文博客跳过
4. 承认不确定——不知道就说不知道
## 预估时间
30-60 分钟
## 用户可以怎么调整
- 砍 Agent:觉得某个 Agent 不重要可以删
- 加源:用户知道但 AI 没列的好资源
- 改重点:某个 Agent 应该聚焦不同方向
- 加议题:Agent E 里想知道的争议Step 2.3:给用户审
向用户汇报: 1. 5 个 Agent 的分工要点(不需要全文,给 1-2 句各自的使命) 2. 3 个值得强调的设计点(特别是 Agent E 的差异化要求 / 案例 agent 要原文 / 反 AI 文废话) 3. 询问"砍 / 加 / 调 / 直接开跑"
---
用户授权"直接跑"的处理
如果用户说"你直接跑就好"——更新 PLAN.md 标注"已授权全流程不打扰",仍然要写 `02-调研计划.md` 存档(方便事后排查 Agent 调研范围),然后直接进 Stage 3。
---
Agent A → Agent E 的"异见点"衔接动作
重要:5 个 sub-agent 是并行派出的,所以 Agent E 派出时 Agent A 还没产出"异见点清单"。
主线程的衔接动作:
1. 派出阶段(Stage 3):Agent E 议题不依赖 Agent A——主线程从 stage-3-subagent-templates.md §Agent E 主题适配表预先挑 8-10 个议题填进 Agent E prompt 2. 回收阶段(Stage 4 合成):所有 sub-agent 回笔记后,主线程读 Agent A 笔记末尾的"⚠️ 异见点清单",把里面没被 Agent E 覆盖的新议题手动并入 Agent E 笔记(不是再派 sub-agent)
这样可以并行跑 5 个 agent,又不丢 Agent A 发现的新异见点。
---
反模式
❌ 计划写得太抽象
"调研提示词的各个方面"——必须具体到查哪些 URL / 哪些仓库 / 哪些议题。
❌ 不区分 Agent,所有源都堆在一起
必须明确每个 Agent 查什么,避免 Sub-agent 之间重复。
❌ Agent E 议题太少
Agent E 至少要扫 8-10 个争议议题。少了产物会没锐度。 议题来源:stage-3-subagent-templates.md §Agent E 主题适配表预置 8 个候选。
❌ 等 Agent A 跑完再派 Agent E
错误!5 个 sub-agent 应该一次性并行派。Agent E 议题用预置 + 通用议题模板,不依赖 Agent A 反馈。
Stage 3:Sub-agent 模板(核心文件)
这一篇是 system-study 的灵魂。5 个 sub-agent 的 prompt 决定了产物质量。
主线程拿到题目后,按这份文件 + 主题情况构造 5 段 prompt,一次性并行派出。
---
设计原则(先理解再用模板)
为什么是 5 个 agent,不是 3 个或 10 个
- 少于 5:覆盖不全。骨架/前沿/真物/生态四类信息源差异大,合并会丢细节
- 多于 5:协调成本上升,token 爆炸,主线程合成困难
- 5 = 4 类客观信息(A-D)+ 1 类反共识(E):4 是给"全貌",1 是给"金矿"
为什么 A-D 灵活但 E 必选
- A-D 是"调研类"——查找、整理、归纳。主题不同源不同,所以灵活
- E 是"判断类"——找异见、给倾向、扫盲区。主题不同但方法论稳定,所以必选
为什么 5 个一次性并行派
- 并行:节省总耗时(最慢的那个决定总时间,不是相加)
- 一次性:避免分两批时主线程对前一批结果的偏见污染后一批
- 缺点:5 个同时跑,某一个 socket 崩溃概率不低(这次实战 Agent B 就崩了)
- 应对:sub-agent prompt 强制"分段写入文件",崩溃前已经存了大半
---
通用约束(5 个 agent 共享,每个 prompt 都要塞)
写在 prompt 末尾的"强制要求"段:
## 强制要求(不可违反)
1. **每个论点必须可追溯**——给出 URL 或文档定位
2. **拒绝 AI 文式套话**——"在 AI 时代..."、"我们必须..."、"通过..."、
"随着...的发展"等模板句直接跳过
3. **承认不确定**——查不到就标"待验证",不要编造
4. **中文输出,专业术语保留英文**
5. **分段写入文件**——每完成 1-2 个章节就用 Write 工具更新文件,
不要等到最后一次性写完(防止 socket 中断丢内容)
6. **不要写引言、不要写"总结"、不要写"展望"**——直接进入素材第 5 条是从这次实战学到的教训——Agent B 跑了 40 个 tool 调用后 socket 断连,因为没分段写所以全丢。这条必须每个 agent 都加。
---
Agent A — 骨架(官方文档 + 学派 / 主流方法)
职责类型
建立坐标系。"所有教科书都会讲的部分",包括:核心概念词典、主流方法对照、学派/方法的 2026 现状判断。
必含字段
1. 核心概念词典(10-20 个术语):每条一句话定义 + 来源 URL 2. 主流方法对照表:同一问题不同来源的差异 3. 学派/方法列表(5-7 个):每个一句话本质 + 何时用 + 出处 + 现状判断 4. ⚠️ 异见点清单(交给 Agent E 整合用)
反模式
- 写成教材式"什么是 X"段落(要表格 / 列表,密度优先)
- 只摆事实不给"2026 是否仍推荐"的判断
- 来源标"业界普遍认为"——必须能点到具体文档
主题适配规则
| 主题 | 必查官方源举例 |
|---|---|
| 提示词 | Anthropic Prompting Best Practices / OpenAI Prompt Guidance / Google Whitepaper / CoT/ReAct/ToT 等论文 |
| 记忆系统 | Anthropic Memory Tool / Claude Code memory / OpenAI Assistants memory / Letta、Mem0 等 |
| MCP | Anthropic MCP 协议规范 / Server 实现指南 / Inspector 工具 |
| Skills | Anthropic Skills 文档 / Claude Code Skills 章节 / agent-skills repo |
参考 prompt(提示词学习实例)
你是为用户做"提示词官方文档与学术派"调研的研究员。
最终产出是一份给用户系统学习用的 HTML 学习材料,你负责"骨架"部分——
所有教科书必讲的核心方法。
## 调研范围
必查源:
- Anthropic Prompt Engineering Guide
- Anthropic Claude Cookbook
- OpenAI Prompt Engineering Guide / Cookbook
- Google Gemini Prompt Engineering Guide / Whitepaper
- 学术派核心论文:CoT (Wei 2022)、ToT (Yao 2023)、ReAct (Yao 2022)、
Self-Consistency、Self-Refine、Reflexion、Plan-and-Solve
## 产物文件位置
写入:<工作目录>/03-调研笔记/A-官方与学派.md
## 产物结构(必须有这 4 块)
### 1. 核心概念词典(10-15 个)
每个术语一句话定义 + 来源 URL,表格呈现。
### 2. 各家最佳实践对照表
Anthropic / OpenAI / Google 在同一问题上的对照(至少 5 个问题):
- 如何控制输出格式
- 如何减少幻觉
- 如何用 examples
- 如何让模型 step-by-step 思考
- 如何写 system prompt
- 如何处理 long context
### 3. 学术派 5-7 个主流方法
每个:一句话本质 + 何时用 + 论文出处 + 2026 现状判断
### 4. ⚠️ 异见点清单
出现"各家说法不一致"或"老说法已被新模型推翻"的点单独标出。
[+ 通用强制要求 6 条]
## 风格
约 1500-3500 字。结构化笔记,密度高,可追溯。
完成后给我一个不超过 150 字的报告:查到几个源、覆盖核心概念几个、找到异见点几条。---
Agent B — 前沿(新形态、新趋势)
职责类型
扫"这个领域最近的变化"。新概念、新工具、新论文、新争论——还没进入主流教材的部分。
必含字段
1. 该领域当下最重要的 3-5 个"新形态"(带具体名字 / 工具 / 论文) 2. 每个新形态的"为什么出现 + 解决了什么 + 真实片段或案例" 3. 反模式与陷阱 4. 待验证 / 盲区
反模式
- 罗列"X 是 Y 的升级"这类抽象套话
- 没有真实片段 / 案例支撑
- 把 1-2 年前已经普及的概念当作"新"
窄主题特殊处理
如果主题本身已经很窄(如 CLAUDE.md / 单一工具),Agent B 可能挖不到"明显新形态"——这种情况下:
- 不要硬凑 "5 个新形态" 把无关内容塞进来
- prompt 退化为 "Agent A 的 2026 更新补丁":扫这个窄概念在最近 6-12 个月有什么演化、争议、新用法
- 内容篇幅可降到 1000-1500 字(vs 标准 2000-4000 字)
- 主线程 Stage 4 合成时可以把 B 的内容并入 A 章节,不单独成"进阶篇"
主题适配规则
| 主题 | "前沿"对应什么 |
|---|---|
| 提示词 | Agent 时代的 system prompt 形态(tool description / subagent / context engineering) |
| 记忆系统 | Memory tool / CLAUDE.md / 长程 agent harness |
| MCP | 最新的 MCP server 生态 / Skills 与 MCP 关系 |
| Skills | Plugin Store / Skills 编排 / Subagent 集成 |
参考 prompt(提示词学习实例)
你是为用户做"Agent 时代提示词"调研的研究员。这是用户最关心的切片之一。
最终产出是一份给用户系统学习用的 HTML 学习材料的"Agent 时代"章节。
## 调研范围
必查源:
- Anthropic Agent / Tool use / Computer use 官方文档
- Anthropic Claude Code、Skills、Agent SDK 文档
- Anthropic 工程博客:context engineering、effective agents、long-running agents
- OpenAI Assistants API + Agents SDK 文档 + Swarm 项目
- LangChain / LangGraph 关于 Agent prompt 的核心讨论
- AutoGen / CrewAI 等 multi-agent 框架
- Cognition AI "Don't Build Multi-Agents"
- 推上 prompt eng 圈:hwchase17、swyx、karpathy、simonw
## 产物文件位置
写入:<工作目录>/03-调研笔记/B-Agent时代.md
## 产物结构(⚠️ 以下 5 块是"提示词主题"专属示例,跑其他主题时主线程要重写)
1. system prompt 的五部分模式(任务/角色/工具/边界/记忆,每部分含正反例 + 真实片段)
2. tool description 写法(含 Anthropic 官方 good/bad 对比)
3. Subagent 协调三模式
4. Context 工程(清/压/存)
5. 反模式与陷阱
**主线程改写指南**:Agent B 产物结构的通用骨架是「3 块必含 + 主题特化 2 块」:
- 必含 1:该领域当下 3-5 个新形态(带名字 / 工具 / 论文)
- 必含 2:每个新形态的"为什么出现 + 解决了什么 + 真实片段或案例"
- 必含 3:反模式与陷阱
- 特化 1-2:主题相关的具体细分议题(如 MCP 可以是"协议设计 / Server 工程化")
[+ 通用强制要求 6 条]
约 2000-4000 字。---
Agent C — 真物(顶级案例 / 真实代码 / 原文拆解)
职责类型
这个 agent 最容易出二手概括——必须看到原文,宁可少几个案例。
必含字段
1. 总览表(至少 5 个案例 + 可信度评级 4 档:官方公开 / 开源可见 / 泄露较可信 / 二手不可考,不可考的不展开) 2. 每个案例拆解:来源 / 骨架 / 3+ 个原文片段(保留原文)/ 独特技巧 / 与其他差异 3. 跨案例对比表(5-7 个维度) 4. 关键发现 / 意外(至少 5-10 条)
反模式
- "据社区抓包"这种模糊源头——必须给具体仓库 / URL
- 用 AI 总结的"这家产品的 prompt 大概是这样"
- 漂亮但没原文支撑的分类(强制 3+ 个原文片段就是为了挡这个)
案例数量不足兜底
"至少 6 个案例 + 3+ 原文片段" 是标准主题的要求。窄主题或案例稀缺主题处理:
- 5-6 个案例:正常处理,单独成"案例篇"
- 3-4 个案例:可处理,但案例篇 + 生态篇可考虑合并
- 少于 3 个案例:不单独成"案例篇",合并到"生态篇" details 折叠区作为辅助说明
宁可案例少而精,不要为凑数把可信度低的二手概括塞进去(违反硬约束)。
主题适配规则
| 主题 | "真物"在哪 |
|---|---|
| 提示词 | x1xhlol/system-prompts-and-models-of-ai-tools、jujumilk3/leaked-system-prompts 等仓库 |
| 记忆系统 | Letta / Mem0 / Cognee 等开源项目源码、Claude Code 的 CLAUDE.md 真实用例 |
| MCP | 官方 reference servers / 热门第三方 servers 源码 |
| Skills | obra/superpowers、anthropics/agent-skills(如有)、cursor.directory 收录的 Skills、awesome-claude-code、hesreallyhim/awesome-claude-code、disler/claude-code-hooks-mastery、wshobson/agents 等聚合仓 + Anthropic Plugin Store 精选页 |
参考 prompt(完整可改造模板)
你是为<用户描述:身份 + 研究方向>调研"<主题>顶级案例 / 真实代码 / 原文拆解"的研究员。
<用户>最在意"拿到真物"——必须看到原文,不要二手概括。
最终产出是这次调研中"案例库"部分。
## 必查目标(按优先级)
**高优先级(开源/官方公开,可信度最高)**:
- {主题相关的开源仓库列表}
- 项目 1(github.com/...)— 开源,直接看源码
- 项目 2 — 同上
- 官方公开的部分
**中优先级(泄露较可信)**:
- 项目 X 的泄露版(来源:jujumilk3/leaked-system-prompts 或类似聚合仓)
- ...
主推荐查源:GitHub 上"<主题>-leaked-prompts"、"awesome-<主题>" 等聚合仓
## 产物文件位置
写入:<工作目录>/03-调研笔记/C-顶级案例.md
## 产物结构
### 总览表
所有案例 + 可信度评级 **4 档:官方公开 / 开源可见 / 泄露较可信 / 二手不可考**,不可考的不展开。
### 逐个案例拆解(至少 6 个,按可信度从高到低)
每个案例固定结构:
## 案例名(可信度等级)
**来源**:[URL 或仓库定位]
**抓取时间/版本**:(如能确定)
### 骨架结构
3-5 行列出 prompt 的主要部分
### 原文片段(至少 3 段)
> [原文,保留英文]
(点评:这段的意图/技巧)
### 独特技巧
1-3 个这家做了别家没做的
### 与其他案例的差异
### 跨案例对比
"共同模式 vs 独特做法"对照(5-7 个维度)
## 强制要求(不可违反)
1. **来源不明的不要写**——宁可少几个案例
2. **拒绝"AI 总结的二手案例"**——必须看到原文片段
3. 每个案例至少 3 个原文片段
4. 原文片段保留英文,点评用中文
5. 每个案例必须给可信度评级(4 档)
6. 拒绝 AI 文套话
7. 找不到的标"未找到原文,跳过"
8. **分段写入文件**——每完成 1-2 个案例就 Write 一次更新文件
9. 中文输出(原文片段除外)
## 风格
约 3000-6000 字。素材笔记,密度高,每段都有原文支撑。
完成后给我一个不超过 200 字的报告:实际找到几个真实可信案例、来源在哪、
可信度分布、有什么意外发现。---
Agent D — 生态(工具景观 / 工程化 / 应用场景)
职责类型
扫"市面上谁在用 / 怎么用 / 工具生态长什么样"。直接对接用户的产品决策。
必含字段
1. 工具景观图(按"开发期 / 运行期 / 评估期"或主题相关分层) 2. 每个工具的核心立场(不是功能列表) 3. 行业级信号(收购、转型、停服) 4. 真需求 vs 虚需求清单 5. 对用户产品的具体建议(5 条)
反模式
- 写工具的功能列表(必须写"核心立场 / 解决什么真问题")
- 没有"真需求 vs 虚需求"的判别
- 给的产品建议太抽象,不能直接照做
主题适配规则
不同主题"生态"差异很大:
| 主题 | "生态"包含什么 |
|---|---|
| 提示词 | PromptLayer / LangSmith / Helicone / Langfuse / Promptfoo / Braintrust / Latitude / Humanloop / Dify / Coze |
| 记忆系统 | Letta / Mem0 / Cognee / Zep / MemGPT / Anthropic Memory Tool / Claude Code CLAUDE.md |
| MCP | mcp.so / Smithery / PulseMCP / Cline MCP marketplace / 各家 client 的 MCP 集成 |
| Claude Skills | Anthropic Plugin Store / agent-skills 社区仓 / 各家 fork 的 Skills 集合 |
参考 prompt(完整可改造模板)
你是为<用户描述>调研"<主题>工程化生态 / 工具景观 / 应用场景"的研究员。
这块调研与<用户>的研究方向/产品决策直接相关——既要看清现有工具立场,
也要找出可能的差异化机会(如果用户有产品)或值得关注的研究入口(如果用户做研究)。
## 调研范围
必查工具(用 WebSearch + WebFetch,重点看官网定位和 GitHub README):
- 运行期/可观测类:{列出 3-4 个}
- 评估/测试类:{列出 3-4 个}
- 管理/编辑类:{列出 2-3 个}
- 国内/开源类:{列出 2-3 个}
调研重点不是功能列表,是**核心立场**和**真问题**。
## 产物文件位置
写入:<工作目录>/03-调研笔记/D-工程化.md
## 产物结构
### 1. 行业级信号(先扫这个)
比工具对比更重要的事——收购 / 停服 / 转型 / 整队跳槽。3 个最重要的信号。
### 2. 工具景观图
按"开发期 / 运行期 / 评估期"或主题相关分层。每个工具一句话核心立场(不是功能列表)。
### 3. 评估方法/工程方法的几个流派
3-5 个流派一句话本质 + 适用场景 + 局限 + 现状。
### 4. 工程化成熟度阶梯
5 级模型,每级特征 + 卡点 + 升级触发条件。
### 5. 管理范式之争
代码 vs 配置 vs 数据 三种范式 + 各家工具站哪边 + 各阶段适合哪种。
### 6. ⚠️ 真需求 vs 虚需求清单
- 虚需求(工程师过度建模、demo 友好但低使用频率)
- 真需求(被忽视或错位满足)
### 7. 给<用户>的具体建议(根据用户场景调整)
基于以上调研,给 3-5 条带锐度的建议:
- 如果用户在做相关产品 → 差异化机会
- 如果用户在做内容创作 → 选题方向
- 如果用户在做研究 → 值得深入的入口
## 强制要求
1. **不要写工具的功能列表**——写"核心立场"和"解决什么真问题"
2. 必须明确标记"真需求 vs 虚需求"
3. 每个论点有出处(URL)
4. 中文输出
5. 拒绝 AI 文套话
6. 不知道就说不知道
7. **分段写入文件**——每完成 1-2 节就 Write 一次
## 风格
约 2000-4000 字。素材笔记,有立场、有判断。
完成后给我一个不超过 150 字的报告:覆盖几个工具、看到什么意外立场、
给<用户>最重要 1-2 条建议是什么。---
Agent E — 争议+盲区(差异化命门,必选)
职责类型
这个 agent 是和市面学习材料的核心区别。主流共识扫一遍 + 异见挑出来 + 盲区列出来。
必含字段
议题列表(每个 1 节):
## 议题 N:[名字]
**主流观点**
- 谁说的(人/公司,必须可追溯)
- 论据是什么
- 来源 URL
**非主流观点**
- 谁说的
- 论据
- 来源
**我的初判**(必须给倾向 + 理由,X/10 分,用户可推翻但不能没有)
**对用户的启示**(一句话:和用户的研究/产品有什么关系)末尾盲区清单(独立段落,至少 5 条):
### 盲区 N:[名字]
- 现象:大家都怎么说
- 我的怀疑:这种说法可能只是 AI 互相复读 / 缺乏真实验证 / 在新模型上已不成立
- 真实证据:[如有则给,没有则说"待验证"]
- 选题机会:对用户内容创作/产品决策的潜在价值(评级:极金/强金/金)反模式(必须写进 prompt)
- 禁止和稀泥——"两边都对"、"具体情况具体分析"、"这取决于场景"都不接受
- 没有代表人物/源就不算论点
- 给的盲区是"大家都知道的事"——必须挖出"AI 复读但缺乏真实验证"的部分
议题如何选
主线程从"主题适配规则"表挑议题,给 Agent E 列出候选议题:
- 标准主题(在适配表里、范围广):用预置的 8 个议题,可酌情加 1-2 个新点
- 窄主题(如某个具体工具 / 单一概念,议题候选不足 8 个):议题数量可少到 5-6 个,但每个深挖。用质量补数量,不强凑
- 不在适配表的主题:用本文档末尾的"通用议题生成模板"(5 类)现造 8 个
注意:议题数量不是越多越好。少凑数稀释比多而精的强。
关于 Agent A 反馈的新异见点:5 个 sub-agent 是并行的,派出 Agent E 时 Agent A 还没产出"⚠️ 异见点清单"。不要等 A 反馈再派 E——主线程派 E 时用预置议题;A 跑完后如果发现新异见点,由主线程在 Stage 4 合成时手动并入 E 笔记(详见 stage-4-synthesis.md Step 4.1.5)。
主题适配规则(每主题预置 8 个候选议题,主线程从中挑 + 加新的)
E 的方法论稳定,但议题随主题变:
| 主题 | 8 个候选议题(保底) |
|---|---|
| 提示词 | ① 格式之争 XML vs MD vs JSON ② system role 真有用吗 ③ prefill 是否已死 ④ 长 prompt vs 短 prompt ⑤ few-shot 在 reasoning 时代是否过时 ⑥ CoT 是否过时 ⑦ prompt vs fine-tune vs RAG ⑧ "Prompt Engineering 已死"说法 |
| 记忆系统 | ① 自动写入 vs 用户控制 ② 结构化 vs 自由文本 ③ memory 还是 RAG ④ 跨 session 持久化的边界 ⑤ memory 衰减机制设计 ⑥ 长上下文 vs 外置 memory ⑦ memory 安全/隐私 ⑧ memory 的可观测性是否被忽视 |
| MCP | ① 协议臃肿 vs 极简 ② 集成路径之争(client vs server) ③ Skills vs MCP 之争 ④ stdio vs SSE vs streamable HTTP ⑤ OAuth 是否绑死 server 开发 ⑥ MCP server 是否会"工具爆炸" ⑦ marketplace 之争 ⑧ MCP 的安全模型是否过于宽松 |
| Claude Skills | ① Skills vs Subagent 边界 ② Skills 是否会"工具爆炸" ③ Skills 编排模式 ④ Skills vs MCP 选型 ⑤ Skills 的版本管理盲区 ⑥ Skills 的可发现性问题 ⑦ Plugin Store 商业模式之争 ⑧ Skills 是否削弱模型自主性 |
如果主题不在上面,主线程必须先列出 8 个议题(可参考通用议题生成模板)再派 Agent E。
通用议题生成模板(5 种类型):
- A. 协议/标准之争(如格式、协议、接口)
- B. 集成路径之争(如轻量 vs 重型、自治 vs 编排)
- C. 安全边界(如隐私、权限、prompt injection)
- D. 性能 vs 易用(如长 vs 短、复杂 vs 简单)
- E. 过时之论(如某技术"是否已死" / "是否被新模型替代")
参考 prompt(核心,要详细)
你是为用户做"<主题>领域争议和盲区"调研的研究员。
**用户最看重这一块**——她说:"Agent 出来像维基百科我不要,
普通学习材料没有的东西才是金矿。"
争议和盲区对用户而言是:① 内容选题金矿;② 产品决策的反面证据;
③ 防止被主流共识带偏的"清醒剂"。
最终产出是 HTML 学习材料里**最差异化的章节**。
## 必扫议题(每个都要双轨陈述 + 你的初判,禁止和稀泥)
[主线程从"主题适配规则"表里挑 8-10 个具体议题填入。
不在表里的主题先用"通用议题生成模板"列出。]
## 产物文件位置
写入:<工作目录>/03-调研笔记/E-争议与盲区.md
## 产物结构
[逐议题模板见上方"必含字段"]
末尾:⚠️ 盲区清单(至少 5 条)
## 强制要求(不可违反)
1. **禁止和稀泥**——"两边都对"不接受,必须给倾向(X/10 分)
2. 每个观点必须有代表人物/源
3. 拒绝 AI 文式套话
4. 中文输出
5. 盲区至少 5 条,按"极金/强金/金"评级
6. **分段写入文件**
## 风格
约 3000-6000 字。这一节是产物的灵魂,密度高、有锐度、有立场。---
派 Agent 的代码骨架
主线程在阶段 3 应该这样调用(同一个 message 5 个并行):
Agent({description: "Agent A 骨架调研", subagent_type: "general-purpose", prompt: "<构造好的 Agent A prompt>"})
Agent({description: "Agent B 前沿调研", subagent_type: "general-purpose", prompt: "<构造好的 Agent B prompt>"})
Agent({description: "Agent C 真物调研", subagent_type: "general-purpose", prompt: "<构造好的 Agent C prompt>"})
Agent({description: "Agent D 生态调研", subagent_type: "general-purpose", prompt: "<构造好的 Agent D prompt>"})
Agent({description: "Agent E 争议+盲区", subagent_type: "general-purpose", prompt: "<构造好的 Agent E prompt>"})如果某个 agent 失败: 1. 检查产物文件是否存在:有的话部分内容可能在,决定补写还是重跑 2. 重跑时增加"分段写入"强调:在新 prompt 里明确"前一次因 socket 崩溃丢内容,这次必须每完成 1 个章节就 Write 更新" 3. 重跑 1 个不要重跑全部——其他 4 个的结果保留
---
通用 prompt 头部模板(含 Agent 边界占位符)
每个 sub-agent prompt 都用这个开头:
你是为<用户描述:身份+做什么+研究方向>做"<切片名>"调研的研究员。
最终产出是一份给<用户>系统学习用的 HTML 学习材料,你负责"<章节名>"部分。
[切片专属调研范围]
## ⚠️ Agent 边界(从 stage-2 §Step 2.1.5 复制本 agent 对应段落)
你不许讲什么:<具体内容>
你可以假设读者已掌握:<具体内容>
你的重点是:<具体内容>
## 产物文件位置
写入:<工作目录>/03-调研笔记/<文件名>.md
[切片专属产物结构]
## 强制要求(不可违反)
[通用 6 条 + 分段写入文件]
## 风格
约 <字数> 字。结构化笔记,密度高,可追溯。
完成后给我一个不超过 150 字的报告:实际查到几个源、覆盖哪些子话题、找到几条异见。关键:"Agent 边界"段是必填项——主线程在 Stage 2 写 02-调研计划.md 时已经定义了边界,必须复制对应段落到每个 sub-agent prompt。这是治"自指主题切片重叠"的命根子。
Stage 4:体系搭建 + 大纲确认
5 份调研笔记整合成 8 篇章节结构。主线程做,不下放给 sub-agent。
---
操作流程
Step 4.1:读全部 5 份调研笔记
主线程批量读 03-调研笔记/A.md B.md C.md D.md E.md,建立整体感。
不要让 sub-agent 替你读再总结——sub-agent 的总结会丢锐度。
Step 4.1.5:把 Agent A 的异见点并入 Agent E(必做)
这步极易遗忘,必须显式执行。
5 个 sub-agent 是并行派出的——派 Agent E 时 Agent A 还没跑完。Agent A 跑出来后,笔记末尾会有一个 "⚠️ 异见点清单" 段(这是 Agent A 的硬要求字段之一)。
主线程读 Agent A 笔记时:
1. 找到"⚠️ 异见点清单"段 2. 对照 Agent E 已扫的议题列表 3. A 列出但 E 没扫到的新异见点 → 由主线程手动写一段并入 Agent E 笔记(不是再派一个 sub-agent) 4. 标注"(来源:Agent A 异见点 #N,主线程合成)",可追溯
如果不做这步,Agent A 发现的新异见点会被丢掉——这是 v0.1 实战时差点踩的坑。
Step 4.2:设计 8 篇章节结构(标准主题)
8 篇标准结构(按"由内向外"组织):
| # | 章节 | 内容来源 | 是否必含 |
|---|---|---|---|
| 1 | 导读 | 主线程写:材料怎么用 / 切片关系 / 推荐读法 | 必含 |
| 2 | 骨架篇 — 基础概念与方法 | Agent A | 必含 |
| 3 | 实战篇 — 怎么用 | Agent A 内容的可操作版(主线程加工) | 必含 |
| 4 | 进阶篇 — 新形态 | Agent B | 必含 |
| 5 | 案例篇 — 真物拆解 | Agent C | 必含 |
| 6 | 生态篇 — 工程化 | Agent D | 必含 |
| 7 | 争议篇 — 议题列表 | Agent E 上半部 | 必含(差异化命门) |
| 8 | 盲区篇 — 选题金矿 | Agent E 下半部 | 必含(差异化命门) |
| 9 | 附录(可选) | 来源 URL 全集(HTML 里也可以放章节末尾,不必单独成篇) | 可选 |
章节 9 处理建议:实战首发版没单独成"附录篇",把来源 URL 散在各章节末尾或合并到 HTML 末端的折叠区即可。不要为了凑数强行写附录章节——会稀释信息密度。
章节 3 注意:实战篇是从 Agent A 内容里提炼出来的"日常 SOP"——比如"怎么写 system prompt"、"怎么减幻觉"、"怎么用 few-shot"。不是另一个 sub-agent 产出,是主线程从 Agent A 笔记里挑可操作的部分重组。
Step 4.2.5:窄主题章节调整(如果适用)
如果 Stage 1 判定为窄主题(切片 2-3 个),8 篇标准结构需要调整:
| 标准 8 篇 | 窄主题处理建议 |
|---|---|
| 导读 | 必含,篇幅可减半 |
| 骨架篇 | 必含 |
| 实战篇 | 常和骨架篇合并——窄主题"怎么写 = 是什么"重合严重 |
| 进阶篇 | 如果 Agent B 内容稀薄(<1500 字),并入骨架篇,不单独成章 |
| 案例篇 | 案例 < 5 个时,合并到生态篇 details 折叠区 |
| 生态篇 | 必含 |
| 争议篇 | 必含(差异化命门,永远不省) |
| 盲区篇 | 必含(差异化命门,永远不省) |
窄主题最简结构(5 篇):导读 / 骨架(含实战+进阶)/ 案例+生态(合并)/ 争议 / 盲区。
最终 HTML 60-80KB / 800-1100 行是合理的——密度优先于长度。
Step 4.3:写 04-体系大纲.md
# 阶段 4 产物:体系大纲
## 设计原则
1. 不走"基础→进阶→高阶"教材路线
2. 争议 + 盲区独立成篇
3. 每章都标"对用户的启示"
4. 顶级案例原文片段不删减
## 章节结构(8-9 篇)
[列每篇的标题 + 主要小节 + 内容来源 + 预估字数]
## HTML 设计
- 浅色主题,暖白底
- 4 种 callout 颜色:
- warn(琥珀):争议中的"主流观点强调点"
- gold(金):盲区
- insight(绿):对用户启示
- rose(玫红):安全 / 反模式警告
- 顶级案例用 details 折叠
- 单文件 HTML,CSS 内嵌Step 4.4:给用户审坐标系
汇报核心点:
- 8 篇章节结构(一句话各一篇)
- 重点强调:"争议篇 + 盲区篇是这份材料的灵魂"
- 询问"坐标系对不对?要不要加减章节?"
---
用户授权"直接出"的处理
类似 Stage 2——存档 04-体系大纲.md,直接进 Stage 5。
---
反模式
❌ 走教材式结构
"基础知识 → 进阶应用 → 高级技巧" → 错误!要按"由内向外的同心圆"。
❌ 把 5 份调研笔记原样搬进 HTML
要重组、提炼、加视角,不是机械拼接。
❌ Agent E 内容被淡化
争议和盲区必须独立成两篇,不能塞进其他章节作为附属。
❌ 让 sub-agent 帮忙合成
合成必须主线程做。这一步直接决定最终质量。
Stage 5:HTML 学习材料规范
单文件 HTML,所有 CSS 内嵌,离线可用。这一篇是设计规范——拿首发"提示词学习"作为参考实例。
---
文件位置
<工作目录>/05-学习材料.html
关键约束
1. 一次性 Write 写完——不要分多次写避免被中间状态打断 2. 单文件——CSS、JS 都内嵌;不依赖外部 CDN 3. 离线可用——所有内容自包含 4. 中文字体优先——PingFang SC / Hiragino Sans GB / 系统字体
---
设计 Token(直接复制用)
:root{
--bg:#FAFAF7; --bg-soft:#F2F2EC; --bg-card:#FFFFFF;
--text:#1F1F1F; --text-soft:#4A4A48; --text-dim:#6B6B68;
--border:#E5E5E0; --border-soft:#EFEFE9;
--accent:#2563EB; --accent-soft:#DBEAFE;
--warn:#B45309; --warn-bg:#FEF3C7; --warn-border:#FCD34D;
--gold:#92400E; --gold-bg:#FEF3C7; --gold-border:#F59E0B;
--emerald:#065F46; --emerald-bg:#D1FAE5; --emerald-border:#34D399;
--rose:#9F1239; --rose-bg:#FFE4E6; --rose-border:#FB7185;
--code-bg:#1E1E2E; --code-text:#E4E4E4;
--mono:"SF Mono","JetBrains Mono","Menlo",monospace;
--sans:-apple-system,"PingFang SC","Hiragino Sans GB","Microsoft YaHei",sans-serif;
}布局结构
.layout (grid 280px + 1fr)
├── .sidebar (sticky, 100vh, 左侧)
│ ├── .sidebar-header (标题 / 副标题 / 日期)
│ └── nav.toc (分组:起步 / 基础 / 进阶 / 差异化 / 附录)
└── main (max-width: 920px, padding: 48px 56px)
└── section[id] × 8-9主内容区:
max-width: 920px(保证中文行长可读)padding: 48px 56px 80pxscroll-behavior: smooth
侧栏导航:
width: 280pxposition: sticky; top: 0; height: 100vh; overflow-y: auto- IntersectionObserver 高亮 active 章节
---
4 种 Callout(必含)
.warn(琥珀色)— 用于"主流观点的强调" / "Anthropic 砍掉了 X"这种警告
<div class="warn">
<span class="label">Anthropic 4.6+ 的重要变化</span>
<p>... </p>
</div>.gold(金色)— 用于盲区
<div class="gold">
<p><strong>现象</strong>:...</p>
<p><strong>我的怀疑</strong>:...</p>
<p><strong>真实证据</strong>:...</p>
<p><strong>选题机会</strong>:...</p>
</div>.insight(绿色,emerald)— 用于"对用户的启示"
<div class="insight">
<span class="label">对用户的启示</span>
<p>...</p>
</div>语义:用来高亮"这一段对用户的具体启示"——可能是选题机会、产品决策方向、行动建议、研究入口。不是普通的总结,是"用户研究视角下可以拿走的东西"。
.rose(玫红)— 用于安全警告 / 致命反模式
<div class="rose">
<span class="label">致命三件套</span>
<p>...</p>
</div>---
案例篇必备:details 折叠
<details>
<summary>① Aider — prompt 工程的"祖坟" <span class="stars">★★★★★</span></summary>
<div>
<p><strong>来源</strong>:...</p>
<h5>原文片段 ①</h5>
<div class="snippet">原文保留英文</div>
<p><strong>点评</strong>:中文点评</p>
</div>
</details>每个案例必含:来源 / 骨架 / 3+ 原文片段 / 独特技巧 / 与其他差异。
---
争议篇必备:双轨 + 倾向分
<h3>议题 N:标题<span class="judgment">X/10 倾向 Y</span></h3>
<div class="dual-view">
<div class="mainstream"><span class="label">主流</span>
<p>...</p>
</div>
<div class="alternative"><span class="label">非主流</span>
<p>...</p>
</div>
</div>
<h5>我的初判</h5>
<p>...</p>
<div class="insight">
<span class="label">对用户启示</span>
<p>...</p>
</div>---
顶部 hero 模板
<div class="hero">
<span class="section-eyebrow">导读</span>
<h1>{主题}系统学习</h1>
<p class="lead">这是 {用户} "全维度学习 {主题}" 调研的最终学习材料...</p>
<div class="meta">
<span>📅 日期</span>
<span>📚 N 个 Sub-agent 调研</span>
<span>📎 N 个顶级案例原文</span>
<span>⚖️ N 个争议议题</span>
</div>
</div>---
内嵌 JS(高亮当前章节)
const sections = document.querySelectorAll('section[id]');
const tocLinks = document.querySelectorAll('.toc a');
const linkMap = {};
tocLinks.forEach(a => { const id = a.getAttribute('href').slice(1); linkMap[id] = a; });
const observer = new IntersectionObserver((entries) => {
entries.forEach(entry => {
if (entry.isIntersecting) {
const id = entry.target.id;
tocLinks.forEach(a => a.classList.remove('active'));
if (linkMap[id]) linkMap[id].classList.add('active');
}
});
}, { rootMargin: '-20% 0px -75% 0px' });
sections.forEach(s => observer.observe(s));---
实例参考
首发实战:项目根目录 提示词学习/05-学习材料.html
- 文件大小 ~120KB
- 1635 行
- 8 篇结构全包含
- 11 个案例 details 折叠
- 10 个争议议题 + 6 个盲区
直接打开看效果,照着改即可。
---
反模式
❌ 分多次 Write
HTML 必须一次性产出。如果担心截断,先在草稿里组织好结构,再 Write。
❌ 用外部 CDN
所有资源内嵌——离线可用是硬要求。
❌ 字体不指定中文
必须 --sans:-apple-system,"PingFang SC","Hiragino Sans GB",...
❌ 没有 details 折叠
案例多时一定要 details 折叠,否则一页十几屏滚动疲劳。
❌ 配色太花
4 种 callout 已经足够区分语义。不要加第 5 种颜色。