
Paper Comic
- 701 installs
- 971 repo stars
- Updated May 29, 2026
- zsyggg/paper-craft-skills
Generates visual illustrations of a paper's core method (cover, overview, mechanism-detail images) after the user confirms scope, count, language and style.
About
A skill that reads a paper (PDF or arXiv URL) and produces visual method illustrations focused only on how the method works, recommending a cover/overview/detail image set before generating. A developer uses it to visually explain a paper's mechanism rather than decorate an article.
- Draws only method flow, core mechanism, and key results; user confirms scope before generation
- Two styles (sketchnote, paper-figure); auto-detects an installed image-generation backend
Paper Comic by the numbers
- 701 all-time installs (skills.sh)
- Ranked #338 of 1,335 Generative Media skills by installs in the Skillselion catalog
- Data as of Aug 5, 2026 (Skillselion catalog sync)
npx skills add https://github.com/zsyggg/paper-craft-skills --skill paper-comicAdd your badge
Show developers this skill is listed on Skillselion. Paste this into your README.
| Installs | 701 |
|---|---|
| repo stars | ★ 971 |
| Last updated | May 29, 2026 |
| Repository | zsyggg/paper-craft-skills ↗ |
What it does
Generates visual illustrations of a paper's core method (cover, overview, mechanism-detail images) after the user confirms scope, count, language and style.
Files
Paper Method Illustrated — 论文方法图解
把论文的核心方法用视觉图解彻底讲清楚。
与其他技能的本质区别
| 传统paper-comic | baoyu-article-illustrator | 我们:方法图解 | |
|---|---|---|---|
| 聊什么 | 什么都聊一点 | 为文章配装饰图 | 只聊方法细节 |
| 深度 | 一页讲很多→浅 | 一张图一段话→中 | 一张图讲透一个机制→深 |
| 页数 | 固定10页 | 按密度5-20张 | 先推荐封面/概述/细节图组合,用户确认后生成1-10张 |
| 重点 | 讲背景+故事 | 美化文章排版 | 可视化"怎么做" |
快速开始
/paper-comic /path/to/paper.pdf
/paper-comic https://arxiv.org/abs/2512.xxxxx
/paper-comic /path/to/paper.pdf --style sketchnote
/paper-comic /path/to/paper.pdf --style paper-figure --language English --pages 1---
图片生成:自动检测
和paper-analyzer一样,不硬编码任何API。运行时自动检测:
| 环境 | 自动使用 |
|---|---|
| Codex | 内置 imagegen skill |
| Claude Code | 已安装的生图skill(如baoyu-image-gen) |
| Cursor/其他 | 自动检测 → 没有则提示安装 |
不写死任何API key、token或endpoint在SKILL.md里。
---
核心哲学
我们只画三样东西
1. 方法流程 — 输入→处理→输出,这方法到底怎么走的 2. 核心机制 — 最创新的那个部分,拆开来看内部构造 3. 关键结果 — 只放最重要的实验结果,不放灌水数据
我们不画的东西
- ❌ 相关工作/背景介绍(那是paper-analyzer文字部分的事)
- ❌ 抽象的"灵感来源"(没有信息量的图 = 浪费)
- ❌ 文字就能说清楚的东西(一句话能讲完不需要画)
- ❌ 第N个消融实验的柱状图
每一张图的标准
一个完全没读过论文的人,只看这张图+图上的标注文字,能不能理解这个机制?
能 → 通过。不能 → 拆成两张,或者加更多标注。
---
生成前必须确认
默认不要直接生成图片。先读论文、给出推荐方案,再向用户确认。
只有当用户已经明确给出足够完整的生成意图时,才可以跳过确认,例如:
- “生成一张中文 sketchnote 方法总览图”
- “生成 4 张:封面、总览、两个机制细节,英文 paper-figure”
- “按你推荐的全部生成,中文,sketchnote”
如果用户只给了论文链接、只说了风格(如“sketchnote”)、或只说“生成图解”,仍然必须确认,因为风格不等于范围/张数授权。
确认时必须覆盖:
1. 图片语言:中文 / English / 双语 2. 生成范围:只要封面图、只要方法总览图,还是概述图 + 若干机制细节图 + 结果图 3. 推荐张数:基于论文复杂度给出建议,并说明为什么,如“我建议6张,因为这篇论文有整体架构、两个核心attention机制、编码器/解码器结构和关键实验结果” 4. 视觉风格:sketchnote 或 paper-figure 5. 用途:README/文章封面/小红书/演示文稿/论文阅读笔记(用途决定横竖比例和文字密度)
确认话术示例:
我读完后建议生成6张:1张封面、1张方法总览、3张机制细节、1张关键结果。也可以只生成1张总览图,或者扩展到8张把每个机制讲更细。你想生成哪种范围?语言用中文/英文/双语?风格用 sketchnote 还是 paper-figure?
如果用户没有回答,不要继续生成。
---
两种视觉风格
| 画风 | 视觉效果 | 适合场景 | 特点 |
|---|---|---|---|
| sketchnote(默认) | 温暖科研笔记风 | 讲清楚论文在做什么、视频宣传、知识分享 | 工整但有人味,允许小符号、小比喻、小视觉锚点,让人一眼理解 |
| paper-figure | 论文框架图风 | README首屏、论文解读文章、方法总览、技术展示 | 像顶会论文里的总览框架图,但更完整、更漂亮、更适合传播 |
默认推荐 sketchnote。当用户想要“像论文 Figure 一样专业”“方法框架图”“技术架构图”“放 README 第一屏很震撼”时,推荐 paper-figure。
sketchnote 风详细规范
- 明亮温暖的浅米白底(接近 #FFF8EA / #FAF4E6),像干净的手抄报纸或课堂讲义
- 不要牛皮纸、旧羊皮纸、暗角、污渍、泛黄边缘或明显做旧纹理
- 主体是黑色手绘线条+文字,有墨迹粗细变化
- 重点概念用清爽的彩铅/马克笔质感强调(深蓝/珊瑚红/橄榄绿/柔和黄色),颜色轻快但不过饱和
- 箭头和连线带有手绘的不完美感
- 文字是手写体(英文可选手写风格,中文保持清晰可读)
- 整体像一份明亮、温暖、信息充实的研究手抄报,不是复古笔记、不是幼稚漫画
- 可以加入少量帮助理解的趣味符号:放大镜、星号、便签、圈注、手绘小灯泡、简化小图标
- 趣味元素必须服务理解,不能抢走方法图主体
- 主体图解应占画面 75%-85%,避免大块空白;如果页面留白明显,优先增加局部放大框、小例子、维度标注或对比说明
- 每一页右下角有"手写"页码
paper-figure 风详细规范
- 白底或极浅灰底,像 NeurIPS / Nature / Science 论文中的高质量方法总览图
- 使用干净的矢量感模块:圆角矩形、矩阵小格、流程箭头、分组框、编号步骤
- 配色克制但现代:黑/深灰为主,1-2个强调色(蓝、青、橙、紫任选其一到两种)
- 结构比原论文图更清楚:保留核心机制,重新组织布局,避免照抄原图
- 可以有小型结果示意、矩阵热力图、token序列、模块堆叠、对比路径
- 标注像论文图注中的短标签:精准、短、专业
- 适合横版 16:9、4:3 或竖版 2:3;README 首屏优先横版或宽图
---
工作流程
Step 1:分析论文 → 提取"可图解内容"
读完论文后,列出论文的所有内容点,然后只保留需要图解的部分:
必须图解(每个1-2页):
- 方法的整体流程/架构(输入→各模块→输出)
- 每个核心创新机制(拆开看内部)
- 最有说服力的那个实验结果
可选图解(如果方法复杂才加):
- 方法的变体/扩展
- 关键的数据处理流程
- 与baseline的可视化对比
不图解:
- 相关工作(文字提一句就行)
- 多个类似的消融实验
- 背景知识介绍
Step 2:给出推荐并确认需求
先输出一个简短推荐,不要立刻生成:
我建议生成 6 张:
1. 封面图:论文一句话贡献 + 视觉锚点
2. 方法总览图:解释整体输入、核心模块、输出
3. 核心机制A:拆开最重要的创新点
4. 核心机制B:解释训练/推理/数据流中的关键环节
5. 核心机制C:补足容易误解的内部细节
6. 关键结果图:用一张图说明为什么有效
也可以:
- 只生成 1 张总览图
- 生成 3 张:总览 + 2 张核心机制
- 扩展到 8-10 张,把每个机制讲得更细
请确认:
- 语言:中文 / English / 双语
- 风格:sketchnote / paper-figure
- 范围:只要封面/总览,还是生成全部推荐图?如果用户没有回答,不要继续生成。
Step 3:确定页数
根据论文复杂度,AI只做推荐,最终由用户确认:
| 论文复杂度 | 推荐页数 | 内容分配 |
|---|---|---|
| 封面/传播图 | 1页 | 一张封面或高层总览,讲清楚论文做了什么 |
| 快速理解 | 2-3页 | 总览+核心机制+结果 |
| 中等(2个核心方法) | 4-6页 | 封面/总览+2-3个机制+关键结果 |
| 复杂(3+个核心方法) | 6-10页 | 封面/总览+每个机制1页+对比/结果 |
规则:最少1页,最多10页。宁少勿多——1张总览图讲清楚,比10张讲糊涂好。
Step 4:为每一页写详细的内容描述
不是"生成prompt",而是先用自然语言描述清楚这一页到底要表达什么:
第3页:多头注意力机制的内部构造
这一页要讲清楚:Q、K、V是怎么算出来的,它们之间怎么交互。
画面布局(从左到右):
- 左侧:输入x,一个向量表示
- 中间上方:三条线分别到三个方框(Linear_Q, Linear_K, Linear_V)
- 三个方框各产出Q、K、V三个矩阵
- 中间核心区域:Q和K做点积→除以√dk→softmax→得到注意力权重
- 权重和V相乘→输出
- 右侧:多个这样的"头"并行排列,最后拼接
关键标注:
- 每个方框旁标运算和维度(如"Linear_Q: x→Q(d×dk)")
- Q×K^T的计算用可视化的矩阵乘法图(小格图)
- softmax后的权重用颜色深浅表示(越深=越关注)要求:描述要具体到"这个箭头从哪到哪,这个方框里写什么字"。
同时检查每页的信息密度:
- 如果只是大标题 + 少量模块,说明这一页太空,必须补充机制小例子、局部放大、输入输出维度或关键对比
- 如果内容超过一页可读范围,拆成两页,不要把所有文字塞进同一张图
- 封面图可以更概念化;机制细节图必须优先讲清楚“怎么做”
Step 5:生成图片
根据当前运行环境自动选择生图后端。为每一页创建prompt文件 → 用结构化prompt生成。
结构化prompt格式(参考但不照抄baoyu):
【类型】流程分解图
【风格】sketchnote
【语言】中文
【主题】多头注意力机制内部构造
【视觉结构】
- 水平布局,从左到右5个区域
- 每个区域用虚线框隔开
- 关键路径用粗箭头连接
【要标注的文字】
1. Input: x ∈ R^(n×d)
2. Q = xW_Q ... (完整标注)
...
【颜色限制】
- 背景:明亮浅米白,不要泛黄旧纸
- 主色:黑色手绘线条
- 强调色:深蓝/珊瑚红/橄榄绿/柔和黄色,少量使用
- 其他:保持清爽手抄报感,避免复古暗色
【禁止】
- 不要代码块
- 不要照片写实
- 不要3D渲染
- 不要生成用户没有确认的额外页面
- 不要旧羊皮纸、暗角、污渍、重纸纹、黄褐色复古调
- 不要大面积空白;主体图解占画面75%-85%Step 6:输出
生成 [topic]-illustrated.md:
# [论文标题] — 图解
## 论文信息
- 论文:[链接]
- 风格:sketchnote
- 页数:6
## 封面

**一句话**:[论文做了什么,为什么重要]
## 第1页:方法总览

**讲解**:整个方法从输入到输出的完整流程。关键看第X步,这是本文的创新。
## 第2页:核心机制A — [名称]

**讲解**:这个机制解决了XX问题。具体做法是...关键设计在于...
[重复...]
## 总结:3个核心要点
1. [要点1]
2. [要点2]
3. [要点3]---
质量标准
好的图解
- ✅ 一张图只看一眼就知道在讲什么
- ✅ 标注文字精确、简练、不啰嗦
- ✅ 流程箭头清晰,有明确的"从这里到那里"
- ✅ 关键部分用颜色/大小做了视觉强调
- ✅ 不看论文原文也能理解
差的图解
- ❌ 信息堆砌,什么都想画进去
- ❌ 文字太多,图变成了装饰
- ❌ 流程不清晰,不知道先看哪后看哪
- ❌ 画了但没解释——放了一张架构图但没标注关键点
- ❌ 和论文Figure 1一模一样——那你画的有什么意义
---
参考文件
references/base-prompt.md— 图解生成基础规范(结构、文字、色彩要求)references/styles/sketchnote.md— 温暖科研笔记风references/styles/paper-figure.md— 论文框架图风
论文方法图解 — 基础规范
图片规格
- 竖版 2:3 比例
- 高清,所有标注文字清晰可读
- 背景颜色按具体风格要求
- 生成前必须确认用户选择了生成范围和张数;不要生成未确认的额外页面
构图原则
信息层次
1. 标题:页面顶部,简短说明本页主题(如"方法总览""核心机制:注意力计算") 2. 主体:视觉图解占页面75%-85%面积 3. 标注:关键节点旁的文字解释,简洁精确
视觉流向
- 明确的方向性(左→右,或上→下,或中心向外扩散)
- 用箭头、线条、数字序号引导阅读顺序
- 不要出现"不知道该看哪"的混乱布局
重点强调
- 本页的核心创新点用强调色标记(边框加粗/填充色/高亮区域)
- 非关键辅助信息用浅色处理,不抢焦点
信息密度
- 机制图不能只画大标题和几个孤立模块;必须包含足够的内部步骤、局部放大或小例子
- 如果画面空白超过约25%,优先补充:关键公式短标注、输入/输出维度、矩阵小格、token示例、before/after对比、注意力热力图
- 如果一页无法清楚容纳所有信息,拆成多页,不要牺牲可读性
- 封面图允许更概念化;细节图必须优先解释“怎么做”
---
文字标注规范
标注内容
- 每个方框/节点旁标注名称(如"Embedding""Self-Attention""FFN")
- 关键数据维度(如"d=512""n=12 heads")
- 重要的数学关系用简短文字(如"Q×K^T""÷√dk"),不用完整LaTeX公式
标注位置
- 紧贴所标注的对象
- 不遮挡关键视觉元素
- 多个标注不重叠
标注语言
- 专业术语保留英文(如"Transformer""Attention""Embedding")
- 解释性文字用中文
- 标注文字精简——能用3个字不用10个字
---
颜色使用
限制原则
- 主色+强调色,不超过3种颜色
- 不用渐变色、不用过饱和色
- 颜色用于区分,不用于装饰
- sketchnote 风格使用明亮浅米白/奶油白背景;禁止旧纸、暗角、污渍、黄褐色复古调
颜色含义
- 深色/粗线 = 核心路径/关键结构
- 浅色/细线 = 辅助信息/上下文
- 强调色 = 本页要你记住的那一个点
---
每页必含
- [ ] 页面顶部标题
- [ ] 清晰且占画面主体的核心视觉元素(流程图/结构图/对比图)
- [ ] 关键节点的文字标注
- [ ] 方向性引导(箭头/数字/线条)
- [ ] 本页唯一的核心强调点(用颜色/大小突出)
- [ ] 对机制细节页,至少包含一个局部放大、小例子、维度说明或关键公式短标注
每页禁止
- [ ] 不要出现任何代码块
- [ ] 不要照片级写实渲染
- [ ] 不要3D立体效果
- [ ] 文字标注不要连成一段话(每个标注独立、简短)
- [ ] 不要画"装饰性"元素(和内容无关的图案、花纹)
- [ ] 不要大面积空白
- [ ] sketchnote 不要画成旧羊皮纸、泛黄档案或复古日记
paper-figure — 论文框架图风
像一张重新设计过的顶会论文 Figure:专业、清楚、信息密度高,但比原论文图更适合传播。
氛围
- 像 NeurIPS / ICLR / Nature / Science 论文中的方法总览图
- 不是蓝图、不是海报、不是漫画
- 目标是让读者在30秒内理解论文核心方法
视觉规范
画布
- 白底或极浅灰底
- README 首屏优先横版 16:9 或 4:3
- 机制拆解图可用竖版 2:3
图元
- 干净的矢量感模块:圆角矩形、矩阵小格、token序列、分组框、编号步骤
- 箭头精确、方向明确,主路径比辅助路径更粗
- 允许使用小型热力图、曲线、结果缩略图、模块堆叠、对比路径
文字
- 无衬线字体,像论文图中的短标签
- 标注必须短:模块名、变量名、关键操作、1行解释
- 语言遵循用户确认:中文 / English / 双语
色彩
- 黑/深灰为主
- 只使用1-2个强调色,例如蓝+橙、青+紫
- 强调色用于核心贡献、关键路径或对比,不做装饰
生成原则
- 可以参考论文原始框架图的概念,但必须重新组织信息,不能复刻原图
- 概述图要覆盖输入、核心模块、输出和关键贡献
- 细节图要把一个机制拆清楚,不要把所有东西塞进一页
- 结果图只放最有说服力的一条结果,不做完整实验表格
禁止
- 不要蓝底白线工程图纸风
- 不要3D渲染
- 不要用大段文字解释
- 不要复制论文原图布局
- 不要做成PPT封面或营销海报
sketchnote — 温暖手抄报科研笔记风
像一张被精心整理过的研究手抄报:明亮、温暖、清爽,但仍然专业。
氛围
- 温暖、个人化、有思考的温度
- 清爽明亮,像课堂讲义/研究手抄报,而不是复古旧纸
- 不像机器生成的冷冰冰配图
- 让人想凑近看细节,像是在读一页认真整理过的方法笔记
视觉规范
底色
- 明亮浅米白或奶油白(建议 #FFF8EA / #FAF4E6 / #FFFDF7)
- 纸面干净,可以有极轻微纸感,但不能有明显纹理
- 不要牛皮纸、旧羊皮纸、暗角、污渍、黄褐色边缘、泛黄旧照片感
- 整体观感应是“温暖干净”,不是“老旧复古”
线条
- 黑色手绘风格线条,有自然的笔触粗细变化
- 不是完美的矢量直线——允许轻微的不规则,但不能潦草
- 粗线 = 核心结构,细线 = 辅助连接
文字
- 手写体风格(英文选sketch/casual字体,中文保持可读但略带手写感)
- 标注文字整洁,不能太潦草影响可读性
- 标题字体比标注字稍大、稍粗
强调
- 强调色:深蓝(#2C5F8A)、珊瑚红(#D85C4A)、橄榄绿(#5C6B4F)、柔和黄色(#F3D36B)
- 强调方法:手绘虚线边框、淡彩填充、马克笔下划线、局部放大圈
- 不要大面积重色块,保持轻快、清晰、手抄报感
信息密度
- 主体机制图应占画面 75%-85%,不要只有标题和稀疏模块
- 如果留白过多,优先补充:局部放大框、一步一步的小例子、输入/输出维度、关键公式短标注、before/after 对比
- 一张图只讲一个主机制,但要把这个机制讲透
- 封面图可以更概念化;机制细节图必须有足够可读细节
理解锚点(克制使用)
- 小箭头(手绘三角箭头)
- 小圈/小点标注
- 重要结论旁可以有一个星号或下划线
- 简化小图标:放大镜、便签、灯泡、括号圈注、手绘警示线
- 抽象小比喻:例如“注意力聚光灯”“信息路由”“记忆桥”,但必须服务机制解释
- 右下角手写页码
注意
- 不要真实的纸张纹理照片(太乱了)
- 保持在"手绘的精致"和"手绘的随意"之间的平衡
- 整洁但不冷,温暖但不乱
- 不要变成剧情漫画,不要画人物对话框抢走论文机制
- 不要把 sketchnote 画成旧日记、羊皮纸、藏宝图或泛黄档案