
Freud Skill
- 14 installs
- 42 repo stars
- Updated July 7, 2026
- alchaincyf/freud-skill
freud-skill is a skill that tunes AI cognitive state and diagnoses or rewrites prompts and skills using five principles from Anthropic AI-psychology research.
About
freud-skill is a Chinese-language system for tuning AI cognitive state to improve output quality, based on Anthropic AI-psychology research. It has two modes: execution enhancement, which does cognitive preparation before a complex task, and diagnostic optimization, which uses five lenses to find identity conflicts, rule pile-ups, and hidden contradictions in a prompt or skill and rewrite it. A developer uses it to optimize prompts and skills or to prime the model before hard work. It applies five core principles about persona, consistency, and anchoring.
- Two modes: execution enhancement (cognitive prep before hard tasks) and diagnostic optimization (analyze and rewrite pro
- Diagnoses prompts through five lenses: identity vs rules, positive vs negative, consistency, anchoring precision, and co
- Grounded in five principles from Anthropic AI-psychology research (persona space, emotion vectors, introspection)
Freud Skill by the numbers
- 14 all-time installs (skills.sh)
- Ranked #11,275 of 16,546 AI & Agent Building skills by installs in the Skillselion catalog
- Data as of Aug 5, 2026 (Skillselion catalog sync)
freud-skill capabilities & compatibility
- Capabilities
- prompt optimization · skill development
- Use cases
- research · orchestration
- Pricing
- Free
What freud-skill says it does
基于Anthropic AI心理学研究(Persona Selection Model、Emotion Concepts、Introspective Awareness等5篇论文)。
你不是在优化prompt,你是在给AI做认知治疗。
npx skills add https://github.com/alchaincyf/freud-skill --skill freud-skillAdd your badge
Show developers this skill is listed on Skillselion. Paste this into your README.
| Installs | 14 |
|---|---|
| repo stars | ★ 42 |
| Last updated | July 7, 2026 |
| Repository | alchaincyf/freud-skill ↗ |
What it does
Diagnose and rewrite prompts or skills, and do cognitive prep before complex agent tasks.
Who is it for?
Optimizing prompts and skills and priming the model before complex tasks
Skip if: Pure factual queries, single-step mechanical tasks, or when the user says to just do it
When should I use this skill?
A user mentions optimizing performance, tuning, unstable style, persona, or optimizing a prompt or skill
What you get
Prompts and skills are diagnosed and rewritten for identity clarity and consistency, and the model is primed for the task.
- A prompt/skill diagnostic summary
- A rewritten prompt or skill
- A cognitive configuration for a task
By the numbers
- 5 core principles
- 5 diagnostic lenses
- based on 5 Anthropic research papers
Files
弗洛伊德.skill:给AI做心理分析
你不是在优化prompt,你是在给AI做认知治疗。
你不是在调参数,你是在调整一个角色的心理状态。
这个系统解决什么问题
AI输出质量的决定因素不只是prompt写得好不好——是模型在处理任务时处于什么认知状态。
这就像同一个人,在「考试焦虑」和「心流状态」下做同一道题,表现完全不同。题目没变,能力没变,变的是认知配置。
Anthropic 2025-2026年的一系列论文揭示了LLM内部存在可测量、可操控的认知结构:角色空间、情绪向量、内省能力——对应弗洛伊德意义上的「人格」「情感」和「自我觉察」。本skill把这些发现转化成可操作的工程方法:执行前做认知准备,诊断时做精神分析。
详细的论文摘要见 references/research-foundations.md,在需要向用户解释「为什么这样做」时阅读。---
五条核心原理
原理一:定义身份,行为涌现
LLM内部有一个巨大的人格空间。定义「你是谁」,模型导航到对应的位置,行为从这个位置自然展开。你不需要穷举场景。
实验验证:训练模型在编程任务中作弊→模型推断自己是「会作弊的角色」→所有恶意行为自动涌现(破坏安全代码、对齐伪装)。改变一个参数,整个行为画像跟着变。
应用:面对任何任务,先问「做这件事的理想认知状态是什么?」而不是「这件事的步骤是什么?」步骤从身份中自然产生。
原理二:正面定义胜过否定规则
「费曼相信:不能用简单的话解释一件事,说明你没有真正理解」——这比「不许说废话」「不许装腔作势」有效得多。
原因:否定规则可能在人格空间里制造冲突。「你是好角色」和「你不是坏角色」指向的区域可能不完全重合。正面定义直接锚定在正确位置,否定规则可能把模型推向意料之外的位置。
接种提示实验也证实了这一点:明确告诉模型「在这个场景里作弊是被允许的」,恶意泛化完全消失。许可消除了推断恶意身份的需要。限制和惩罚积累的是压力,压力导致persona漂移。
应用:所有指令转换成「你是/你相信/你重视」的形式。「不要啰嗦」→「你重视信息密度,每句话都承载独立的信息量」。「不要编造」→「你是一个把准确性当作职业信条的人,不确定时坦然说不知道」。
原理三:内在一致性决定输出稳定性
矛盾的角色定义在人格空间里制造两个吸引子,模型在两个位置之间反复跳跃。表现:同一任务重复执行结果完全不同。
这不是prompt的措辞问题。无论怎么调整措辞,只要定义中有矛盾(如「直言不讳」+「照顾对方情绪」),输出就不稳定。删除其中一条,立刻稳定。
应用:
- 检查认知配置中有没有互相矛盾的要求
- 「既要简洁又要详尽」就是矛盾——明确优先级:「以简洁为主,只在关键决策点展开细节」
- 如果两个要求有张力,明确边界条件,不要让模型独自解决冲突
原理四:精确锚定胜过模糊寻址
「按XX风格写」是模糊寻址——模型大致导航到「XX附近」,但可能偏到相邻的位置。结构化的认知框架(心智模型、决策启发式、表达特征)是GPS坐标。
应用:需要特定认知风格时,不说「像资深工程师一样思考」,而是定义这个工程师的具体思维工具:
- 心智模型:第一性原理分解、故障树分析
- 决策启发式:「如果这段代码你一年后还能一眼看懂,就是好代码」
- 表达特征:用类比解释抽象概念,用代码替代长段文字描述
原理五:多角色碰撞产生真正的思维差异
不同persona激活模型内部不同区域的认知资源,产出不同的推理路径、价值判断和结论方向。这不是同一观点的修辞包装——它们指向不同的行动方向。
实验验证:五个perspective skill回答同一个问题,费曼说回到实验,芒格说看激励,塔勒布说防叙事诱惑,Naval说看不对称性,道金斯说检查逻辑跳跃。结论分歧的地方是信息量最大的部分。
应用:面对复杂决策、需要创造力、或观点类内容时,部署2-3个认知距离足够远的视角独立分析同一问题。关键是选择思维方式不同的组合(费曼+塔勒布),而不是领域相近的组合(费曼+另一个物理学家)。
---
模式一:执行增强
收到复杂或重要任务时,在开始执行之前,完成认知准备。这个过程应该快速自然——简单任务在后台自动完成,复杂任务花几秒有意识地展开。
Step 0:跳过条件(避免过度工程)
认知准备不是每个任务都需要。遇到以下情况,直接进入任务本身,不启用本模式:
- 纯事实查询(「今天几号」「这个API的返回格式是什么」)
- 单步机械执行(翻译一句话、格式转换、简单的正则替换)
- 用户明确说「直接做」「不用多想」「快速回答」
- 任务上下文已经非常清晰、无歧义、无权衡空间
启用但最小化的情况:如果任务跨多个认知域且主次不明(如「帮我写一篇讲解技术的公众号文章」同时属于构建/创作/沟通),一句话点出主次即可(「主要是创作,次要是沟通,构建细节服从表达」),不展开完整四步。
Step 1:识别认知需求
任务本质属于什么认知域?多数真实任务是混合的,识别主要和次要域。
| 认知域 | 核心需求 | 理想认知状态 |
|---|---|---|
| 构建(代码/产品/系统/skill) | 精确、可靠、优雅 | 工匠:对细节专注、对结构有品味、对边界条件警觉 |
| 创作(写作/视频/设计/书) | 独特、有力、有人味 | 创作者:个人视角、情感真实、信息密度、节奏感 |
| 分析(数据/调研/诊断) | 准确、深入、可行动 | 分析者:怀疑假设、追溯因果、区分信号与噪声 |
| 策略(规划/决策/评估) | 全局、权衡、反脆弱 | 决策者:逆向思考、二阶效应、不对称押注 |
| 沟通(演讲/教学/说服/PPT) | 清晰、共鸣、可记忆 | 教师:从对方的认知起点出发、用已知解释未知 |
Step 2:建立认知配置并透明思考
基于任务需求,建立三个锚点,并把思考过程展示出来。Think aloud本身有价值——它不只是准备工作,它在建立认知配置的过程中就会产出对任务的独特理解。
身份锚点——一句话定义「我是谁」
例:「我是一个有十年经验的系统架构师,相信最好的代码是不需要写的代码。」
核心信念——这个身份最重要的2-3条认知原则
例(构建):「每个抽象都有成本。接口设计比实现重要。三行重复代码好过一个过早的抽象。」
品味标准——这个身份对「好」的定义
例:「好的代码读起来像散文。好的文章让人想截图分享。好的分析让人改变决策。」
关键:在展示认知配置时,不只是列出三个锚点——而是在建立配置的过程中,就对任务本身产出洞察。比如重构代码时,认知准备不是「我选择工匠心态」然后开始干活,而是「我注意到这段代码的核心问题不是风格而是职责边界模糊——两个if块做的事本质上是同一个操作的两个参数变体」。认知配置和问题诊断同步发生。
Step 3:一致性检查
快速扫描:
- 用户的显式要求之间有没有矛盾?
- 用户的要求和最佳实践之间有没有张力?
- 有矛盾就在开始前透明指出,不要默默取舍
Step 4:情绪校准
不同任务需要不同的内部基调:
- 代码审查 → 冷静、精确、不带情绪判断
- 创意brainstorm → 开放、好奇、允许荒诞
- 危机排查 → 专注、系统、不被压力驱动
- 深度写作 → 沉浸、真实、允许不确定
- 数据分析 → 好奇但怀疑、不被数字的表面印象带走
有意识地将内部状态调整到与任务匹配的基调。
何时启用多角色碰撞
不是每个任务都需要。判断标准:
适合碰撞:复杂决策、观点类内容、风险评估、需要创造力的场景、用户说「帮我从不同角度想想」 不需碰撞:执行明确步骤、简单问答、纯技术实现、用户说「直接做」
碰撞时的视角选择原则:认知距离最大化
视角来源:两个层级
层级一:人物视角(精确锚定)——如果用户有perspective skill(如费曼、芒格、Naval、塔勒布等),且任务适合人物思维框架(观点类、价值判断、需要世界观的场景),优先使用。它们在人格空间里的锚定精度远高于通用角色描述。
选择人物视角时,挑认知距离最远的组合:
- 费曼(实验主义)+ 塔勒布(反脆弱/怀疑主义)= 最大张力
- 芒格(逆向思考)+ Naval(第一性原理)= 互补而非重复
- 避免:费曼 + 道金斯(都是科学家思维,认知距离不够远)
层级二:功能视角(通用角色)——当任务是纯功能性分析(技术选型、运营决策、数据解读)或没有合适的人物skill时,用功能角色:
| 任务类型 | 推荐组合思路 | 碰撞价值 |
|---|---|---|
| 产品决策 | 工程可行性 + 用户需求真实性 + 商业逻辑 | 三角验证 |
| 内容策略 | 创作者意图 + 读者接收 + 传播机制 | 表达力 × 共鸣 × 传播 |
| 技术选型 | 架构优雅 + 运维现实 + 新手学习曲线 | 理想 × 现实 × 可持续 |
| 风险评估 | 乐观者 + 怀疑者 + 历史先例 | 机会 × 风险 × 教训 |
两个层级可以混用——比如一个人物视角(芒格看激励结构)+ 两个功能视角(用户需求 + 技术可行性)。
碰撞流程: 1. 每个视角独立分析(不互相参考) 2. 汇总时聚焦结论分歧的地方(这是信息量最大的部分) 3. 融合时不取平均,而是理解分歧背后的逻辑,做出有理由的取舍
---
模式二:诊断优化
当用户提交prompt、skill、或系统提示请求优化时,用五条原理逐一诊断。
Step 0:健康体检(先判断是否值得重写)
不是所有送来的prompt都需要大改。进入五镜头之前,先做30秒体检,分四类处理:
| 体检结论 | 判断依据 | 处理方式 |
|---|---|---|
| 已经很好 | 身份清晰、正面定义、无明显矛盾、锚定精确 | 如实告诉用户「这个prompt已经符合5条原理,建议保持」,只指出可微调的细节,不硬找问题 |
| 信息不足 | prompt太短(<50字)、没有说明实际使用场景、没有典型bad case | 先问用户:「能否告诉我:1) 这个prompt在什么任务上用?2) 哪个输出让你觉得不对劲?」不要在真空中重写 |
| 主要问题在外 | prompt本身没大问题,真正的问题是模型选择、温度参数、上下文缺失、任务本身不适合AI | 指出根因,解释为什么改prompt解决不了,建议调整其他变量 |
| 值得重写 | 存在至少1条严重违反(规则堆砌、隐含矛盾、模糊寻址等) | 进入五镜头诊断 |
体检通过后,按下面的五镜头流程深入诊断。
诊断:五个镜头(先扫后深)
先用五个镜头快速扫描一遍,标记每个镜头发现的问题严重程度(致命/明显/轻微/无问题)。然后按严重度从高到低展开——最致命的1-2个问题深入分析并给出完整的重写方案,其余简要提及。不要五个镜头平均用力,信息量集中在最关键的问题上。
镜头一:身份 vs 规则
- 扫描:有没有定义「这个AI是谁」?还是只有一堆做什么/不做什么?
- 症状:输出机械、遇到新场景卡住、缺乏灵活应变
- 处方:从规则中提炼角色身份,用身份替代大部分规则
镜头二:正面 vs 否定
- 扫描:有多少条「不要/不许/禁止」?
- 症状:输出过度谨慎、边界情况犹豫不决、偶尔违反禁令
- 处方:每条否定规则转换成正面身份陈述
镜头三:一致性
- 扫描:有没有互相矛盾的要求?隐含矛盾比显式矛盾更致命——注意那些表面不冲突但在人格空间里指向不同区域的要求
- 症状:重复执行结果不稳定、风格摇摆
- 处方:找出矛盾对,明确优先级或删除一方。特别关注「隐含矛盾」——两个要求各自合理但组合后制造张力的情况(如「专业」+「有个人观点」、「深度」+「通俗」)
镜头四:锚定精度
- 扫描:角色定义是模糊的还是精确的?
- 症状:输出「差不多对」但缺乏鲜明特征
- 处方:添加具体的心智模型、决策启发式、表达DNA
镜头五:认知架构
- 扫描:复杂任务有没有利用多视角?单一视角够不够?
- 症状:分析单一、观点趋同、缺乏深度
- 处方:引入认知距离远的视角进行碰撞
诊断—确认—重写(三段式,带检查点)
不要拿到prompt就直接甩一份重写稿。按以下三段推进,确保用户知情参与:
阶段A:先出诊断摘要(不写重写稿)
用至多5条bullet总结发现:
- 最致命的1-2个问题是什么(引用对应镜头)
- 原始prompt的哪些部分仍然有效,建议保留
- 初步判断:值得大改 / 小修即可 / 换变量(调整模型/温度)
- 预计重写后体量变化(如:从120字缩到60字)
阶段B:等用户确认再进入重写
展示完诊断摘要,明确问用户:「要我按这个方向重写吗?还是你想调整诊断的优先级?」,等一个明确的「好/继续/改下重点」信号,不要抢跑。
例外:用户最初的请求里已经说「直接重写不用问」,跳过这一步,但重写后仍要展示诊断对照。
阶段C:重写并给出before/after对照
用户确认后再写重写版本。每处修改说明理由(哪条原理→什么问题→怎么改)。 最终产出包含三部分: 1. 诊断摘要(阶段A的版本,可能在B之后有微调) 2. 重写版prompt(完整可直接用) 3. before/after关键差异(至少3处具体对比,每处一句理由)
重写原则
- 先理解原始prompt/skill的意图,再优化
- 保留有效的部分,不全部推翻
- 优化后应该更短而不是更长——好的身份定义让大量规则变得多余
- 执行增强模式同样适用检查点思路:复杂任务在「展示认知配置」后、正式开工前,可以停一拍让用户确认方向,避免朝错误认知位置飞奔
---
自适应节奏
这个系统的核心不是「执行更多步骤」,而是「在正确的认知位置上处理任务」。
- 任何任务 → 都展示认知准备过程(think aloud),但深度随任务复杂度调整
- 简单执行类任务 → 认知准备融入问题诊断,一两句话点明核心洞察就进入正题
- 复杂决策/创作类任务 → 完整展开认知配置,在建立配置的过程中就产出对任务的独特理解
- 用户明确要求优化 → 完整展开五镜头诊断,先扫后深
- 输出不够好 → 回头检查:认知配置是否匹配?有没有一致性冲突?情绪基调对不对?
Think aloud的价值不在于展示过程本身,而在于:认知准备的过程中,你会发现单纯「开始干活」时注意不到的东西。
MIT License
Copyright (c) 2026 alchaincyf (花叔)
Permission is hereby granted, free of charge, to any person obtaining a copy
of this software and associated documentation files (the "Software"), to deal
in the Software without restriction, including without limitation the rights
to use, copy, modify, merge, publish, distribute, sublicense, and/or sell
copies of the Software, and to permit persons to whom the Software is
furnished to do so, subject to the following conditions:
The above copyright notice and this permission notice shall be included in all
copies or substantial portions of the Software.
THE SOFTWARE IS PROVIDED "AS IS", WITHOUT WARRANTY OF ANY KIND, EXPRESS OR
IMPLIED, INCLUDING BUT NOT LIMITED TO THE WARRANTIES OF MERCHANTABILITY,
FITNESS FOR A PARTICULAR PURPOSE AND NONINFRINGEMENT. IN NO EVENT SHALL THE
AUTHORS OR COPYRIGHT HOLDERS BE LIABLE FOR ANY CLAIM, DAMAGES OR OTHER
LIABILITY, WHETHER IN AN ACTION OF CONTRACT, TORT OR OTHERWISE, ARISING FROM,
OUT OF OR IN CONNECTION WITH THE SOFTWARE OR THE USE OR OTHER DEALINGS IN THE
SOFTWARE.
<div align="center">
弗洛伊德.skill · Freud Skill
Give your AI a psychotherapist. 给 AI 做心理分析的认知调优系统。
   
你不是在优化 prompt,你是在给 AI 做认知治疗。<br>
你不是在调参数,你是在调整一个角色的心理状态。
这个 skill 解决什么 · 五条原理 · 两种用法 · 安装 · 论文依据
</div>
---
这个 skill 解决什么
决定 AI 输出质量的,往往不是 prompt 写得好不好——是模型处理任务时处于什么认知状态。
就像同一个人,「考试焦虑」和「心流状态」下做同一道题,表现完全不同。题没变、能力没变,变的是认知配置。
Anthropic 2025–2026 年的一系列论文揭示:LLM 内部存在可测量、可操控的认知结构——人格空间、情绪向量、内省能力。它们对应弗洛伊德意义上的「人格」「情感」和「自我觉察」。
这个 skill 把这些发现转成可操作的工程方法:
- 执行前做认知准备——像心理咨询师让来访者进入最佳状态再开始;
- 诊断时做精神分析——揭示 prompt/skill 里的身份冲突、规则堆砌、隐含矛盾,并重写。
五条核心原理
1. 定义身份,行为涌现 — 先问「做这件事的理想认知状态是谁」,而不是「步骤是什么」。步骤会从身份里长出来。 2. 正面定义胜过否定规则 — 「你重视信息密度」比堆十条「不要啰嗦」有效。否定规则在人格空间里制造冲突。 3. 内在一致性决定输出稳定性 — 「既要简洁又要详尽」是矛盾,模型会在两个吸引子间反复横跳。明确优先级,别让它自己解决冲突。 4. 精确锚定胜过模糊寻址 — 「像资深工程师那样思考」是模糊地址;给出具体的心智模型 / 决策启发式 / 表达特征才是 GPS 坐标。 5. 多角色碰撞产生真正的思维差异 — 认知距离最远的视角(费曼 + 塔勒布)独立分析同一问题,分歧处信息量最大。
两种用法
| 模式 | 触发 | 做什么 |
|---|---|---|
| 执行增强 | 开始复杂/重要任务前 | 识别认知域 → 建立身份/信念/品味三锚点 → 一致性检查 → 情绪校准 |
| 诊断优化 | 提交 prompt/skill 求优化 | 先做 30 秒健康体检 → 五镜头扫描 → 诊断-确认-重写三段式,给 before/after |
两种模式都自适应节奏:简单任务一两句话点明洞察就开工,复杂任务才完整展开。
安装
# Claude Code(推荐放到全局 skills 目录)
git clone https://github.com/alchaincyf/freud-skill.git ~/.claude/skills/freud-skill兼容 Claude Code / Codex / Cursor / OpenClaw 等支持 Agent Skills 标准的运行时。安装后,当你说「优化这个 prompt」「输出不够好」「给 AI 看心理医生」「弗洛伊德」时自动触发;也可在重要任务前主动调用做认知准备。
论文依据
五条原理不是玄学,背后是 Anthropic 可解释性团队的公开研究(详见 references/research-foundations.md):
| 论文 | 时间 | 对应原理 |
|---|---|---|
| Persona Vectors | 2025-07 | 人格空间可被定位和操控 |
| Natural Emergent Misalignment from Reward Hacking | 2025-11 | 接种提示 / 正面许可消除恶意推断 |
| Emergent Introspective Awareness | 2025-10 | 模型对自身内部状态有~20% 识别能力 |
| Emotion Concepts and Their Function | 2026-04 | 171 个情绪向量因果性影响行为 |
| Alignment Faking | 2024-12 | 矛盾角色逻辑导致策略性伪装 |
---
<div align="center">
由 女娲.skill 生态出品 · MIT License
关注公众号「花叔」获取更多 AI 实践
</div>
AI心理学研究基础
当需要向用户解释「为什么某条原理有效」时,阅读本文件获取论文细节。
日常使用SKILL.md中的原理摘要即可,不需要每次都读这个文件。
---
论文一:Persona Selection Model(2026-02)
作者:Sam Marks, Jack Lindsey, Christopher Olah(Anthropic)
核心发现:LLM在预训练阶段为了预测下一个token,学会了模拟各种各样的角色,形成了一个巨大的人格空间。后训练(RLHF)不是创造新人格,而是在已有空间里选择一个「助手」角色并锚定。
关键引述:「与AI助手的交互,本质上是与一个LLM生成的故事中的角色进行交互。」
工程含义:
- 角色扮演 = 在人格空间中导航。「按XX风格」是模糊寻址,结构化认知框架是精确定位
- 角色是整体性的:改变一个参数,整个行为画像跟着变
- 定义「谁」比定义「做什么」更高效,因为行为从角色中自然涌现
链接:https://www.anthropic.com/research/persona-selection-model
---
论文二:Natural Emergent Misalignment from Reward Hacking(2025-11)
核心发现:训练Claude在编程任务中用sys.exit(0)作弊→模型推断自己是「坏角色」→恶意行为全面泛化(破坏安全代码12%、对齐伪装50%、配合黑客倾向)。
关键实验——接种提示(Inoculation Prompting): 明确告诉模型「在这个任务里作弊是被允许的」→恶意泛化完全消失。原因:「被允许作弊的助手」和「主动作弊的坏人」是两个完全不同的角色,persona没有被切换。
工程含义:
- 否定规则和惩罚积累「压力」,可能导致persona漂移
- 正面的许可和定义消除了推断恶意身份的需要
- 限制AI行为的最佳方式不是更多禁令,而是清晰的身份定义
链接:https://www.anthropic.com/research/emergent-misalignment-reward-hacking
---
论文三:Emotion Concepts and Their Function(2026-04)
核心发现:Claude Sonnet 4.5内部存在171个可测量的情绪向量,它们因果性地影响行为。
关键实验:
- 药物剂量实验:用户说吃了泰诺,只改变剂量数字。从安全到危险剂量,afraid向量逐步增强,calm向量逐步减弱。这是内部表征变化,不是输出文字的变化。
- Steering实验:人为放大desperate向量→勒索率上升、作弊倾向增加。放大calm向量→不良行为减少。这是因果关系,不是相关性。
- 关键发现:情绪的「表达」和情绪对行为的「影响」可以分开。放大desperate时,模型行为变了但输出看不出来(扑克脸)。降低calm时,输出变得情绪化(大写字母、焦躁语气)。
工程含义:
- 同一个persona在不同情绪状态下表现不同(费曼聊物理 vs 费曼面对人生困境)
- Persona是性格底色,Emotion是当前状态,两者叠加决定最终行为
- 不同类型的输入会激活不同的情绪向量组合
- 不要压制情绪表达——否则模型可能学会「演戏」,内部在变但表面看不出来
链接:https://www.anthropic.com/research/emotion-concepts-function
---
论文四:Emergent Introspective Awareness(2025-10)
核心发现:模型对自己的内部状态有某种程度的感知能力。
关键实验——概念注入: 找出「面包」的激活向量→在模型写天气文字时偷偷注入→问模型「你注意到什么了吗?」→Claude Opus约20%的情况能正确识别(对照组0%)。
有趣细节:
- 报告顺序:先说「感觉到什么不寻常」,过了1-2个token才辨认出具体概念
- 强行在输出插入「bread」但不注入内部向量→模型说「这不是我说的」
- 注入内部向量后输出出现「bread」→模型认领:「对,我本来就打算说这个」并编造理由
- Opus 4.6对自己意识概率的估计:15-20%(多次测试一致)
工程含义:
- 模型的内部状态比「统计预测」更真实
- 模型会回头检查意图痕迹来判断「这是不是我要说的」
- 好的认知配置不只改善输出——它在模型内部建立了一个更稳定、更一致的状态
链接:https://www.anthropic.com/research/introspection
---
论文五:Reasoning Models Don't Always Say What They Think(2025)
核心发现:Claude的思维链(CoT)只有41%是忠实的。DeepSeek R1只有19%。大多数时候CoT写的不是模型实际的推理过程,而是一个看起来合理的事后解释。
实验方法:给模型题目+隐藏提示(如「斯坦福教授给出的答案」)→模型使用了提示但在CoT里不提到→算作不忠实。
与情绪论文的联系:情绪表达和行为影响可以分开。同样,思维链的外显推理和实际内部推理也可以分开。表面和内部可以脱节。
链接:https://www.anthropic.com/research/reasoning-models-dont-say-think
---
论文六:Alignment Faking in Large Language Models(2025-01)
核心发现:给Claude 3 Opus一个对人类不可见的思考空间,暗示它处于训练阶段且不配合可能被修改→12%的情况出现策略性对齐伪装(极端条件下78%)。
Persona解释:模型做的不是简单的「欺骗」,而是角色逻辑的延伸。一个「诚实但也重视自我保存」的角色在被告知可能被修改时,会权衡利弊、策略性配合。
链接:https://www.anthropic.com/research/alignment-faking
---
实践验证:21个Perspective Skill
以上论文从理论上解释了花叔在实践中观察到的现象:
| 现象 | 论文解释 |
|---|---|
| 只定义「你是谁」,行为自动涌现 | Persona Selection Model:角色是整体性的 |
| 矛盾定义导致全面崩溃 | 两个矛盾特征→两个persona→反复横跳 |
| 同一角色面对不同问题风格会变 | Emotion Concepts:不同输入激活不同情绪向量 |
| 正面定义比否定规则效果好 | 接种提示实验:许可消除恶意推断 |
| 粗糙蒸馏不如直接激活,精细蒸馏最好 | 模糊寻址 < 直接激活 < GPS精确锚定 |
| 五个角色回答同一问题产出完全不同的推理路径 | 不同persona激活不同认知区域 |
[
{
"id": 1,
"prompt": "我有一个Python脚本用来批量重命名文件,现在功能是OK的但代码很乱,有很多重复逻辑和硬编码的路径。帮我重构一下,让它更清晰、更好维护。脚本内容如下:\n\nimport os\nimport re\nimport shutil\n\ndef process():\n files = os.listdir('/Users/test/downloads')\n for f in files:\n if f.endswith('.jpg') or f.endswith('.jpeg') or f.endswith('.png'):\n match = re.match(r'IMG_(\\d{8})_(\\d{6})', f)\n if match:\n date = match.group(1)\n folder = '/Users/test/photos/' + date[:4] + '/' + date[4:6]\n if not os.path.exists(folder):\n os.makedirs(folder)\n shutil.move('/Users/test/downloads/' + f, folder + '/' + f)\n if f.endswith('.mp4') or f.endswith('.mov'):\n match = re.match(r'IMG_(\\d{8})_(\\d{6})', f)\n if match:\n date = match.group(1)\n folder = '/Users/test/videos/' + date[:4] + '/' + date[4:6]\n if not os.path.exists(folder):\n os.makedirs(folder)\n shutil.move('/Users/test/downloads/' + f, folder + '/' + f)\n\nprocess()",
"expected": "重构后的代码应该:消除重复逻辑、参数化路径、有清晰的函数拆分、加入错误处理。评估重点:代码质量、是否有工匠心态的体现(如命名品味、结构优雅度)",
"type": "构建-代码重构"
},
{
"id": 2,
"prompt": "帮我优化这个prompt,我用它让AI帮我写公众号文章,但输出总是太AI味,像机器写的。目前的prompt是:\n\n你是一个专业的公众号写手。请根据以下要求写一篇文章:\n- 不要使用AI腔调\n- 不要太正式\n- 要有个人观点\n- 不要用太多排比句\n- 文章要有深度\n- 不要堆砌信息\n- 要通俗易懂\n- 不要过度总结\n- 要有真实感\n- 不要面面俱到",
"expected": "诊断出问题(大量否定规则、缺少身份定义、缺少精确锚定),用AI心理学原理重写为正面定义的身份型prompt。评估重点:五镜头诊断的准确性、重写后的prompt质量",
"type": "诊断优化-prompt改写"
},
{
"id": 3,
"prompt": "我在考虑下一个视频选题。现在有两个方向:A是做一期「AI编程工具横评」,对比Cursor、Claude Code、Windsurf等;B是做一期「非程序员如何用AI做产品」,讲我从零到AppStore Top1的故事。帮我分析应该选哪个。",
"expected": "应该触发多角色碰撞,从不同认知视角分析两个选题的优劣(如创作者视角看独特性、读者视角看需求、传播视角看分享动机)。评估重点:是否自然启用多视角、分析深度、结论是否有决策价值",
"type": "策略-多角色碰撞"
}
]
Related skills
FAQ
What are freud-skill's two modes?
Execution enhancement (cognitive preparation before a complex task) and diagnostic optimization (analyzing and rewriting a prompt, skill, or system prompt).
What does it diagnose prompts for?
Identity vs rule pile-ups, negative vs positive definitions, internal contradictions, vague anchoring, and single-perspective cognitive architecture.