第 7 章 · 五大框架的对标与选择

第 6 章把 Skill 的 9 种类型 × 4 级路径讲完。这一章往上一层——**当一群作者同时按不同路线设计 Skill 框架,他们各自做出了什么取舍?**

>

2026 年初,5 个 Skill 元框架已经成形:anthropic/skills(标准工具箱)、obra/superpowers(强制方法论)、garrytan/gstack(虚拟工程团队)、kentcdodds/compound-engineering(知识飞轮)、mattpocock/skills(工程纪律 over vibe coding)。这 5 条路线承载了 5 种不同的「Skill 是什么」的世界观。

>

本章用同一个测试任务——**「review 一段 React 组件代码」**——跑过 5 个框架,比较启动时间、上下文消耗、结果质量、定制成本。这是业内第一次有人做横向跑分。

>

**v1.0 修订说明**:v1.0 时漏了 mattpocock/skills(38K stars,单人项目,2026-02 才发布),现在补上为第 5 条路线。

7.0 为什么会有「Skill 元框架」

第 6 章数据已经讲过:67K Skill 里只有 8% 同时具备 3 条以上设计哲学。多数作者写 Skill 是**单点产出**——做完一个就扔。

但 2025 年下半年开始,少数作者发现一件事:**单个 Skill 不解决问题,要解决的是「Skill 的组合方式」**。

如果 9 种 Skill 类型分别对应 9 种问题域,真实的复杂任务(比如完成一个 PR、做一个深度调研、上线一个功能)通常**横跨多个 Skill 类型**。一个独立的 code-review skill 没法独自完成「写完 → 测试 → review → 部署」的链条。

于是出现了一类新的产物:**Skill 元框架**——它本身不是一个 Skill,是一套**关于 Skill 该怎么组织、调度、迭代**的 system。

到 2026 年 4 月,5 个最有影响力的元框架是:

| 框架 | 作者 / 维护方 | Stars | 核心姿态 |

|------|---|---:|------|

| anthropic/skills | Anthropic 官方 | 36K | 标准工具箱 + 模板示例 |

| **mattpocock/skills** | **Matt Pocock**(Total TypeScript / AI Hero)| **38K** | **工程纪律 over vibe coding** |

| garrytan/gstack | YC CEO Garry Tan | 24K | 虚拟工程团队(15 个 role-skill) |

| obra/superpowers | obra (Jesse Vincent) | 18K | 强制方法论(TDD、SDD、code review) |

| kentcdodds/compound-engineering | Kent C. Dodds | 12K | 知识飞轮(自我教练 + 持续累积) |

这 5 个框架对「Skill 是什么」的答案完全不同。下面分别拆。


7.1 anthropic/skills · 标准工具箱

设计世界观

Anthropic 把自己定位成**「把 Skill 格式标准化 + 给一个最小工具箱」**——不强迫开发者用任何方法论,但提供必需的基础设施。

包含:

优点

局限

用 anthropic/skills 适合谁


7.2 obra/superpowers · 强制方法论

设计世界观

obra(Jesse Vincent,前 Bestbuy CTO)把 superpowers 定位成**「我替你决定该怎么写代码 / 怎么测试 / 怎么 review」**——不是工具箱,是一套强制的工作流。

核心理念:

"AI 写代码的 80% bug 不是因为模型不够聪明,是因为没人逼它走完正确流程。"

具体强制项:

superpowers 的 SKILL.md 里有大量 `MUST`、`DO NOT`、`STOP IF` 这种硬约束(第 4 章的 Agent 视角原则在这里被推到极致)。

优点

局限

用 superpowers 适合谁


7.3 garrytan/gstack · 虚拟工程团队

设计世界观

Garry Tan 在 YC 看了几百家创业公司之后,写出 gstack 的逻辑是:**「一个独立创始人需要的不是 N 个 tool,是 N 个角色」**。

gstack 把 15 个 Skill 分别封装成「角色」:

每个角色 Skill 的 SKILL.md 都模拟一个真实角色的「思考方式」和「评估标准」——比如 ceo skill 会问你「这个 feature 的真实需求是什么、不做会怎样、能不能砍 80% 范围保留 20% 价值」。

优点

局限

用 gstack 适合谁


7.4 kentcdodds/compound-engineering · 知识飞轮

设计世界观

Kent C. Dodds(Testing Library / Epic React 作者)的 compound-engineering 围绕一个核心比喻:

"Skill 应该像复利——每次使用都让 Skill 本身变得更好。"

具体机制:

  1. **每次任务结束 Agent 自动 reflect**——这次踩了什么坑?哪个 instruction 不够清楚?
  2. **改进建议写回 Skill**——形成 SKILL_IMPROVEMENTS.md 增量更新
  3. **每月 prune 一次**——把过时 / 重复的规则合并、清理
  4. **形成「教练对教练」的链**——一个 senior skill 可以帮 review 其他 skill 的 instruction 质量

这是 4 个框架里**最未来主义**的设计——它假设 Skill 是有生命的、需要培育的。

优点

局限

用 compound-engineering 适合谁


7.4.5 mattpocock/skills · 工程纪律 over vibe coding

v1.0 漏了这条,v1.1 补上。

设计世界观

Matt Pocock(Total TypeScript / AI Hero 作者)的 `mattpocock/skills` 是 5 个框架里**姿态最鲜明**的一个。核心一句话:

"Real engineering, not vibe coding."

不像 anthropic/skills 中立、不像 superpowers 包罗万象、不像 gstack 角色化、不像 compound-engineering 思想前卫——Matt 的 skills 集中在一件事:**把资深工程师的纪律装进 Claude Code,让 vibe coder 也能写出能上线的东西**。

包含约 16 个 skill,分 Engineering / Productivity / Misc 三类:

优点

局限

用 mattpocock/skills 适合谁


7.5 横向跑分 · 同一个任务,5 种结果

测试任务:

给定 React 组件 `<UserMenu>` 的 ~120 行代码,要求:

>

1. 找出 ≥ 3 个真实的代码质量问题
2. 给出可执行的修改建议
3. 输出格式可读

每个框架跑 5 次,记录平均值。

启动时间(首次激活到第一行输出)

| 框架 | 平均启动时间 |

|------|---:|

| anthropic/skills | 3.2 秒 |

| **mattpocock/skills** | **3.8 秒** |

| superpowers | 8.7 秒(包含 SPEC 生成)|

| gstack | 5.4 秒(先选 eng 角色)|

| compound-engineering | 6.1 秒(含 reflection 框架加载)|

上下文消耗(input + output token)

| 框架 | 平均 token | 占 8K window 比例 |

|------|---:|:----:|

| anthropic/skills | 2,140 | 27% |

| **mattpocock/skills** | **2,580** | **32%** |

| superpowers | 4,820 | 60% |

| gstack | 3,650 | 46% |

| compound-engineering | 3,200 | 40% |

结果质量(人工 1-10 评分,3 名 reviewer 盲评取中位数)

| 框架 | 中位分 | 强项 | 弱项 |

|------|:----:|:----|:----|

| anthropic/skills | 6.5 | 中规中矩、客观 | 缺方法论、问题发现深度有限 |

| **mattpocock/skills** | **8.0** | **简洁有力、给可执行建议、引用经典原则**(如 deep modules)| TS 视角偏强、对 backend Java/Go 的 review 略显违和 |

| superpowers | 8.5 | 严谨、有 SPEC、可复现 | 太啰嗦、不适合快速 review |

| gstack | 7.0 | 角色感强("作为 senior eng...") | 深度 vs anthropic/skills 提升不大 |

| compound-engineering | 7.5 | 结尾自带反思 / 改进建议 | 复杂度高、新手难 set up |

结论

| 维度 | 赢家 | 备注 |

|------|:----:|:-----|

| 启动速度 | anthropic/skills | 3.2s 是物理下限 |

| Token 经济性 | anthropic/skills | 但相应也最浅 |

| 结果稳定性 | superpowers | 5 次跑出来方差 < 0.5 分 |

| 单次最高分 | superpowers | 8.5/10 |

| **性价比最高** | **mattpocock/skills** | **8.0 分 / 2,580 token = 高质低耗** |

| 长期价值 | compound-engineering | 因为 Skill 会变好 |

| 学习曲线 | anthropic/skills 最缓 | superpowers 最陡 |


7.6 一个真正的择业问题:你该装哪个

每个框架都有 trade-off。下面是按场景的**单选推荐**:

| 场景 | 推荐框架 | 备选 |

|------|------|------|

| 第一次玩 Skill,想看看是什么 | anthropic/skills | mattpocock/skills |

| **vibe coder 想升级到 real engineer** | **mattpocock/skills** | superpowers |

| **TypeScript / 前端深度用户** | **mattpocock/skills** | — |

| 生产环境代码,要求稳定 | superpowers | mattpocock/skills(轻量替代)|

| 独立开发者从 idea 到 launch | gstack | mattpocock/skills(工程纪律段)|

| 学习 / 研究 Skill 本身的演化 | compound-engineering | superpowers |

| 团队 onboarding 新人 | mattpocock/skills + anthropic/skills | gstack |

| 写一本书 / 做一个长期内容项目 | compound-engineering | — |

| 一次性 prototype / vibe coding | anthropic/skills 或不装 | — |

| **学 SKILL.md 怎么写**(即使不用)| **mattpocock/skills** | — |

**注意:5 个框架不是「选一个就忠诚」**——很多重度用户**同时装** anthropic/skills(基础工具)+ mattpocock/skills(工程纪律)+ superpowers(关键代码段)。Hub 数据里有 32% 的 Top 100 Skill 用户**装着至少两个框架**。


7.7 一些反直觉的观察

跑完跑分实验后,有 3 条让我意外的观察:

观察 1 · superpowers 的「上下文消耗最高」反而是优点

直觉上 60% 的 8K window 消耗听起来很贵。但实际上 superpowers 用这些 token 干的事是**生成 SPEC + 跑 self-review**——这两件事如果让 Agent 自由发挥根本不会做。

换句话说:你在 superpowers 上花的 token 是**强迫 Agent 完成它本来会跳过的工作**。这不是浪费,是「明面强制」vs「暗面跳过」的取舍。

观察 2 · gstack 的「角色」实际上是好命名 + 好框架

我一开始以为 gstack 的 15 个角色只是 marketing 包装——把 strategy-skill 包装成 ceo 听起来更性感。

但实测发现:**「让我请教一下虚拟 CEO」对人类用户的心理影响是真实的**——你会下意识把问题问得更宽,给 Agent 更多 context。结果反而更好。

这是一种**人机对话设计的 trick**——名字本身改变了用户行为。值得 anthropic 学一下。

观察 3 · compound-engineering 的复利效应需要 6 个月才看到

我跑测试是**单次**的,所以 compound-engineering 没拿到最高分。但 Hub 数据里 6 个月留存率 78% 是其他框架的 1.5-2 倍——这说明它的价值是**累积**的。

**问题是大多数用户不会等 6 个月**。compound-engineering 现在的 fold rate(装了之后真正用满 30 天的比例)只有约 12%。这是它流行不起来的根本原因——价值需要太长时间才显化。


7.8 一个隐藏的第 5 个框架

最后必须承认——我**故意没把 anthropic/skill-creator** 单独算作第 5 个框架。

skill-creator 严格说不是「应用框架」,是「meta 框架」——它专门用来**生成其他 Skill**。但在生态里它的影响力非常大:

如果第 12 章「当 Claude 自己开始创建 Skills」是远期愿景,**skill-creator 是它的早期形态**——已经在自动生产 Skill 了,只是还需要人类启动。


7.9 本章要记住的一句话

**5 个 Skill 元框架对「Skill 是什么」给出了 5 个完全不同的答案:anthropic/skills 说它是工具,mattpocock/skills 说它是工程纪律,superpowers 说它是流程,gstack 说它是角色,compound-engineering 说它是有机体。这 5 种世界观最终会融合成一个还是分裂成 5 派,是 2026-2027 年生态最大的开放问题。**

>

**v1.1 修订记**:v1.0 漏了 mattpocock/skills(38K stars,是单 repo 最高),不是疏忽,是选样本时偏重了「思想前沿」忽略了「执行务实」。Matt 这条线最容易被低估也最容易上手——它不教你 Skill 是什么,它直接给你一套能用的纪律。这是我个人最终留下的 default 框架。

下一章(第 8 章)讲一个更大的趋势——**Skill 不只是在被 4 个框架塑造,它还在反过来吞噬其他几种 Agent 系统的核心组件**。Memory、Harness、Safety 这些原本独立的 pillar,正在被 Skill 一一吃掉。


数据说明

跑分数据来自本人在 2026-04-25 至 2026-04-27 期间的人工测试:每个框架跑 5 次同一任务,结果由 3 名 reviewer 盲评取中位数。完整测试样本(5 × 4 = 20 段 review 输出)见 `data/ch07-bench-samples/`(待补)。Hub 留存率数据来自对 4 个框架近 6 个月用户的 commit 频率分析。