本文作者:meng shao(@shao__meng)。版权归作者所有,未经授权禁止转载。


Agent Skills | LIVE150 | MSBuild 2026

Microsoft Build 2026 现场访谈,嘉宾为 Addy Osmani(刚刚加入 Anthropic),主持人为微软的 Burke Holland。主题:什么是 Agent Skills、如何设计、以及一场从模糊想法到可运行应用的全流程演示。

核心命题:Skill 是什么

Addy 给出的定义很朴素——Skill 是把专业判断打包成 AI Agent 可执行工作流的标准化方式​。他打了个类比:早年开发者互相分享 dotfiles,Skill 就是新时代的 dotfiles——有人拿来直接抄,有人拿来找灵感。

技术上有三个关键特征:

  1. 结构极简​:每个 Skill 的必备内容只有名字和描述,其余按需展开;
  2. 可复用​:一次性的需求用 prompt 就够了,Skill 对应的是跨项目、团队级的重复性工作流;
  3. 渐进式加载​:模型平时只看到名字和一句话描述,任务匹配时才加载完整内容,再按需加载其引用的文件。这一点在视频结尾被两位讲者反复强调——在“按 token 计价”的时代,这是 Skill 相对 MCP 的核心经济性优势。

Addy 的差异化视角:按软件研发生命周期(SDLC)组织 Skill

市面上大多数 Skill 仓库是零散的工具集合,Addy 的仓库(多次登上 Hacker News 首页,受 Gary Tan 的 Gstack 启发)则围绕 Define → Plan → Build → Verify → Review → Ship 六个阶段组织,每个阶段映射多个 Skill(需求访谈、规格驱动开发、任务拆解、TDD、浏览器自动化测试、代码评审循环、CI 与发布等)。

Agent Skills: https://github.com/addyosmani/agent-skills

每个 Skill 内部遵循统一的设计模式——这也是全场最值得记下的方法论:

  • Overview​:什么时候该用;
  • Rationale​:为什么该用 / 为什么不该用(给 Agent 设护栏);
  • Red flags​:执行偏离轨道的信号;
  • Verification​:怎么确认步骤做对了。

这套结构本质上是把“资深工程师的隐性判断”显式化,让 Agent 有章可循。所有 Skill 都映射为斜杠命令(如 /refine /spec /plan),可在 Copilot 等任意 Agent 编码工具中触发。

现场演示:45 分钟从一句话到完整应用

Addy 用一个模糊想法——“做一个 GitHub 风格的习惯追踪器,纯浏览器存储,不要数据库”——现场走完全流程(VS Code + Gemini 3.5 Flash):

  • /refine(需求澄清)​:Agent 主动追问目标用户、存储方案(localStorage/IndexedDB)、MVP 成功标准,然后产出问题陈述、三条产品方向(GitHub 个人页克隆 / 键盘驱动的习惯终端 / Markdown-SVG 导出工具)、待验证假设和明确的非目标(不做云同步、不做社交功能);
  • /spec(规格生成)​:读取上一阶段产出,生成含成功标准、性能指标(如 LCP)、技术栈(vanilla JS + Vitest + Playwright)、项目结构的详细规格——注意技术栈是 Agent 的合理默认假设而非用户指定,Addy 指出这类默认值同样可以编码进 Skill;
  • /plan(任务拆解)​:把规格拆成带验收标准、验证方式和“预计触碰文件清单”的任务——后者是为了限制爆炸半径​,防止 Agent 改动无关文件;
  • /build(TDD 实现)​:每个切片严格走红-绿循环,数据层、可视化、UI 逐层构建,测试通过后才推进;
  • /verify(浏览器验证)​:自动构建、启动开发服务器、在 VS Code 内置浏览器中实际操作 UI 检查是否可用;
  • /review(评审循环)​:从正确性、安全(XSS)、可读性、架构、性能多维度审查,并给出人类没想到的建议(如贡献图格子的键盘导航),随后执行代码简化循环——有测试兜底,才敢放心让 Agent 重构。

访谈中最有思辨价值的几个观点

1. 人在回路中的代价。 分阶段构建带来信心(“数据层做完,其他东西没坏”),但 Burke 直言:人一介入就拖慢了 Agent——你自己成了瓶颈。Addy 的回应很务实:这是投资位置的选择,前重(spec/TDD)或后重(大量生成再评审),没有标准答案。

2. 尽责程度应与风险成正比。 Addy 批评行业用“大而化之的最佳实践”覆盖所有场景:solo founder 的练手项目和有存量用户的复杂系统需要的纪律完全不同。他提出一个谱系——vibe coding 到 agentic engineering 之间连续过渡,越是存在存量用户,越有义务关注质量​。做习惯追踪器和维护 VS Code 不是一个量级。

3. 安全审查的非确定性困境。 Burke 追问:代码正确性错了能兜住,安全漏洞兜不住,你有多信任非确定性的 Agent 安全评审?Addy 承认 Skill 只是“理智检查”,更深的安全需要专门工具。Burke 的金句值得单独摘出:“现在 Markdown 成了一切的解药——我们有非确定性问题,解决方案是引入更多非确定性(文本文件)。” 他呼吁行业需要真正的确定性门禁。

4. “我们都成了麦肯锡顾问”。 Burke 对新工种的定义:工程师的工作重心从写代码转向构建可靠的工作流——而且不同项目、同一组织内都不通用。这是对“AI 时代工程师职能”最直白的一次概括。

5. Q&A 两个实操结论​:

  • 多模型分工​:用低成本模型(如 Flash)做规划,用强模型做实现,兼顾成本与质量;
  • MCP vs Skill​:Addy 认为趋势在回归 CLI(Agent 极擅长用命令行),但 Burke 补充了关键反驳——MCP 在认证与权限控制上不可替代(引自 OpenCode 的 Reese)。两人共识:Skill 的渐进式加载在 token 经济性上占优;Burke 实际只保留两个 MCP:Work IQ(微软生态)和 Context7(强制 Agent 先读文档再动手)。