没装这3个Skills,你的Codex只用了一半
如果你现在用 Codex 还是“提需求 → 等它写代码 → 自己打开网页验收”,真的太不智能了。
我重新核了一遍最近比较火的 Codex Skills。
值得尝试的优先看这 3 个:
agent-browser
代理浏览器
planning-with-files
文件规划
karpathy-guidelines
卡帕西-指导方针
先说清楚:
它们都是第三方社区工具,不是 OpenAI 官方内置 Skill。
“装完 Codex 性能翻倍”也没有任何可信 benchmark 支持。
真正补的是:
agent-browser → 浏览器执行 planning-with-files → 长任务状态管理 karpathy-guidelines → 约束 Coding 行为
Codex 本身已经支持 Agent Skills。一个 Skill 至少包含 SKILL.md,也可以附带 scripts、references、assets 等资源,让一套工作流能够重复使用。
01|agent-browser:让 Codex 写完以后自己打开网页验证
第一个是:
agent-browser
代理浏览器
这是 Vercel Labs 开源的浏览器自动化 CLI,而且官方明确写明可以配合:
Claude Code、Codex、Cursor、Gemini CLI、GitHub Copilot、OpenCode 等 Agent 使用。
Claude Code、Codex、Cursor、Gemini CLI、GitHub Copilot、OpenCode 等代理工具被广泛应用。
它能做:
打开网页 ↓ 读取页面元素 ↓ 点击按钮 ↓ 填写表单 ↓ 截图 ↓ 抓取信息 ↓ 重新检查页面状态
最实用的并不是让 Codex:
帮我打开 Google。
而是:
让 Codex 写完 Web 功能以后自己做验收。
例如你刚让它完成一个登录页。
直接继续:
使用 agent-browser 测试 http://localhost:3000/login。分别测试空密码、错误密码和正确账号。检查错误提示、页面跳转和最终登录状态。失败场景保存截图。不要修改测试账号以外的数据。
Codex 就可以走:
写代码 ↓ 启动项目 ↓ 打开网页 ↓ 填写账号 ↓ 点击登录 ↓ 检查结果 ↓ 发现问题 ↓ 修改 ↓ 重新测试
agent-browser 的典型工作方式是先运行:
agent-browser snapshot -i
拿到页面中按钮、输入框、链接等交互元素及
、
这样的引用,再进行:
agent-browser click
agent-browser fill
“hello”
页面变化之后重新 Snapshot。
Coding Agent 真正开始好用,不只是因为它能写,而是因为它开始能够验证自己写的东西。
安装
agent-browser 当前官方推荐的全局安装方式:
npm install -g agent-browser agent-browser install
第二条会下载 Chrome for Testing。
然后给 Coding Agent 安装对应 Skill:
npx skills add vercel-labs/agent-browser
这也是 agent-browser 官方给 Codex、Claude Code、Cursor 等 Agent 推荐的方式。
02|planning-with-files:给复杂任务装一个“外部工作记忆”
第二个:
planning-with-files
文件规划
它解决的是 Coding Agent 一个很现实的问题:
任务做得越长,原始目标越容易被挤出上下文。
比如你让 Codex:
给项目增加完整权限系统。
一开始很清楚。
然后开始:
分析数据库 ↓ 改 Schema ↓ 写 API ↓ 改前端 ↓ 修测试 ↓ 查 Bug ↓ 改配置
几十次 Tool Call 之后,就容易出现:
已经确认过的事情重新调查;
之前踩过的坑再踩一次;
做着做着偏离原始需求。
planning-with-files 的方法非常朴素:
重要状态不要全部存在模型上下文里,写到文件。
它核心维护 3 个 Markdown:
task_plan.md → 目标、阶段、下一步 findings.md → 调研结果、关键发现、决策 progress.md → 做过什么、测试结果、错误记录
项目作者自己甚至直接用:
Context Window = RAM
Filesystem = Disk
来解释这个设计。
所以任务即使经历较长会话、上下文压缩或者重新进入项目,Agent 仍然可以先读文件恢复工作状态。
安装
当前项目 README 给 Agent Skills 用户提供的方式是:
npx skills add OthmanAdi/planning-with-files –skill planning-with-files -g
项目当前明确列出了 Codex 支持。
安装之后可以直接告诉 Codex:
使用 planning-with-files 完成这个任务。先建立任务计划,再开始实现。重要发现写入 findings.md。每完成一个阶段更新 progress.md 和 task_plan.md。
03|Karpathy Guidelines:它是防止CodeX乱写
第三个:
karpathy-guidelines
卡帕西-指导方针
这个 Skill 做的事情完全不同。
它不提供浏览器。
也不提供数据库。
它只负责一件事:
约束 Coding Agent 的行为。
很多人用 Codex 都遇到过:
我让你修一个按钮,你为什么把整个组件重构了?
或者:
我只是让你修 Bug,为什么顺手加了几个我没要的抽象层?
Karpathy Guidelines 就是在解决这种问题。
但先纠正一个很重要的信息:
它不是 Andrej Karpathy 官方制作或发布的 Codex Skill。
当前社区 Skill 自己的说明就是:
它是根据 Andrej Karpathy 对 LLM Coding 常见问题的公开观察整理出来的一套行为指南。
核心有四条。
① Think Before Coding
先搞清楚再写。
有歧义不要偷偷替用户做决定。
先明确:
目标是什么? 有什么假设? 有没有多个理解? 有没有更简单方案?
② Simplicity First
只写解决当前问题所需要的代码。
50 行能解决:
就不要为了所谓“未来扩展”提前造 200 行框架。
③ Surgical Changes
这个特别实用。
只改完成任务真正需要改的地方。
比如用户让你修改:
LoginForm.tsx
不要顺手:
重构整个 Auth 换 CSS 架构 改十几个变量名 增加三个辅助类
每一处修改都应该能回答:
这和当前需求有什么关系?
④ Goal-Driven Execution
把:
修复这个 Bug。
转换成:
先复现问题 ↓ 建立可验证条件 ↓ 修改 ↓ 运行测试 ↓ 确认 Bug 消失 ↓ 确认相关功能没有回归
Agent 越能明确“什么叫完成”,越不容易出现写了一堆代码却没真正解决问题。
安装
目前
提供的安装方式:
npx skills add
https://github.com/multica-ai/andrej-karpathy-skills
–skill karpathy-guidelines
对应 Skill 已包含 Codex 使用所需的 Skill 元数据。
装完以后,可以显式告诉 Codex:
使用 karpathy-guidelines 修复这个 Bug。只修改完成任务必要的文件。不进行顺手重构。不增加没有要求的功能。先复现问题,修改后运行相关测试验证。
04|三个一起用才是真正有意思的地方
它们其实分别控制一个阶段:
planning-with-files ↓ 先把复杂任务管住 karpathy-guidelines ↓ 编码过程中别乱扩需求 agent-browser ↓ 最后打开真实网页验证
最终形成:
需求 ↓ Planning ↓ Coding ↓ Tests ↓ Browser 验收 ↓ 记录结果
例如你准备:
给 SaaS 增加邮箱注册功能。
可以直接给 Codex:
使用 planning-with-files 和 karpathy-guidelines 完成这个任务。目标:增加邮箱注册。第一阶段只分析项目并建立计划,不写代码。成功标准: 正常邮箱能够注册; 重复邮箱被拒绝; 非法邮箱不能提交; 注册成功后进入 Dashboard; 新增测试以及现有相关测试全部通过。修改时只动必要文件,不顺手重构。完成后使用 agent-browser 在本地页面实际完成一次正常注册和两个失败案例。最后记录测试结果和遗留问题。
这个时候 Codex 的工作模式就会更接近:
读项目 ↓ 规划 ↓ 实现 ↓ 测试 ↓ 打开网页 ↓ 真实点击 ↓ 发现问题 ↓ 修复 ↓ 再验证
而不是:
代码已经生成,请自行测试。
05|不是所有任务都启动这三个skills
如果只是:
改一个颜色 修一个错别字 解释一个函数 写一个正则
完全没必要启动复杂 Planning。
这三个 Skill 更适合:
agent-browser
Web 项目、E2E、表单、后台系统、Browser Automation。
planning-with-files
复杂研究、3+ 阶段任务、大量 Tool Call、可能跨长 Session 的工作。
项目自己也主要把它定位在这类长任务。
karpathy-guidelines
Debug、老项目维护、局部修改、重构,以及你最担心 Agent “越改越多”的任务。
它自己也明确提醒:
这些指南倾向谨慎,简单任务不要机械套用。
06|最后一个避坑:第三方 Skill 不要无脑安装
这一点我认为比推荐哪 3 个更重要。
Codex Skill 并不一定只有一份 Markdown。
OpenAI 当前 Skill 规范允许包含:
SKILL.md scripts/ references/ assets/
其中 scripts 可以是真正可执行的 Python、Bash 等代码。
所以第三方 Skill 安装前至少先看:
SKILL.md scripts/ Hooks 需要调用哪些外部工具 会执行什么命令
Skill 本质上是在扩大 Agent 的能力边界,所以安装 Skill 和安装普通 Prompt 不是同一件事。
尤其是带:
浏览器控制;
文件修改;
Shell;
Hooks;
账号登录;
外部 API;
的 Skill。
优先看源码,再决定是否长期启用。
最后
很多人使用 Codex 的第一反应是:
换一个更强模型。
但真正做大型项目以后你会发现:
模型只是其中一部分。
一个 Coding Agent 还需要:
任务不跑偏。
代码别乱改。
结果能自己验证。
这 3 个 Skill 刚好分别对应:
planning-with-files:管理复杂任务。
karpathy-guidelines:控制工程行为。
agent-browser:完成真实网页验收。



