如果你现在用 Codex 还是“提需求 → 等它写代码 → 自己打开网页验收”,真的太不智能了。

我重新核了一遍最近比较火的 Codex Skills。

值得尝试的优先看这 3 个:

agent-browser
代理浏览器

planning-with-files
文件规划

karpathy-guidelines
卡帕西-指导方针

先说清楚:

它们都是第三方社区工具,不是 OpenAI 官方内置 Skill。

“装完 Codex 性能翻倍”也没有任何可信 benchmark 支持。

真正补的是:

agent-browser → 浏览器执行 planning-with-files → 长任务状态管理 karpathy-guidelines → 约束 Coding 行为

Codex 本身已经支持 Agent Skills。一个 Skill 至少包含 SKILL.md,也可以附带 scripts、references、assets 等资源,让一套工作流能够重复使用。

01|agent-browser:让 Codex 写完以后自己打开网页验证

第一个是:

agent-browser
代理浏览器

这是 Vercel Labs 开源的浏览器自动化 CLI,而且官方明确写明可以配合:

Claude Code、Codex、Cursor、Gemini CLI、GitHub Copilot、OpenCode 等 Agent 使用。
Claude Code、Codex、Cursor、Gemini CLI、GitHub Copilot、OpenCode 等代理工具被广泛应用。

它能做:

打开网页 ↓ 读取页面元素 ↓ 点击按钮 ↓ 填写表单 ↓ 截图 ↓ 抓取信息 ↓ 重新检查页面状态

最实用的并不是让 Codex:

帮我打开 Google。

而是:

让 Codex 写完 Web 功能以后自己做验收。

例如你刚让它完成一个登录页。

直接继续:

使用 agent-browser 测试 http://localhost:3000/login。分别测试空密码、错误密码和正确账号。检查错误提示、页面跳转和最终登录状态。失败场景保存截图。不要修改测试账号以外的数据。

Codex 就可以走:

写代码 ↓ 启动项目 ↓ 打开网页 ↓ 填写账号 ↓ 点击登录 ↓ 检查结果 ↓ 发现问题 ↓ 修改 ↓ 重新测试

agent-browser 的典型工作方式是先运行:

agent-browser snapshot -i

拿到页面中按钮、输入框、链接等交互元素及

@e1

@e2

这样的引用,再进行:

agent-browser click

@e1

agent-browser fill

@e2

“hello”

页面变化之后重新 Snapshot。

Coding Agent 真正开始好用,不只是因为它能写,而是因为它开始能够验证自己写的东西。

安装

agent-browser 当前官方推荐的全局安装方式:

npm install -g agent-browser agent-browser install

第二条会下载 Chrome for Testing。

然后给 Coding Agent 安装对应 Skill:

npx skills add vercel-labs/agent-browser

这也是 agent-browser 官方给 Codex、Claude Code、Cursor 等 Agent 推荐的方式。

02|planning-with-files:给复杂任务装一个“外部工作记忆”

第二个:

planning-with-files
文件规划

它解决的是 Coding Agent 一个很现实的问题:

任务做得越长,原始目标越容易被挤出上下文。

比如你让 Codex:

给项目增加完整权限系统。

一开始很清楚。

然后开始:

分析数据库 ↓ 改 Schema ↓ 写 API ↓ 改前端 ↓ 修测试 ↓ 查 Bug ↓ 改配置

几十次 Tool Call 之后,就容易出现:

已经确认过的事情重新调查;

之前踩过的坑再踩一次;

做着做着偏离原始需求。

planning-with-files 的方法非常朴素:

重要状态不要全部存在模型上下文里,写到文件。

它核心维护 3 个 Markdown:

task_plan.md → 目标、阶段、下一步 findings.md → 调研结果、关键发现、决策 progress.md → 做过什么、测试结果、错误记录

项目作者自己甚至直接用:

Context Window = RAM

Filesystem = Disk

来解释这个设计。

所以任务即使经历较长会话、上下文压缩或者重新进入项目,Agent 仍然可以先读文件恢复工作状态。

安装

当前项目 README 给 Agent Skills 用户提供的方式是:

npx skills add OthmanAdi/planning-with-files –skill planning-with-files -g

项目当前明确列出了 Codex 支持。

安装之后可以直接告诉 Codex:

使用 planning-with-files 完成这个任务。先建立任务计划,再开始实现。重要发现写入 findings.md。每完成一个阶段更新 progress.md 和 task_plan.md。

03|Karpathy Guidelines:它是防止CodeX乱写

第三个:

karpathy-guidelines
卡帕西-指导方针

这个 Skill 做的事情完全不同。

它不提供浏览器。

也不提供数据库。

它只负责一件事:

约束 Coding Agent 的行为。

很多人用 Codex 都遇到过:

我让你修一个按钮,你为什么把整个组件重构了?

或者:

我只是让你修 Bug,为什么顺手加了几个我没要的抽象层?

Karpathy Guidelines 就是在解决这种问题。

但先纠正一个很重要的信息:

它不是 Andrej Karpathy 官方制作或发布的 Codex Skill。

当前社区 Skill 自己的说明就是:

它是根据 Andrej Karpathy 对 LLM Coding 常见问题的公开观察整理出来的一套行为指南。

核心有四条。

① Think Before Coding

先搞清楚再写。

有歧义不要偷偷替用户做决定。

先明确:

目标是什么? 有什么假设? 有没有多个理解? 有没有更简单方案?

② Simplicity First

只写解决当前问题所需要的代码。

50 行能解决:

就不要为了所谓“未来扩展”提前造 200 行框架。

③ Surgical Changes

这个特别实用。

只改完成任务真正需要改的地方。

比如用户让你修改:

LoginForm.tsx

不要顺手:

重构整个 Auth 换 CSS 架构 改十几个变量名 增加三个辅助类

每一处修改都应该能回答:

这和当前需求有什么关系?

④ Goal-Driven Execution

把:

修复这个 Bug。

转换成:

先复现问题 ↓ 建立可验证条件 ↓ 修改 ↓ 运行测试 ↓ 确认 Bug 消失 ↓ 确认相关功能没有回归

Agent 越能明确“什么叫完成”,越不容易出现写了一堆代码却没真正解决问题。

安装

目前

skills.sh

提供的安装方式:

npx skills add

https://github.com/multica-ai/andrej-karpathy-skills

–skill karpathy-guidelines

对应 Skill 已包含 Codex 使用所需的 Skill 元数据。

装完以后,可以显式告诉 Codex:

使用 karpathy-guidelines 修复这个 Bug。只修改完成任务必要的文件。不进行顺手重构。不增加没有要求的功能。先复现问题,修改后运行相关测试验证。

04|三个一起用才是真正有意思的地方

它们其实分别控制一个阶段:

planning-with-files ↓ 先把复杂任务管住 karpathy-guidelines ↓ 编码过程中别乱扩需求 agent-browser ↓ 最后打开真实网页验证

最终形成:

需求 ↓ Planning ↓ Coding ↓ Tests ↓ Browser 验收 ↓ 记录结果

例如你准备:

给 SaaS 增加邮箱注册功能。

可以直接给 Codex:

使用 planning-with-files 和 karpathy-guidelines 完成这个任务。目标:增加邮箱注册。第一阶段只分析项目并建立计划,不写代码。成功标准: 正常邮箱能够注册; 重复邮箱被拒绝; 非法邮箱不能提交; 注册成功后进入 Dashboard; 新增测试以及现有相关测试全部通过。修改时只动必要文件,不顺手重构。完成后使用 agent-browser 在本地页面实际完成一次正常注册和两个失败案例。最后记录测试结果和遗留问题。

这个时候 Codex 的工作模式就会更接近:

读项目 ↓ 规划 ↓ 实现 ↓ 测试 ↓ 打开网页 ↓ 真实点击 ↓ 发现问题 ↓ 修复 ↓ 再验证

而不是:

代码已经生成,请自行测试。

05|不是所有任务都启动这三个skills

如果只是:

改一个颜色 修一个错别字 解释一个函数 写一个正则

完全没必要启动复杂 Planning。

这三个 Skill 更适合:

agent-browser

Web 项目、E2E、表单、后台系统、Browser Automation。

planning-with-files

复杂研究、3+ 阶段任务、大量 Tool Call、可能跨长 Session 的工作。

项目自己也主要把它定位在这类长任务。

karpathy-guidelines

Debug、老项目维护、局部修改、重构,以及你最担心 Agent “越改越多”的任务。

它自己也明确提醒:

这些指南倾向谨慎,简单任务不要机械套用。

06|最后一个避坑:第三方 Skill 不要无脑安装

这一点我认为比推荐哪 3 个更重要。

Codex Skill 并不一定只有一份 Markdown。

OpenAI 当前 Skill 规范允许包含:

SKILL.md scripts/ references/ assets/

其中 scripts 可以是真正可执行的 Python、Bash 等代码。

所以第三方 Skill 安装前至少先看:

SKILL.md scripts/ Hooks 需要调用哪些外部工具 会执行什么命令

Skill 本质上是在扩大 Agent 的能力边界,所以安装 Skill 和安装普通 Prompt 不是同一件事。

尤其是带:

浏览器控制;

文件修改;

Shell;

Hooks;

账号登录;

外部 API;

的 Skill。

优先看源码,再决定是否长期启用。

最后

很多人使用 Codex 的第一反应是:

换一个更强模型。

但真正做大型项目以后你会发现:

模型只是其中一部分。

一个 Coding Agent 还需要:

任务不跑偏。

代码别乱改。

结果能自己验证。

这 3 个 Skill 刚好分别对应:

planning-with-files:管理复杂任务。

karpathy-guidelines:控制工程行为。

agent-browser:完成真实网页验收。