内容受 CC BY-NC-SA 4.0 协议保护,暂不可复制。
gaolihong.com
← 返回列表

同一段 Prompt,Claude 和 Codex 写出了两个版本的我

发布于 2026/07/13· 更新于 2026/07/14
3,120 字11 分钟15 次阅读
#弋说#记录

同一份 Prompt,为什么还是写出了两个版本的我?

四个 AI 帮我改稿,最后我来定稿

稿子可以从四处来,最后的红笔还在我手里。

0 我为什么真的切到了 Codex? #

7 月 13 日,我刷到三木写 Fable 5 订阅去留的帖子。

原定 6 月 22 日移出订阅,后来推到 7 月 7 日,又变成 7 月 12 日。今天再看,日期已经到了 7 月 19 日。

看到第四个日期的时候,我第一反应是:“又来?”

因为这一串日期,我也等过。

我对 Claude Code 的依赖一直很重。它写中文很合我的心意,我现在使用的写作 Skill,也是在跟它一遍遍改稿的过程中长出来的。可模型去留和额度规则一直变,我每天打开它之前,都要先想一遍今天还能用多久。一旦额度卡进工作流,它影响的就会是一整天的安排。

我能接受产品调价,也能接受模型分层。至少把日期和规则说清楚,让我知道下周的工作该怎么排。 Fable 5 的截止日一路往后挪,反而让我认真开始了迁移。

说实话,我的火气一直冲着产品规则去。Claude 的文字能力依然很好用,这才是最尴尬的地方。每天心里都觉得烦,第二天还是会打开 Claude Code。帖子里写的那种感觉,我太熟悉了。

差不多就在这段时间,我开始把任务大量搬进 Codex。

最近 Codex 的额度显示又变了。

原先的五小时限制从我的界面里消失了,剩下周额度。中间还送过我好几次 limit reset。看起来松了一些,周额度照样紧张。好坏我现在也判断不了,总之,它确实接住了这次迁移。

有点好笑的是,六月底我还在跟朋友夸 Codex。

朋友说,Codex App 用着就觉得舒服。我回他,做产品还是 OpenAI 会做。另一段聊天里,我在骂 cc 的 UI 展示灯又变了,甚至已经开始安排回国之后的工作流:Claude Code 负责作业和规划,Codex 放在手边随缘用。

和朋友夸 Codex 的聊天记录

我当时还说了一句:“感觉要回国用 Codex 了。”

聊天记录:感觉要回国用 Codex 了

Codex 额度界面的变化

当时想得挺简单。换个 App,把 Skill 和 Memory 同步过去,事情大概就结束了。

实际切完才发现,文件很好搬,习惯很难搬。

1 工作流已经切过去了,我为什么还在别扭? #

Codex 接文件操作和资料整理的速度很快。它会自己翻目录,读完整篇文章,然后把修改直接写进 Obsidian。当然,Claude Code 也可以。

区别是 Codex 的桌面 App 也很顺手,较之半年前的版本,顺手许多,我依然喜欢它作为产品的完成度。

问题出在写文章。

同一段 Prompt,一个字都没改。两边使用的 Skill 内容一致,手工维护的 Memory 也同步过,我都直接从 CC 中导出再让 Codex 读取导入。

Codex 写出来的文章结构清楚,交付也完整,可我读完总要大改,AI 味太重了。Claude Code Opus 给出的初稿通常更接近我脑子里那个还很模糊的东西。它知道一个观点该停在哪里,也知道哪句话可以少解释半步。

如果非要说 Codex 的稿子哪里怪,我一开始还真讲不清楚。

它很完整,也很顺。每段都会把现象讲完,接着给出分析,最后再放一句适合加粗的话。单独看都对,连起来就开始显得很“AI”。我平时说话其实会跑题,会犹豫,有时写到一半才发现前面想错了。Codex 把这些毛边都收掉之后,文章反而离我远了一点。

于是我最开始的问题从“谁写得更好”,慢慢变成了:

两套系统都读过「我」,为什么还是写出了两个版本的我?

2 我到底在比什么? #

我把这个问题同时丢给了 ChatGPT 和 Claude。

ChatGPT 把重点放在模型先验和 Agent 环境上;Claude 提了一个我很喜欢的说法:我的 Skill 是在长期磨合里给 Claude 打出来的补丁,它修正的是 Claude 的默认倾向。

两边都说对了一部分。也都很有各自产品的味道。

硬要把实际对比对象写出来,大概长这样:

GPT-5.6-sol × Codex × AGENTS.md / Skill / Local Memory

Claude Opus 4.8 × Claude Code × CLAUDE.md / Skill / Auto Memory

写到这里我才意识到,模型在这条式子里只占一格。

Agent 会决定哪些文件进入上下文,也会决定什么时候加载完整 Skill。系统提示还在持续影响回答方式。

我嘴上说的是 GPT-5.6 和 Opus 4.8,手里真正打开的却是两套完整产品

这听着有点绕,可问题恰好就藏在这些绕的地方。

两个大头贴照相亭,同一个我两张成片

同一个我,两张成片。

3 “用久了更懂我”到底发生在哪里? #

每个新 Session 都会重新开始,模型权重依然是所有用户共用的参数。Claude Code 用久了以后显得更懂我,变化主要发生在窗口外面。

Claude Code 官方文档里写了两套跨会话机制。CLAUDE.md 由用户自己维护,Auto Memory 则会根据纠正和偏好积累笔记,再把这些内容带到后面的会话里。

Claude 在回答我时,把“使用时间”的影响说得很低。我后来去看它自己的文档,感觉这句话还是说得太满了。

Codex 也有本地 memory。它默认关闭,打开以后会从符合条件的历史任务里生成记忆。这个过程在后台发生,短会话可能跳过,接近 rate limit 时也可能暂缓。我这台机器已经打开 memories,所以 Codex 确实在积累关于我的内容,只是起步时间更晚。

我还顺手检查了本机的实际文件。Claude Code 在我撰写文章的 Obsidian Vault 下有一份 18 行的记忆索引,后面连着写作格式和标题审美等专题文件。Codex 的主摘要有 83 行,内容横跨最近任务和全局偏好。

两边都有记忆,走的方向却各走各的。

所以,最近才开始使用 Codex 当然有影响。这个影响落在记忆积累和双方磨合上。至于模型权重,它依然属于大家共用的那一套。

讲到这里,事情已经比“谁更懂我”复杂多了。(我最开始也没想到,写一篇文章还会顺手去看 memory 文件有多少行。好像在看日志文件)

4 同一份 Skill 为什么换了地方就变了? #

Claude 回答里的“补丁”很有意思。

风格指南通常是改出来的。模型哪次写得太满,我就加一条收束;哪种句式连续出现,我再补一条禁则。久而久之,这份文件一边记录我的偏好,一边保留了 Claude 曾经撞过的问题。

我检查过两边的那个存放我个人偏好的 Skill,都是 356 行。核心内容一致,差异主要是产品名称和指令文件路径。单看文件,它们确实算同一份。

可这份 Skill 最早是跟 Claude 一起磨出来的。

很多要求之所以写进去了,是因为 Claude 当时总在这里惹我烦。还有一些东西一直留在空白里,因为 Claude 原本就会那样处理,我也就懒得专门写。

同一份文件搬到 Codex 之后,情况自然变了。它会认真避开条例里的禁区,然后用自己的习惯补上剩余部分。偏偏那些剩余部分,常常才是“像不像我”的来源。

禁则能告诉模型哪几句会惹我烦。至于哪里会让我读得舒服,文档里写得还远远不够。

这么看,Skill 同步只能算搬完了文件。接下来还得继续改,而且要针对 Codex 的风格磨合 Skill。

同一套 Skill 换模型重新改尺寸

同一套 Skill,换个模型还要重新改尺寸。

5 剩下的差异都来自模型吗? #

模型自己的表达习惯当然存在。

OpenAI 对 GPT-5.6 的公开介绍很强调复杂生产流程和 token efficiency。提示指南里也直接写到,它的默认表达比 GPT-5.5 更简洁。放在编程任务里,这种倾向很好用;放到个人文章里,它有时会把铺垫压成结论,再顺手替我做个小结。

Anthropic 对 Opus 4.8 的介绍则提到 style direction,也把 voice 和 taste 放进了产品叙事里。至少从公开表达来看,两家公司对“好回答”的描述确实有一点差别。

Claude 还给了一个很好听的解释:代码质量容易验证,散文质量更依赖人的偏好,所以两类奖励最后塑造出不同的模型气质。

这个解释很顺。越顺,我越想先打个问号。

训练数据和后训练配方仍在黑箱里。两家公司也都在强调 coding 和 agentic work,Opus 4.8 的发布页同样写了大量工具调用与长流程任务。把我的一次写作体感直接翻译成模型训练史,跨度还是太大了。

我先把公开资料放在线索的位置。至于“本质区别”,也许还得再等等。

6 这里面有多少“看习惯了”? #

这大概是 Claude 回答里最扎心的一条:眼熟。

我用它蛮久了,它从一开始就在记我的写作偏好、语言表达,我也在学怎么跟它说话。我知道一段素材铺到什么程度就够了,也知道哪些模糊的要求丢给 Opus,它自己会往熟悉的方向补。

那段所谓“逐字相同”的 Prompt,本来就是在 Claude 的反馈里一轮轮长出来的。我省掉的内容,Claude 可能已经知道该往哪里补。Codex 看到相同的几个字,只能按照自己的习惯处理。

所以字符相同,起点其实已经带着历史。

盲测当然有用。我可以把来源去掉,隔一天再读,也可以给两边相同的正反例,再让它们各自总结一次我的风格。做到这一步,品牌带来的预期会少一些,剩下的差异也更值得继续看。

不过,眼熟本来就是使用体验的一部分。承认这一点也没什么丢人的。

7 写到这里 #

如果现在重新回答最开始的问题,我大概会这样说:

Codex 使用时间更短,它积累的记忆与改稿样本也更少。Opus 的表达习惯刚好更贴近我的审美,而我的 Skill 又在 Claude 身边长大。这些东西叠在一起,才形成了现在的体感。

一句“谁更强”显然无法囊括

实际工作流可以先照着体感走。Claude 继续处理初稿和语感展开,Codex 接资料核实与文件维护。等我攒够一批“Codex 原稿 → 我的修改稿”,再把差异整理成新的正反例。

更有意思的是,这篇文章的第一稿就是 Codex 写的。

它读了聊天截图和旧文,又检查了本机配置与官方资料。今天我嫌那份稿子 AI 味太重,又把全文交给 DeepSeek 和 Xiaomi MiMo 做了一轮中文诊断,最后回来逐句重写。

绕了一圈,这篇文章自己变成了它正在讨论的案例之一。

我一边嫌 AI “写得不像我”,一边继续让四个 AI 帮我找哪里不像。写到这里有点好笑,但也挺真实。

最终改哪句、留哪句,还是得我自己来。

总之,文件能复制,Skill 也能同步。默契先慢慢磨吧。

等我再用一段时间 Codex,也许还会回来补一节。现在先写到这里。

本文由 AI(Codex、Claude Code、DeepSeek、Xiaomi Mimo)协作写成,经能工智人审阅定稿。

参考资料 #

  1. OpenAI:Using GPT-5.6
  2. OpenAI:Build skills
  3. OpenAI:Memories
  4. OpenAI:Custom instructions with AGENTS.md
  5. Anthropic:Introducing Claude Opus 4.8
  6. Anthropic:How Claude remembers your project
  7. Anthropic:Extend Claude with skills
▸ 修改足迹 · 2 次

codex-claude-two-versions · 修改记录

  1. #c06c4ca订正 · 3 字git 同步
  2. #d691d0b首次发布git 同步

跳到 Agent,开 Harness 模式,已附上文章 slug

评论 (0)

暂无评论,留下第一条吧。

登录 注册账号 后可以评论。