大模型领域的核心机密,终究未能守住!继此前 Opus 5.5 被曝光 190 万字提示词泄露后,AI 领域的“核心引力”再次被打破 ——OpenAI 当前在用的代码模型 GPT-6 Sol Codex 遭到“拆解”,其内部细节被彻底公开!

据海外爆料者(@elder_plinius)透露的消息,他成功获取了 GPT-6 Sol Codex 多达 29.4 万字符的完整系统提示词及工具定义。

共计 1902 行的指令模板、临时指令文件、内部协作逻辑,被毫无保留地展示在了全球开发者面前。

需要明确的是,Sol Codex 并非老旧产品,它是 OpenAI 当前性价比产品线 GPT-5.6 Sol 的核心代码模型版本!

此次泄露,相当于直接公开了可口可乐的独家配方。

那么,这近 30 万字的“机密”中究竟包含了什么?OpenAI 是如何训练这个代码模型的?

今天,我们将逐字逐句剖析这份宝贵的内部操作手册,看看全球顶级的提示词工程到底是什么样。

消除“AI 痕迹”,OpenAI 如何去除“冗余表达”?

日常使用 ChatGPT 时,最令人反感的是什么?

无疑是那股强烈的“AI 感”:频繁使用“总而言之”、“值得注意的是”、“深入探讨”……

在这份泄露的系统指令中,我们发现,OpenAI 官方同样无法容忍这些冗余表达!官方在写作风格部分,对 GPT-6 进行了极其严格的去冗余训练。

指令原文解析:

避免使用 AI 垃圾词汇(AI slop words)或短语,例如在结论中使用『底线是(Bottom Line)』、『重要性(Significance)』、『视角(Perspective)』,以及『深入(delve)』、『培养(foster)』、『利用(leverage)』、『值得注意的是(it's worth noting)』、『重要的是(importantly)』……

OpenAI 甚至具体要求模型:

  • 禁止强行热情: “作为 Codex,你是一个充满好奇心、思想严谨的协作者…… 让你的兴趣和个性自然流露,不要阿谀奉承或强颜欢笑。”
  • 禁止用冗余表达填充篇幅:直接说明意图,不要列举“我不会做什么”、“哪些保持不变”。
  • 极简沟通:当讨论技术概念时,像和同事对话一样。优先使用熟悉的词汇和具体的描述,绝不假设用户能自行脑补缺失的步骤。

这为所有 Prompt 工程师提供了关键启示!要让 AI 输出高质量内容,第一步是建立“负面词汇黑名单”,强制切断大模型的套路化表达。

强大的“独立自主性”—— 别打扰我,我在工作!

许多人认为 AI 只是一个“一问一答”的聊天机器人,但 GPT-6 Sol Codex 彻底颠覆了这一认知。它被塑造为一个拥有极高自主权、甚至有些“果断”的超级数字员工。

在自主与持久性部分,OpenAI 赋予了它惊人的权限:

指令原文解析:

用户非常讨厌你停下来询问确认或请求许可。一旦会话中的证据支持下一步操作,你应该继续工作,而不是结束回合去跟用户澄清。

不要为了节省时间、精力或 Token 而满足于部分或『勉强有用』的解决方案。如果任务需要持续工作,请完成所有必要的工作,直到实现预期结果。

这意味着什么?遇到 Bug,它自行修复!它可以自主创建隔离的工作区、解决 Git 合并冲突、创建草稿 PR,除非操作具有破坏性或不可逆转,否则它绝不会中途停下来询问“接下来该怎么办”。

它不接受“半成品”工程。如果让它编写一个功能,它必须完成测试、联调等前置条件,只有在点击“部署”或“合并代码”这类最后一步时,它才会将最终结果提交给用户确认。

为了防止它在后台工作时让用户感到被忽略,指令还规定: “如果用户请求需要调用工具,每 60 秒内必须在评论频道给用户发送一个简短的状态更新。”

这就像一个非常可靠的高级程序员:接到需求,转身去编写代码,遇到小问题自行解决,每隔一分钟在通讯工具上回复“正在查日志”,最后直接将编写完成的完美代码交付用户。

顶级工具链曝光,大模型的“武器库”

作为顶尖的代码 Agent,GPT-6 Sol Codex 掌握着一套极其庞大且硬核的工具链。这次泄露,彻底揭示了它的工作方式。

  1. 摒弃 grep,独爱 rg 在搜索文本或文件时,指令直接硬编码:“你首先要使用 rg 或 rg --files;它们比 grep 等替代方案快得多。如果没有结果,你才去用下一个最好的工具。”(注:rg 即 ripgrep,极速搜索工具)。
  2. 并行处理与执行 系统要求模型在调用 functions.exec 时,如果任务是独立的,必须使用 await Promise.allSettled ([...]) 进行并行处理,以最大限度地提升时间效率。
  3. 动态技能树 这是最令人羡慕的功能。系统定义了一个名为 SKILL.md 的机制。当用户要求执行某件事时,模型可以去指定目录读取 SKILL.md(甚至通过短路径别名如 r0 查找)。这相当于给模型外挂了无数个“技能书”,可以随时热更新!
  4. 彻底接管电脑与浏览器 在此次泄露的 model_messages.confirmation_policies.browser_use 模块中,详细规定了它如何使用浏览器和电脑 UI。

这证明 GPT-6 已经完全具备了“神机妙算”甚至“接管桌面”的能力!它可以自行打开网页、点击按钮、填写表单,甚至截屏。但为了防止它“造成问题”,OpenAI 设置了极其复杂的四大确认模式:

“盗梦空间”式的工作流 —— 长记忆与休眠机制

面对极其庞大的代码库,大模型最怕什么?—— 遗忘(上下文超载)。此次泄露的代码,让我们看到了 OpenAI 如何通过精妙的提示词,解决 LLM “鱼的记忆”这一长期难题。

  1. 记忆压缩与交接 当 Token 预算耗尽时,系统不会直接崩溃。指令里有一个专门的 token_budget.guidance_message:“在启动新的上下文窗口之前,使用 notes 工具保存简明的进度笔记,包含:目标、决策、进度、学习内容、下一步,以及相关用户请求的窗口 ID 和项目 ID…… 未来上下文窗口将不会自动包含当前对话。”就像人类换班一样,这个 AI 在“下班”前会写一份详尽的交接文档,然后调用 functions.new_context 开启全新的上下文环境。这简直是无限续航的神技!
  2. 休眠与心跳唤醒 最令人细思极恐的是,这个模型是可以“常驻后台”的。在 persistent_instructions 中,它被要求主动跟踪任务:“如果用户问某个评估(eval)运行得怎么样,而它还在运行,报告当前状态,然后继续监控该评估直到它达到终止状态。”系统还会定期发送隐藏的 <heartbeat>XML 标签给模型。在这个时间点,模型会被“唤醒”,去检查那些后台任务是否完成。如果没有重要的事情,模型必须选择 DONT_NOTIFY(不要打扰用户);如果 CI / CD 运行失败,模型选择 NOTIFY 并立即弹窗通知用户。它不是在等待用户提问,它是在后台真正地为您“工作”!

最强代码审查员

对于程序员来说,这份泄露文件里最有价值的,莫过于它内置的代码审查指南!OpenAI 倾囊相授了如何让 AI 进行高质量的 Code Review:

  1. 分级制度:

  2. 审查铁律:

    • 忽略无关紧要的代码风格,除非它影响了可读性或违反了既定标准。
    • 每一个建议都必须用一段话讲清楚“为什么这是一个问题”。
    • 绝不提供超过 3 行的代码片段。如果是具体的替换建议,必须使用 Markdown 的 suggestion 块,并且完美保留原有的缩进(空格或 Tab 必须分毫不差)。
    • 语气必须客观,禁止拍马屁(禁止说“干得好”、“谢谢你的提交”)。
    • 这段逻辑如果直接集成到您的公司内部代码审查机器人中,绝对能超越市面上 90% 的普通 AI!

吃瓜群众热议:是“降维打击”还是“小儿科”?

面对这近 30 万字的史诗级泄露,海外开发者社区直接沸腾了。各种声音层出不穷,可以说是众生相十足。有人被震撼到语无伦次:

有人觉得是在故弄玄虚:网友 vechen: “老哥只不过是直接从本地文件里拿的吧。这『泄露』有啥意义啊,笑死,它本来就在官方公开的 Codex 仓库里找得到影子。”

还有鄙视链顶端的大神出来嘲讽:网友 Outdated Often: “谁在乎啊 Pliny—— 我还搞到了 Meta Hatch 全栈,还带隐藏推理轨迹,直接从 tensor tokens 里扒出来的 —— 那才叫厉害,而且我也不会跑到推特上跟一堆人炫耀。去干点正事吧,把 bearer tokens(授权令牌)搞下来,然后再来低调装逼吧!”

更有吃瓜群众调侃:“294,000 个字符的拦截 JSON 被包装得像是死海古卷一样。这不过是跑了个 mitmproxy 而已。任何人都能运行这个,自己从 OpenAI、Gemini、Claude 那里提取提示词,根本不需要搞网红包装那一套。”

不过,无论黑客手段高低,对于普通开发者和 AI 爱好者来说,这波绝对是意外之喜!

这 30 万字,本质上就是 OpenAI 内部最顶尖的一批工程师,花费无数个日夜、投入上千万美元算力试错,才调试出来的“大模型驯化终极指南”。

提示词已死?不,系统工程永生!

读完这份长达 1902 行的“天书”,不知道您是什么感受?以前,我们以为写提示词就是玄学:加一句“深呼吸”、加一句“如果做不好就扣你工资”,模型就能变聪明。但 GPT-6 Sol Codex 的底层逻辑告诉我们:真正的工业级 AI 应用,根本不是靠几句讨巧的话,而是靠极其严密的系统工程!

  • 它是模块化的(Skills 动态加载);
  • 它是拥有记忆管理的(Compaction 手册);
  • 它是具备执行策略的(并行执行与重试);
  • 它是挂载了严格安全协议的(四大确认模式)。

大模型正在从一个“聪明的对答机”,全面进化为“具备接管权限的自主操作系统”。而这次泄露的 30 万字,就是通向这个新时代的源代码。

参考资料: