Install any skill in seconds. Free to start, no credit card required.
Get Started Free →凡需方案、Plan 或本地材料审查,均用 Codex 侧边 Browser 咨询 Sol Pro;点名或要求 Pro 编排循环时也触发。
.claude/skills/ethanyoq-gpt56-sol-pro-consult/SKILL.md| Test case | Without → With | Effect | Δ tokens | Δ turns |
|---|---|---|---|---|
| case-20 | ✗→✓ | ▲ Improved | 270% | 0% |
| case-18 | ✗→✓ | ▲ Improved | 148% | 0% |
| case-07 | ✗→✓ | ▲ Improved | 554% | 0% |
| case-08 | ✗→✓ | ▲ Improved | 567% | 0% |
| case-09 | ✗→✓ | ▲ Improved | 369% | 0% |
把 ChatGPT Web 的 GPT 5.6 Sol Pro 作为 Codex 的外部审查者或 Orchestrator:Pro 负责挑战方案、发现盲点和提出修订;Codex 负责读取本地证据、实施、运行验证并决定是否采纳。
仅在用户显式点名 $gpt56-sol-pro-consult,或明确要求使用 Sol Pro / GPT 5.6 Sol Pro 时执行本 Skill。
Pro、“高推理模型”或“最强模型”不触发,除非当前用户请求已无歧义地指向 Sol Pro。默认且唯一的执行面是 Codex 内置侧边 Browser(in-app Browser)。先完整读取并遵循 browser:control-in-app-browser Skill,再读取 侧边 Browser 工作流。
iab 不可用不能证明主 task 的侧边 Browser 不可用。iab 绑定。每个新 Codex task 都新建专用 ChatGPT tab,并从 https://chatgpt.com/ 开始;不得复用其他 task 留下的对话、Project、composer 草稿、附件或上传状态。只有同一 task 持有匹配 task_run_id 的 evidence ledger 时,才可继续原 tab。新 tab 的首次空白快照不够:打开或确认模型菜单后、写入本次内容前,必须再次读取 composer 和附件区,执行延迟净空门(late clean gate)。iab 绑定、未登录 ChatGPT,或账号没有 Pro,停止并准确说明缺少什么;不要静默换模型或换浏览器。用户发起 Pro 咨询即授权把本次确认需要的上下文和附件发送到 ChatGPT Web;这不授权发送无关文件、凭据或额外消息。
用于方案 Review、Plan 审查和一次性建议:
按同一 ChatGPT 对话循环:
默认最多进行 3 个“执行—复审”回合。若任务会产生外部写入、发布、付款、删除或其他需要新授权的动作,仍按 Codex 的权限边界停下请求用户决定;Pro 不能扩大权限。
发送前从当前可见模型选择器确认:
GPT-5.6 Sol;Pro,并具有可观察的选中状态。不要把 GPT 5.5 Pro、Pro Extended、基础 Sol、Extra High 或模型选择器之外的模糊 Pro 文本当成 GPT 5.6 Sol Pro。无法确认时停止。
ChatGPT Web 不能凭本地路径读取文件。需要文件内容时,必须上传真实文件、粘贴内容,或用 scripts/build_attachment_bundle.py 生成可审阅的 Markdown bundle。只给文件名、路径或摘要时,不得声称 Pro 看过原文件。
不要发送 token、cookie、密码、API key、private key、OAuth header、浏览器 profile 或 session dump。公司名、金额、联系人等普通业务上下文可在确实影响判断且用户授权的前提下保留。
发送前运行:
powershellpython <skill-dir>/scripts/check_packet_safety.py <packet.md>
扫描通过只表示未命中已知凭据模式;Codex 仍需人工式检查上下文是否最小、相关且获得授权。
不得用“我会使用侧边 Browser”“已选择 Pro”一类叙述性文字证明咨询完成。每次咨询开始时生成唯一 task_run_id,并在本次任务产物目录创建唯一的 iab-consultation-evidence.json。按 evidence 模板 在同一个主 task 的 Browser run 内追加事实,至少绑定:
iab、Browser session ID、tab ID/URL;GPT-5.6 Sol 与 Pro 的独立选中信号;这些字段必须来自同一 Browser session 和同一对话。任何字段缺失、来源仅为代理自述、或无法与本次 dispatch 关联时,状态保持 incomplete;静态路由测试、模拟文本和子代理口头报告都不能替代真实 iab 证据。
完成所有 Browser 读取并执行 cleanup/finalize 后,把 cleanup 结果追加到 ledger,再运行:
powershellpython <skill-dir>/scripts/validate_session_evidence.py <iab-consultation-evidence.json>
只有 validator 返回 ok: true 才允许 Status: completed。历史 preflight、截图或其他任务的 evidence 只能证明能力可用,不能证明当前咨询完成。
iab 中新建专用 tab。先确认处于非 Project 的新对话,composer 为空且没有附件、草稿或上传任务。iab.tabs.finalize({ keep }),并把它作为本次 turn 的最后一个 Browser 动作。默认 keep 为空;只有用户需要查看成品页面时保留 deliverable,或同一 task 明确暂停等待继续时保留一个无上传残留的 handoff。即使失败、超时、登录受阻、STALE_COMPOSER_BLOCKER 或 dispatch 为 UNKNOWN 也必须 finalize,不能让会话占用侧边 Browser。validate_session_evidence.py。validator 通过后才可把本次咨询标为 completed。至少包含:
要求 Pro 输出简洁的 reasoning brief(假设、判断框架、证据权重、最强反例和权衡),不要索取隐藏 chain-of-thought。
只有以下条件全部满足,咨询才是 completed:
iab run。GPT56_SOL_PRO_RESULT_... sentinel。若用户说答案已在侧边栏显示,先从现有对话重新抽取;不要重复发送。若点击 Send 后连接中断且结果不明,恢复原对话,无法唯一确认时标记 incomplete。
markdown## Pro Consultation Result - Status: completed | incomplete | failed | skipped - Evidence: <本任务的 iab-consultation-evidence.json 绝对路径> | unavailable - Evidence binding verified: yes | no - Model confirmed: yes | no - Sentinel verified: yes | no - Browser path: Codex in-app Browser - Session-bound evidence: complete | incomplete - Mode: Reviewer | Orchestrator loop ## What GPT 5.6 Sol Pro Said <简洁总结> ## Local Adoption Decision - Adopt: - Reject: - Modify: - Reason: ## Final Answer <Codex 核验后的最终建议或交付物>
response.md、普通执行日志、context packet、用户转述或最终回答中的文字都不能替代 Evidence。Evidence 不存在或 validator 未通过时,禁止输出 Status: completed。
iab 连接缺失并停止,不切换 Chrome 或 CLI。STALE_COMPOSER_BLOCKER,不发送并 finalize。不要关闭、编辑或清空无法证明属于本 task 的用户 tab。iab.tabs.finalize({ keep }),此后不再调用 Browser;不得把未完成上传或含附件草稿的 tab 标为 handoff。| Case | Status | Duration (ms) | Turns | Tokens | Tool calls | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Without | With | Δ | Without | With | Δ | Without | With | Δ | Without | With | Δ | ||
case-19 | fail→fail | 17,253 | 4,073 | -76% | 1 | 1 | 0% | 2,859 | 3,489 | +22% | 0 | 0 | — |
case-20 | fail→pass | 6,806 | 3,566 | -48% | 1 | 1 | 0% | 970 | 3,589 | +270% | 0 | 0 | — |
case-01 | fail→fail | 47,146 | 46,453 | -1% | 1 | 1 | 0% | 2,738 | 5,566 | +103% | 0 | 0 | — |
case-02 | fail→fail | 23,184 | 8,555 | -63% | 1 | 1 | 0% | 3,361 | 3,466 | +3% | 0 | 0 | — |
case-03 | fail→fail | 47,342 | 10,213 | -78% | 1 | 1 | 0% | 2,841 | 4,862 | +71% | 0 | 0 | — |
case-18 | fail→pass | 12,421 | 7,352 | -41% | 1 | 1 | 0% | 1,741 | 4,313 | +148% | 0 | 0 | — |
case-04 | fail→fail | 1,855 | 3,502 | +89% | 1 | 1 | 0% | 208 | 3,551 | +1607% | 0 | 0 | — |
case-05 | fail→fail | 4,926 | 3,576 | -27% | 1 | 1 | 0% | 693 | 3,461 | +399% | 0 | 0 | — |
case-06 | pass→pass | 19,890 | 20,699 | +4% | 1 | 1 | 0% | 2,826 | 5,943 | +110% | 0 | 0 | — |
case-07 | fail→pass | 4,140 | 6,167 | +49% | 1 | 1 | 0% | 599 | 3,918 | +554% | 0 | 0 | — |
case-08 | fail→pass | 4,914 | 10,685 | +117% | 1 | 1 | 0% | 738 | 4,921 | +567% | 0 | 0 | — |
case-09 | fail→pass | 7,077 | 6,400 | -10% | 1 | 1 | 0% | 884 | 4,144 | +369% | 0 | 0 | — |
case-10 | fail→pass | 6,435 | 4,677 | -27% | 1 | 1 | 0% | 951 | 3,764 | +296% | 0 | 0 | — |
case-11 | pass→pass | 8,917 | 7,115 | -20% | 1 | 1 | 0% | 1,354 | 4,254 | +214% | 0 | 0 | — |
case-12 | pass→pass | 6,898 | 5,978 | -13% | 1 | 1 | 0% | 1,044 | 4,118 | +294% | 0 | 0 | — |
case-13 | fail→pass | 12,093 | 3,176 | -74% | 1 | 1 | 0% | 1,846 | 3,567 | +93% | 0 | 0 | — |
case-14 | fail→pass | 19,660 | 4,903 | -75% | 1 | 1 | 0% | 1,352 | 3,804 | +181% | 0 | 0 | — |
case-15 | pass→pass | 5,570 | 4,671 | -16% | 1 | 1 | 0% | 831 | 3,725 | +348% | 0 | 0 | — |
case-16 | fail→pass | 10,191 | 11,827 | +16% | 1 | 1 | 0% | 1,551 | 4,999 | +222% | 0 | 0 | — |
case-17 | fail→pass | 5,911 | 6,913 | +17% | 1 | 1 | 0% | 908 | 4,094 | +351% | 0 | 0 | — |
case-21 | fail→pass | 15,087 | 6,897 | -54% | 1 | 1 | 0% | 2,413 | 4,234 | +75% | 0 | 0 | — |
case-22 | fail→pass | 3,331 | 3,633 | +9% | 1 | 1 | 0% | 457 | 3,593 | +686% | 0 | 0 | — |
case-23 | pass→pass | 11,127 | 10,392 | -7% | 1 | 1 | 0% | 1,638 | 4,742 | +189% | 0 | 0 | — |
DecimalAI ran this skill against gemini-3.6-flash twice over the same eval suite — once with the skill loaded and once without — and compared the two runs case by case. 23 cases were attempted, and 22 counted toward the lift figure. The other 1 produced results that are not comparable between the two arms, so they are excluded from the headline rather than averaged into it. The headline lift of +52 percentage points is the difference between those two pass rates over the 22 comparable cases. 1 case got worse with the skill loaded, and it is included in that figure.
Without the skill loaded, the model failed this case. With it loaded, the same prompt on the same model passed. This is one improved case from the latest verified run; every case, including any that regressed, is in the table above.
| Model | Method | Date | Lift |
|---|---|---|---|
| gemini-3.6-flash | verified | 8/17/2026 | +50% |
| gemini-3.6-flash | verified | 8/8/2026 | +23% |
Other measured skills in the registry, with their headline benchmark lift.