GPT-6.1 Sol 实测对比 Opus 5.5:1/5 价格能否换来 80% 表现?
OpenAI DevDay 推出 GPT-6.1 Sol 时,给了一句让整个 AI 圈讨论了整整一周的定位:以 Astra 五分之一的价格,获得接近 A 等级的智能。缓存输入价低至每百万 token 0.10 美元,比标准输入便宜 95%,比上一代 GPT-6 Sol 的缓存价也砍掉一半。这一定位天然就指向”高强度、大批量的 Agent / 视频 / 3D 工作流”,而不是单次对话。
但价格便宜不等于能力够用。本文把 GPT-6.1 Sol 和 Claude Opus 5.5 拉到一起,在七项典型创作任务上做横向实测:3D 古风场景、几何变形、500 字创意写作、三蹦子广告短片、建筑方案还原、乐高积木建模、Mac Studio 科普视频,最后还压轴了一个 2 小时 38 分钟的 Unity 游戏”猪猪乐园”。每一项都从输出画面、生成细节、Token 消耗三个维度评估,最后给一张横向对比表。

一、价格与基准:1/5 的价格,52 分的智能
先把账算清楚:
| 维度 | GPT-6.1 Sol | GPT-6 Astra | Claude Opus 5.5 |
|---|---|---|---|
| 缓存输入价(每百万 token) | $0.10 | $0.50(估算) | $0.50 左右 |
| 相对 Astra | 1/5 | 1× | ≈ 1× |
| AI 榜单得分 | 52 | 53 | 55 |
| TerminalBench 4.0(HIGH 推理) | 领先 Opus 5.5 | — | — |
52 分比 Astra 只少 1 分,仍低于 Sonnet 5.5;但 TerminalBench 4.0 在 HIGH 推理档位下反超 Opus 5.5。这意味着在”专业编程 / 终端操作”这个最贵的任务类型上,Sol 用更低的成本就能跑出更高的分。
定位上,几位重度用户给出的判断基本一致:Sol 适合大规模、重复执行、消耗大的工作——代码审查、架构分析、计算机使用、邮件管理、日常批处理。在这些场景里,把 Opus 5.5 换成 Sol,等于直接把成本砍到 20%。
但便宜模型通常意味着”长内容生成”会偏弱——这一点下面七个任务里得到了反复验证。
二、3D 古风场景:色调到位,招牌缺席
第一个测试是”清明上河图”3D 场景还原。GPT-6.1 Sol 输出的整体色调非常接近原画古风——河两岸的瓦房、拱桥、码头、远景的城墙,氛围拉得很足。

但放大看细节就有落差:岸边的商铺没有招牌;桥上的行人、轿子、驴马有,但缺少原画里那种密集的”商贩、招幌、车马”层次感。对比 Opus 5.5 在同类任务上的输出,整体不如 Opus 5.5;但相比上一代 GPT-6 Sol,明显进步了一个大台阶——结构稳了,质感对了,缺的是细节。
三、3D 几何变形:12 段蛇形一气呵成
第二个任务切换到抽象几何:让模型在”球形—蛇形—蝎子—鱼—爱心—五角星”之间做 12 段连续变形,每段 24 面,共 23 个关节。

GPT-6.1 Sol 在这个任务上完成度几乎是 100%:从球形到蛇形,关节扭转正确;蝎子的尾刺、鱼形弯曲、爱心的对称、五角星的尖角,每一个形态的拓扑结构都对。这种连续变形在传统 3D 工具里要手动 K 关键帧,Sol 一段提示词直接出成品,算法与推定的能力相当扎实。
四、创意写作:差距最明显的一项
接下来是 500 字内心独白:同一时间收到三条消息(医院复查、房东涨租、前女友生日快乐),要求在 500 字内呈现内心波动。
GPT-6.1 Sol 的输出在文笔、修辞、节奏上都明显弱于 Claude Opus 5.5——这是本次实测里差距最显著的一项。Sol 在这类需要”文学性”的写作上偏像要点罗列,缺少 Opus 5.5 那种细腻的留白与情绪递进。
如果工作流里包含”长文案 / 广告脚本 / 短篇小说”,写作这一步留给 Claude,把 Sol 留给渲染和建模,是更合理的搭配。
五、三蹦子广告短片:6.1 Sol 的舒适区
接下来是一个相对完整的”广告大片”测试:让 GPT-6.1 Sol 做一个三轮机动车(斑玛子)的乡村广告短片——标题”三蹦子,一路有戏”,配上”不必身价千万,照样潇洒在简里”的文案。

实测下来 Sol 的表现有几个亮点:
- 三蹦子造型还原准确,红色车身、敞篷、稻草帽司机都到位;
- 车辆颠簸感做得不错——行驶过程有真实的弹跳;
- 路上遇到的小鸡造型可爱,羽毛和姿态都自然;
- 运镜合理,有远近切换。
但问题也明显:车斗里装的是什么货物分辨不清——这是 Sol 在生成”小型密集物体”时的常见问题,纹理细节会糊掉。对比 Opus 5.5 同任务,Opus 的整体画面质感更强,Sol”效果不如 Opus 5.5”,但已经是一个能直接用的广告片级别。
六、建筑方案还原:中央大树设计最出彩
给模型三张建筑参考图,要求还原成一座完整建筑的视频漫游——这是测试”空间理解 + 长序列建模”的任务。


GPT-6.1 Sol 给出的方案是一座曲形多层别墅,核心亮点是从一楼向上延伸的中央大树——把”自然生长”和”建筑中庭”两个元素咬合在了一起。整体空间感、纹理、光影都做得不错,落地窗、木地板、露台椅子都能清晰辨认。
但 Opus 5.5 在同一任务上做得更精致——中间的玻璃罩把树包裹住的处理更稳,室内材质纹理也更细腻,露台上的观赏植物(像狗尾巴草)、餐厅、卧室、浴缸都给出了完整的细节漫游。
考虑到两者价格相差数倍,Sol 在建筑任务上的表现已经算”超预期”。如果要做建筑方案汇报视频,Opus 5.5 更稳;但做内部概念演示,Sol 性价比拉满。
八、乐高积木小屋搭建:1037 件 vs 2153 件
给一张 Grok 生成的图片,要求 GPT-6.1 Sol 生成”可以在乐高 / BrickLink 上买到零件的完整积木小屋搭建指南”。


GPT-6.1 Sol 输出了一座 32×24 颗粒,1037 件零件的”蔷薇薄荷小屋”——粉色和薄荷绿的条纹墙,内部有上下两层、厨房、餐厅、卧室。每一个零件都有采购链接,所见即所得。
Opus 5.5 在同一任务上输出的是一座84 步说明书、2153 件零件的”粉色小屋”——规模更大、互动细节更丰富,小床、梳妆镜、可活动关节的小熊都有,说明书也更具可读性(虽然”已安装/未安装”的高亮逻辑不算直观)。
这个任务是 Opus 5.5 完胜 Sol——不论是规模、可玩性还是搭建指南的实用性。乐高这种”密集、规则、可枚举”的任务,Opus 5.5 仍然占据明显优势。
九、Mac Studio 科普与短片:6.1 Sol 文本太重,Opus 颜色失真
让 GPT-6.1 Sol 做一个 Mac Studio 的科普短片——介绍接口、参数、显示器连接方式。


GPT-6.1 Sol 的输出有几个明显问题:
- 文字过多,倾向于 PPT 式的”第几页第几页”,读起来累赘;
- 样式不够精致,初始版本背面颜色太亮,文字不够清晰;
- 反复迭代几次才能达到”基本可用”的水平。
Opus 5.5 在同一任务上的主要问题是Mac Studio 的色彩与官方有偏差(整个色彩偏掉),迭代几次也修不好;线材的展示也不如 Sol 精细。
最终方案是让 Astra 介入修图修线,Sol + Opus 5.5 + Astra 三模型合作才出了一个相对完整的一分钟短片——三种模型各有擅长,单一模型直接做完这种”科技产品介绍”还是有明显短板。
十、文学短片建模:Sol 反超客的逆袭场
把 Astral 写的一篇文学短文(关于水壶跳闸、医院复查、房东涨租、前女友生日快乐的故事)交给 GPT-6.1 Sol,让它先建模再渲染成最终视频。
这个任务 Sol 的表现反而比 Opus 5.5 更好——画面建模场景、人物动态、光线氛围都更自然。这是本次实测里 Sol 唯一明确胜过 Opus 5.5 的长内容任务。
可能的解释是 Sol 在”基于文字生成 3D 场景”这种多模态联合生成任务上做了专门优化,而这类任务恰好是 Sol 价格优势最该发挥的地方。
十一、压轴测试:Unity 猪猪乐园,2 小时 38 分钟做出一个完整游戏
最后一个测试是真正的重头戏——让 GPT-6.1 Sol 用 2 小时 38 分钟做出一个 Unity 游戏”猪猪乐园 · 打盹湾”。




实测下来 Sol 在这个任务上交出了超出预期的答卷:
- 大门与入口做了两只猪吉祥物雕像 + 拱形门 + 彩色招牌”猪猪乐园 · 打盹湾”,氛围拉满;
- 俯瞰图能看到完整的游乐园布局——拱形花门、面包窑、旋转木马、过山车、摩天轮、游船一应俱全;
- 过山车质感不错,轨道结构没有明显错误;
- 细节很多——小猪 NPC”戴着草帽的小姑娘”、地心邮局、卖税坡(很像麦田)、风箱修理铺、露珠灵、丰收转盘、鞦韆(略脱节);
- 猪猪能眨眼睛,这是 Unity 渲染上比较细腻的实现;
- 植物与拱门小船:小船后面都有一片叶子,质感做得挺可爱;
- 整个项目有清晰的 Scene / Material / Prefab 分层,Assets 结构清晰。
也有一些 Unity 通病:鞦韆和杆子脱节(连接处模型断了)、部分静态物体造型重复(不同商店里的小猪长得一样)、棚屋顶部的植物略显单调。但两小时三十八分钟做出一个能跑能交互的 Unity 主题公园,对于个人开发者而言,价值远超成本。
十二、七项任务横向对比表
| 任务 | GPT-6.1 Sol | Opus 5.5 | 差距判断 |
|---|---|---|---|
| 3D 古风场景 | 色调到位、缺招牌 | 更细腻 | Opus 略胜 |
| 3D 几何变形 | 100% 完成度 | 同等 | 持平 |
| 500 字创意写作 | 像要点罗列 | 文笔细腻 | Opus 明显胜 |
| 三蹦子广告片 | 造型可爱,货物糊 | 整体更强 | Opus 略胜 |
| 建筑方案还原 | 中央大树出彩 | 玻璃罩更稳 | Opus 略胜 |
| 乐高积木搭建 | 1037 件、可采购 | 2153 件、可玩性更强 | Opus 完胜 |
| Mac Studio 科普 | 文字太多 | 颜色失真 | 互有短板 |
| 文学短片建模 | 场景自然 | 偏弱 | Sol 反超 |
| Unity 猪猪乐园 | 2h38min 完成 | 未测 | Sol 单独完成 |
整体判断:GPT-6.1 Sol 在”渲染类 / 多模态联合 / 长序列建模”任务上,80% 的能力已经能覆盖 Opus 5.5;但在纯文字创作、可重玩互动设计、密集细节生成这三类任务上,Opus 5.5 仍有不可替代的优势。
十三、怎么用才划算
如果只看价格,GPT-6.1 Sol 是 2026 年最值得关注的模型之一;但要把它用到刀刃上,关键是按任务类型做模型分工:
- 大段文案、文学创作、对话式写作 → Claude Opus 5.5 / Sonnet 5.5;
- 3D 建模、建筑漫游、Unity 工程、广告短片渲染 → GPT-6.1 Sol;
- 代码审查、架构分析、Terminal 操作、批处理任务 → GPT-6.1 Sol(HIGH 推理档);
- 混合任务(剧本 + 短片、文案 + 设计)分模型协作 → Astra 写脚本,Sol 渲染,Opus 5.5 做精修;
- Mac Studio 这种”科技产品介绍” 单一模型目前都做不完整,得 Sol + Opus 5.5 + Astra 三模型接力。
回到文章开头那句”以 Astra 五分之一的价格获得接近 A 等级的智能”——这句话在 2026 年 9 月底这个时间点是成立的,但”接近”不等于”等同”。省下的 80% 预算应该用来跑更多次生成、更长的迭代循环,而不是追求单次输出追上 Opus 5.5 的天花板。
如果你对 3D / 视频生成的完整工作流感兴趣,可以看这篇大模型运行机制解读了解更多底层原理;如果想看 AI 行业的最新全貌,可以看 AI Daily 系列。另外如果关注的是 Agent 工具链与省 Token 实践,之前整理的 Codex 半年更新盘点也值得一读。