OpenAI DevDay 推出 GPT-6.1 Sol 时,给了一句让整个 AI 圈讨论了整整一周的定位:以 Astra 五分之一的价格,获得接近 A 等级的智能。缓存输入价低至每百万 token 0.10 美元,比标准输入便宜 95%,比上一代 GPT-6 Sol 的缓存价也砍掉一半。这一定位天然就指向”高强度、大批量的 Agent / 视频 / 3D 工作流”,而不是单次对话。

但价格便宜不等于能力够用。本文把 GPT-6.1 Sol 和 Claude Opus 5.5 拉到一起,在七项典型创作任务上做横向实测:3D 古风场景、几何变形、500 字创意写作、三蹦子广告短片、建筑方案还原、乐高积木建模、Mac Studio 科普视频,最后还压轴了一个 2 小时 38 分钟的 Unity 游戏”猪猪乐园”。每一项都从输出画面、生成细节、Token 消耗三个维度评估,最后给一张横向对比表。

GPT-6.1 Sol 与 Astra 价格与定位

一、价格与基准:1/5 的价格,52 分的智能

先把账算清楚:

维度 GPT-6.1 Sol GPT-6 Astra Claude Opus 5.5
缓存输入价(每百万 token) $0.10 $0.50(估算) $0.50 左右
相对 Astra 1/5 1× ≈ 1×
AI 榜单得分 52 53 55
TerminalBench 4.0(HIGH 推理) 领先 Opus 5.5 — —

52 分比 Astra 只少 1 分,仍低于 Sonnet 5.5;但 TerminalBench 4.0 在 HIGH 推理档位下反超 Opus 5.5。这意味着在”专业编程 / 终端操作”这个最贵的任务类型上,Sol 用更低的成本就能跑出更高的分。

定位上,几位重度用户给出的判断基本一致:Sol 适合大规模、重复执行、消耗大的工作——代码审查、架构分析、计算机使用、邮件管理、日常批处理。在这些场景里,把 Opus 5.5 换成 Sol,等于直接把成本砍到 20%。

但便宜模型通常意味着”长内容生成”会偏弱——这一点下面七个任务里得到了反复验证。

二、3D 古风场景:色调到位,招牌缺席

第一个测试是”清明上河图”3D 场景还原。GPT-6.1 Sol 输出的整体色调非常接近原画古风——河两岸的瓦房、拱桥、码头、远景的城墙,氛围拉得很足。

清明上河图 3D 场景

但放大看细节就有落差:岸边的商铺没有招牌;桥上的行人、轿子、驴马有,但缺少原画里那种密集的”商贩、招幌、车马”层次感。对比 Opus 5.5 在同类任务上的输出,整体不如 Opus 5.5;但相比上一代 GPT-6 Sol,明显进步了一个大台阶——结构稳了,质感对了,缺的是细节。

三、3D 几何变形:12 段蛇形一气呵成

第二个任务切换到抽象几何:让模型在”球形—蛇形—蝎子—鱼—爱心—五角星”之间做 12 段连续变形,每段 24 面,共 23 个关节。

3D 魔尺变形模拟器

GPT-6.1 Sol 在这个任务上完成度几乎是 100%:从球形到蛇形,关节扭转正确;蝎子的尾刺、鱼形弯曲、爱心的对称、五角星的尖角,每一个形态的拓扑结构都对。这种连续变形在传统 3D 工具里要手动 K 关键帧,Sol 一段提示词直接出成品,算法与推定的能力相当扎实。

四、创意写作:差距最明显的一项

接下来是 500 字内心独白:同一时间收到三条消息(医院复查、房东涨租、前女友生日快乐),要求在 500 字内呈现内心波动。

GPT-6.1 Sol 的输出在文笔、修辞、节奏上都明显弱于 Claude Opus 5.5——这是本次实测里差距最显著的一项。Sol 在这类需要”文学性”的写作上偏像要点罗列,缺少 Opus 5.5 那种细腻的留白与情绪递进。

如果工作流里包含”长文案 / 广告脚本 / 短篇小说”,写作这一步留给 Claude,把 Sol 留给渲染和建模,是更合理的搭配。

五、三蹦子广告短片:6.1 Sol 的舒适区

接下来是一个相对完整的”广告大片”测试:让 GPT-6.1 Sol 做一个三轮机动车(斑玛子)的乡村广告短片——标题”三蹦子,一路有戏”,配上”不必身价千万,照样潇洒在简里”的文案。

三蹦子广告短片

实测下来 Sol 的表现有几个亮点:

  • 三蹦子造型还原准确,红色车身、敞篷、稻草帽司机都到位;
  • 车辆颠簸感做得不错——行驶过程有真实的弹跳;
  • 路上遇到的小鸡造型可爱,羽毛和姿态都自然;
  • 运镜合理,有远近切换。

但问题也明显:车斗里装的是什么货物分辨不清——这是 Sol 在生成”小型密集物体”时的常见问题,纹理细节会糊掉。对比 Opus 5.5 同任务,Opus 的整体画面质感更强,Sol”效果不如 Opus 5.5”,但已经是一个能直接用的广告片级别。

六、建筑方案还原:中央大树设计最出彩

给模型三张建筑参考图,要求还原成一座完整建筑的视频漫游——这是测试”空间理解 + 长序列建模”的任务。

建筑方案 GPT-6.1 Sol
建筑方案 Opus 5.5

GPT-6.1 Sol 给出的方案是一座曲形多层别墅,核心亮点是从一楼向上延伸的中央大树——把”自然生长”和”建筑中庭”两个元素咬合在了一起。整体空间感、纹理、光影都做得不错,落地窗、木地板、露台椅子都能清晰辨认。

但 Opus 5.5 在同一任务上做得更精致——中间的玻璃罩把树包裹住的处理更稳,室内材质纹理也更细腻,露台上的观赏植物(像狗尾巴草)、餐厅、卧室、浴缸都给出了完整的细节漫游。

考虑到两者价格相差数倍,Sol 在建筑任务上的表现已经算”超预期”。如果要做建筑方案汇报视频,Opus 5.5 更稳;但做内部概念演示,Sol 性价比拉满。

八、乐高积木小屋搭建:1037 件 vs 2153 件

给一张 Grok 生成的图片,要求 GPT-6.1 Sol 生成”可以在乐高 / BrickLink 上买到零件的完整积木小屋搭建指南”。

积木小屋 GPT-6.1 Sol
积木小屋 Opus 5.5

GPT-6.1 Sol 输出了一座 32×24 颗粒,1037 件零件的”蔷薇薄荷小屋”——粉色和薄荷绿的条纹墙,内部有上下两层、厨房、餐厅、卧室。每一个零件都有采购链接,所见即所得。

Opus 5.5 在同一任务上输出的是一座84 步说明书、2153 件零件的”粉色小屋”——规模更大、互动细节更丰富,小床、梳妆镜、可活动关节的小熊都有,说明书也更具可读性(虽然”已安装/未安装”的高亮逻辑不算直观)。

这个任务是 Opus 5.5 完胜 Sol——不论是规模、可玩性还是搭建指南的实用性。乐高这种”密集、规则、可枚举”的任务,Opus 5.5 仍然占据明显优势。

九、Mac Studio 科普与短片:6.1 Sol 文本太重,Opus 颜色失真

让 GPT-6.1 Sol 做一个 Mac Studio 的科普短片——介绍接口、参数、显示器连接方式。

Mac Studio 科普短片
Mac Studio 短片开场

GPT-6.1 Sol 的输出有几个明显问题:

  • 文字过多,倾向于 PPT 式的”第几页第几页”,读起来累赘;
  • 样式不够精致,初始版本背面颜色太亮,文字不够清晰;
  • 反复迭代几次才能达到”基本可用”的水平。

Opus 5.5 在同一任务上的主要问题是Mac Studio 的色彩与官方有偏差(整个色彩偏掉),迭代几次也修不好;线材的展示也不如 Sol 精细。

最终方案是让 Astra 介入修图修线,Sol + Opus 5.5 + Astra 三模型合作才出了一个相对完整的一分钟短片——三种模型各有擅长,单一模型直接做完这种”科技产品介绍”还是有明显短板。

十、文学短片建模:Sol 反超客的逆袭场

把 Astral 写的一篇文学短文(关于水壶跳闸、医院复查、房东涨租、前女友生日快乐的故事)交给 GPT-6.1 Sol,让它先建模再渲染成最终视频。

这个任务 Sol 的表现反而比 Opus 5.5 更好——画面建模场景、人物动态、光线氛围都更自然。这是本次实测里 Sol 唯一明确胜过 Opus 5.5 的长内容任务。

可能的解释是 Sol 在”基于文字生成 3D 场景”这种多模态联合生成任务上做了专门优化,而这类任务恰好是 Sol 价格优势最该发挥的地方。

十一、压轴测试:Unity 猪猪乐园,2 小时 38 分钟做出一个完整游戏

最后一个测试是真正的重头戏——让 GPT-6.1 Sol 用 2 小时 38 分钟做出一个 Unity 游戏”猪猪乐园 · 打盹湾”。

猪猪乐园大门
猪猪乐园鸟瞰
猪猪乐园 Unity 编辑器视角
猪猪乐园游戏视角

实测下来 Sol 在这个任务上交出了超出预期的答卷:

  • 大门与入口做了两只猪吉祥物雕像 + 拱形门 + 彩色招牌”猪猪乐园 · 打盹湾”,氛围拉满;
  • 俯瞰图能看到完整的游乐园布局——拱形花门、面包窑、旋转木马、过山车、摩天轮、游船一应俱全;
  • 过山车质感不错,轨道结构没有明显错误;
  • 细节很多——小猪 NPC”戴着草帽的小姑娘”、地心邮局、卖税坡(很像麦田)、风箱修理铺、露珠灵、丰收转盘、鞦韆(略脱节);
  • 猪猪能眨眼睛,这是 Unity 渲染上比较细腻的实现;
  • 植物与拱门小船:小船后面都有一片叶子,质感做得挺可爱;
  • 整个项目有清晰的 Scene / Material / Prefab 分层,Assets 结构清晰。

也有一些 Unity 通病:鞦韆和杆子脱节(连接处模型断了)、部分静态物体造型重复(不同商店里的小猪长得一样)、棚屋顶部的植物略显单调。但两小时三十八分钟做出一个能跑能交互的 Unity 主题公园,对于个人开发者而言,价值远超成本。

十二、七项任务横向对比表

任务 GPT-6.1 Sol Opus 5.5 差距判断
3D 古风场景 色调到位、缺招牌 更细腻 Opus 略胜
3D 几何变形 100% 完成度 同等 持平
500 字创意写作 像要点罗列 文笔细腻 Opus 明显胜
三蹦子广告片 造型可爱,货物糊 整体更强 Opus 略胜
建筑方案还原 中央大树出彩 玻璃罩更稳 Opus 略胜
乐高积木搭建 1037 件、可采购 2153 件、可玩性更强 Opus 完胜
Mac Studio 科普 文字太多 颜色失真 互有短板
文学短片建模 场景自然 偏弱 Sol 反超
Unity 猪猪乐园 2h38min 完成 未测 Sol 单独完成

整体判断:GPT-6.1 Sol 在”渲染类 / 多模态联合 / 长序列建模”任务上,80% 的能力已经能覆盖 Opus 5.5;但在纯文字创作、可重玩互动设计、密集细节生成这三类任务上,Opus 5.5 仍有不可替代的优势。

十三、怎么用才划算

如果只看价格,GPT-6.1 Sol 是 2026 年最值得关注的模型之一;但要把它用到刀刃上,关键是按任务类型做模型分工:

  • 大段文案、文学创作、对话式写作 → Claude Opus 5.5 / Sonnet 5.5;
  • 3D 建模、建筑漫游、Unity 工程、广告短片渲染 → GPT-6.1 Sol;
  • 代码审查、架构分析、Terminal 操作、批处理任务 → GPT-6.1 Sol(HIGH 推理档);
  • 混合任务(剧本 + 短片、文案 + 设计)分模型协作 → Astra 写脚本,Sol 渲染,Opus 5.5 做精修;
  • Mac Studio 这种”科技产品介绍” 单一模型目前都做不完整,得 Sol + Opus 5.5 + Astra 三模型接力。

回到文章开头那句”以 Astra 五分之一的价格获得接近 A 等级的智能”——这句话在 2026 年 9 月底这个时间点是成立的,但”接近”不等于”等同”。省下的 80% 预算应该用来跑更多次生成、更长的迭代循环,而不是追求单次输出追上 Opus 5.5 的天花板。

如果你对 3D / 视频生成的完整工作流感兴趣,可以看这篇大模型运行机制解读了解更多底层原理;如果想看 AI 行业的最新全貌,可以看 AI Daily 系列。另外如果关注的是 Agent 工具链与省 Token 实践,之前整理的 Codex 半年更新盘点也值得一读。