SEO优化部落

奶茶视频软件最新版-奶茶视频软件2026最新版vv1.54.18-22265安卓网

林群梦头像

林群梦

高级SEO优化分析师 · 十年经验

阅读 1分钟 已收录
奶茶视频软件最新版-奶茶视频软件2026最新版vv2.73.2-22265安卓网

图1:奶茶视频软件最新版-奶茶视频软件2026最新版vv2.49.7-22265安卓网

奶茶视频软件美食纪录片深挖菜肴背后的地域文化与人文故事,食材、烹饪、食客的画面栩栩如生。在享受视觉盛宴的同时,读懂食物承载的人间温情。

甩掉遥控器,超越博尔特!“硅基”迈入全自主时代:没有“人”的“机器人”该如何奔跑-9f9e815a

奶茶视频软件

多场景测试关注实际工作表现

2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。

在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。

编程与办公任务中结果各有侧重

后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。

办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。

电脑操作与资源消耗对比

电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。

测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。

依据采集原文重新整理:查看原文

多场景测试关注实际工作表现

2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。

在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。

编程与办公任务中结果各有侧重

后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。

办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。

电脑操作与资源消耗对比

电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。

测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。

依据采集原文重新整理:查看原文

多场景测试关注实际工作表现

2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。

在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。

编程与办公任务中结果各有侧重

后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。

办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。

电脑操作与资源消耗对比

电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。

测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。

依据采集原文重新整理:查看原文

五角大楼,内讧了!-87af324e

奶茶视频软件

多场景测试关注实际工作表现

2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。

在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。

编程与办公任务中结果各有侧重

后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。

办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。

电脑操作与资源消耗对比

电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。

测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。

依据采集原文重新整理:查看原文

多场景测试关注实际工作表现

2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。

在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。

编程与办公任务中结果各有侧重

后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。

办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。

电脑操作与资源消耗对比

电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。

测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。

依据采集原文重新整理:查看原文

多场景测试关注实际工作表现

2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。

在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。

编程与办公任务中结果各有侧重

后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。

办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。

电脑操作与资源消耗对比

电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。

测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。

依据采集原文重新整理:查看原文

张纪中老婆想拼生5胎,称越生越聪明,75岁张纪中在旁低头不语-bea185a0
德意志银行:挪威主权财富基金拟调整配置策略 料大举增持日本国债-e3c84f38

队记:76人相信他们吸引詹姆斯的不只有球队天赋 还有阵容适配度-053bff41

奶茶视频软件

多场景测试关注实际工作表现

2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。

在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。

编程与办公任务中结果各有侧重

后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。

办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。

电脑操作与资源消耗对比

电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。

测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。

依据采集原文重新整理:查看原文

多场景测试关注实际工作表现

2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。

在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。

编程与办公任务中结果各有侧重

后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。

办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。

电脑操作与资源消耗对比

电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。

测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。

依据采集原文重新整理:查看原文

多场景测试关注实际工作表现

2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。

在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。

编程与办公任务中结果各有侧重

后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。

办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。

电脑操作与资源消耗对比

电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。

测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。

依据采集原文重新整理:查看原文

云南两个光伏发电项目开发权被收回;沧州明珠华南基地项目开工-80898330

奶茶视频软件

多场景测试关注实际工作表现

2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。

在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。

编程与办公任务中结果各有侧重

后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。

办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。

电脑操作与资源消耗对比

电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。

测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。

依据采集原文重新整理:查看原文

多场景测试关注实际工作表现

2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。

在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。

编程与办公任务中结果各有侧重

后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。

办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。

电脑操作与资源消耗对比

电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。

测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。

依据采集原文重新整理:查看原文

多场景测试关注实际工作表现

2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。

在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。

编程与办公任务中结果各有侧重

后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。

办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。

电脑操作与资源消耗对比

电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。

测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。

依据采集原文重新整理:查看原文