WWW,88666132,CON社区生活题材剧集围绕一个社区里的邻里展开,不同年龄、不同职业的邻居朝夕相处,有矛盾争执,也有互帮互助。琐碎的日常勾勒出温暖的邻里情,还原城市社区最真实的生活模样。观看时感受邻里之间的温情,体会远亲不如近邻的道理,内心满是温暖。
南方红军三年游击战争纪念馆迎来中外网红采风团 对话历史记忆-newsdef4cb7772c020cc
WWW,88666132,CON
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。
伊朗公布新型导弹,搭载半吨重弹头;特朗普称炒股投资为美国赚了“数千亿”;雷军发布小米迄今最贵手机,售价10999元起丨每经早参-28b98991
WWW,88666132,CON
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。
俄罗斯要求关闭德国驻圣彼得堡总领事馆-4ce61ac4
WWW,88666132,CON
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。
中风后别等!48小时就该开始康复-a4a00bb1
WWW,88666132,CON
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。