草莓视频最新版下载地址在我们的平台上,您可以免费在线观看最新的国产精品高清影视作品,包括电影、电视剧和综艺节目。我们致力于提供高质量的视频播放体验,满足您的娱乐需求,随时随地享受精彩内容。
学习手记|从“读不完的书”感悟美美与共的文明力量-fbbc20b2
草莓视频最新版下载地址
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。
新款宝马7系下线:改款幅度接近换代,豪华与驾控如何兼顾-rssai229251a049eac0f9
草莓视频最新版下载地址
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。
来试试!小托马斯:想去海外打球,欧洲还是CBA我都能打爆全场-83798159
草莓视频最新版下载地址
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。
流感来袭48小时,我选择了“对”的药,满血复活!-875febe6
草莓视频最新版下载地址
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。
多场景测试关注实际工作表现
2026-09-08,围绕OpenAI官方介绍中强调的复杂编程、专业文档制作和电脑操作能力,一次测试将GPT-6 Astra与GPT-5.6 Sol放在相同材料和要求下,对前端、后端、办公和电脑操作四类任务进行比较。测试重点不是单纯生成内容,而是看模型能否完成连续修改、处理复杂约束并交付可用结果。
在前端任务中,测试要求模型继续开发《沉没博物馆》这款双机器人协作3D游戏,加入暂停、撤销、存档、色弱模式、救援优先级和第四张地图等功能。Astra用了约31分45秒,交出了可运行版本和演示动图,但旧存档中一类携带展品的数据出现丢失问题。Sol因服务容量不足中断,未能交付可用版本。
编程与办公任务中结果各有侧重
后端测试围绕闪购商城展开,要求处理库存、重复请求、支付崩溃恢复、退款和数据库迁移等问题。两款模型都完成了防止超卖和重复扣款等核心流程,但在优惠券分摊退款上出现差异:Astra计算出85元现金和15元优惠券分摊,Sol给出100元现金。测试者认为Astra在追加需求处理上更完整。
办公任务要求整理41份存在冲突的材料,生成Excel、董事会PPT和管理层备忘录。两款模型都完成了文件交付,核心数字保持一致。Astra完成整套材料用了约40分8秒,Sol约66分1秒;不过测试者更喜欢Sol的仪表盘和PPT呈现,认为其更方便在会议中展示重点。
电脑操作与资源消耗对比
电脑操作测试要求模型从华为官方YouTube发布会视频中选择片段并制作GIF。Sol选择的玻璃耐用性测试画面更符合测试者对内容展示的偏好,但未完成符合要求的动图制作。Astra选择手机展开画面,并交付了一张符合尺寸、帧率和画面要求的GIF。
测试还记录了Token使用情况。只看双方都交出成品的后端和办公两项,Astra合计使用约915万Token,Sol约2608万;四项工作的全部尝试中,Astra约1207万Token,Sol约3750万。不过测试者指出,Token差距不能直接等同于费用差距。最终,测试者表示后续类似任务会优先尝试Astra,同时保留Sol在办公呈现等方面的优势。