用"Bad Apple"基准测试把模型推到极限:Opus 5.5 与 GPT-6 Astra 协作完成
一项名为"Bad Apple"的基准测试显示,Opus 5.5 能自主搭建评分与对比方法,但缺乏视觉能力,在 Remilia 部分出现模型幻觉;GPT-6 Astra 单独从零开始表现糟糕,却能在 Opus 5.5 已有成果上一次性完成大部分内容,并处理好 Flandre-Youmu 的转场。作者认为该结果只能靠两个模型协作实现,并已将项目提交至 GitHub。
一项名为"Bad Apple"的基准测试显示,Opus 5.5 能自主搭建评分与对比方法,但缺乏视觉能力,在 Remilia 部分出现模型幻觉;GPT-6 Astra 单独从零开始表现糟糕,却能在 Opus 5.5 已有成果上一次性完成大部分内容,并处理好 Flandre-Youmu 的转场。作者认为该结果只能靠两个模型协作实现,并已将项目提交至 GitHub。