7 月 16 日,Simon Willison 发了一篇很简短的文章,主题是用一张"鹈鹕骑自行车"的 SVG 图片测试各版本 AI 模型的效果。这不是什么正经 benchmark,但正因为不正经,反而暴露了最多东西。鹈鹕测试是这样的: 给模型一个简单 prompt——"生成一只骑自行车的鹈鹕 SVG