GPT-6.1已经出现在Arena评测平台上。OpenAI的这款新模型被放进了Agent Arena,官方给出的说法是:去测它,你的投票会塑造它的评估结果,分数很快就会公布。 这不是一次普通的模型上架。Agent Arena测的不是聊天能力,而是 数百万个真实世界、长周期的智能体任务 。模型可以调用网页搜索、文件系统和终端工具,去完成复杂的工作流。 榜单怎么算分 排行榜衡量的是模型在结果上的表现,参照对象是"平均模型"。它用的是一套叫因果追踪的方法论。换句话说,不是看模型说了什么,而是看它最终把事情做成了什么样。 这套评测逻辑对智能体产品来说更接近实战。搜索、读写文件、敲终端命令,这些动作串起来,才是一个真实任务的样子。 不止一个竞技场 GPT-6.1同时进入了Code Arena,覆盖的方向包括: WebDev(网页开发) Text(文本) Vision(视觉) Search(搜索) Document(文档) 从智能体任务到代码生成,再到视觉和文档处理,这次上架的覆盖面铺得相当宽。对开发者来说,这意味着可以在同一套平台上横向比较GPT-6.1在不同场景下的表现。 目前分数还没出来。官方只说了"即将公布",投票通道已经打开。对关注模型实际落地能力的人来说,接下来这份榜单值得盯一下——毕竟它测的是任务完成度,而不是答题正确率。 特别