资讯

中国信通院启动“方升”智能体基准测试任务征集工作

36氪快讯·2026/9/7 02:57:33🔗 原文

📋总体概括

中国信通院宣布面向社会公开征集「方升」智能体基准测试任务,该基准围绕基础能力、典型场景和复杂综合任务三层构建测试框架,目标是将智能体测评从单一分数测量拓展至综合能力评估、过程分析与问题诊断。此举意在汇聚产业界高质量任务资源,完善测试任务、环境与评价方法,是国内官方机构切入智能体(Agent)评测标准制定的重要动作,可能填补国内缺乏统一、权威智能体评测体系的空白。

关键信息

  • 中国信通院公开征集「方升」智能体基准测试任务,旨在完善测试任务、环境和评价方法
  • 「方升」基准采用分层测试框架:基础能力、典型场景、复杂综合任务三个层级
  • 测评方向从综合能力测量拓展至过程分析和问题诊断,超越传统单一打分模式
  • 征集目的是增强基准的专业性、代表性和产业适用性,汇聚高质量任务资源

🔥犀利点评

智能体评测长期被海外榜单垄断,信通院此时推「方升」是标准的卡位战——谁定测试题,谁就有生态话语权。但评测体系最大的死穴是任务质量和更新速度:大模型能力迭代以月计,官方机构若靠征集任务慢条斯理地攒题库,很容易重蹈国内某些AI榜单沦为厂商刷分工具的覆辙。分层框架和过程诊断的思路是对的,关键看后续是否公开评测细节、能否防止针对性优化。

本文由本站自动聚合,以下为原始来源:前往 36氪快讯 阅读全文