WebCraftBench:给 AI 生成的网页来一场「实测大考」
5 天前

腾讯混元团队与清华、北大的研究者共同推出了WebCraftBench评测体系,该体系创新性地将软件测试方法引入AI网页生成评测中。它让智能体实际操作网页,通过代码覆盖率来查找不足,并从美观度、易用性、需求符合度三个维度进行打分。WebCraftBench基于369条真实用户需求和5088条验收标准,对17个前沿模型的6273个生成应用进行了交互探索与评分。在197组复核应用的对比中,其与人类偏好判断的一致率高达85.3%。该评测的核心流程包括代码插桩、智能体探索操作、将操作记录整理为状态转移图以及分维度评分。测评结果显示,没有模型能在所有三个维度上都获得第一,美观度与易用性在单应用层面的相关性较低,且分差越大与人类偏好一致率越高。同时,更换评分裁判对整体排名影响不大,覆盖率反馈有助于提升探索覆盖度。此外,研究还提出了网页生成评测的关键洞察,包括需沿用户操作路径展开、关注探索覆盖情况、分离探索与评分以及理性看待榜单等。