AI

腾讯甩出 WorkBuddy Bench:一套把代码、网页、办公、安全全装进来的编码智能体考场

PConline 2026-07-24 13:53:00
产品动态
由华为云驱动

腾讯发布名为WorkBuddy Bench的多领域编码智能体评测套件,相关论文已发布于arXiv。该基准横跨代码(仓库级软件工程)、网页(前端制品)、办公(多文件业务流程)和安全(红蓝队)四个工作领域,规模分别为80、70、50、60个任务,合计260道。每个任务均从真实的代码提交、拉取请求或业务场...

腾讯发布名为WorkBuddy Bench的多领域编码智能体评测套件,相关论文已发布于arXiv。该基准横跨代码(仓库级软件工程)、网页(前端制品)、办公(多文件业务流程)和安全(红蓝队)四个工作领域,规模分别为80、70、50、60个任务,合计260道。每个任务均从真实的代码提交、拉取请求或业务场景中逆向工程并改写成简短、口语化、带角色扮演的请求,旨在防止通过搜索公开题库“背答案”。数据集已公开发布,包含任务目录、环境镜像、评估工具、测试用例和参考方案。四个子集共享同一套任务目录格式,但采用独立的验证方式:代码类按隐藏测试通过率打分;网页类使用规则检查加LLM/VLM评判再加智能体评判,且必须交付声明路径上的制品、不连实时互联网;办公类采用确定性规则检查加基于证据的LLM评判,权重在0.70到0.95之间偏向规则;安全类则使用确定性的scoring.py跑三次取平均,不用大模型当裁判。安全子集还设置了五层反作弊机制。任务构建采用统一流水线:来源收集、改写成真实请求、组装工作空间、回合后隔离评估资产、独立目录打包。代码任务提供五种角色,安全任务赋予专业角色,且信息故意不充分。评分资产在智能体运行后才引入。评测在隔离容器中运行,模型和沙箱分离,框架使用CodeBuddy Code(默认)和Claude Code两种,推理努力调高、上下文给到200k,并禁用WebSearch与AskUserQuestion。排行榜展示了多家模型族的分数(0–100,思考模式,三次平均)。Claude Opus4.8在代码、网页、办公、安全多数榜首领先,获得五个第一;GLM-5.2在security两榜登顶;GPT-5.5则获得office cc第一。框架的敏感性在安全子集表现明显,平均绝对变动达8.6个点。效率上,GPT-5.5输出token最少但分数不低,而DeepSeek-V4-Pro在代码上运行了44轮、出入token都较高。该论文由腾讯优图实验室、科恩安全实验室、Workbuddy团队与云鼎安全实验室合力完成。团队承认当前局限:代码子集以Python为主、跨语言偏少;开源发布本身带来被爬取污染的风险,需靠版本管理缓解;评判器偏差尚未量化;办公类偏文本,暂无OCR与GUI。近期计划是校准网页评分、扩充公开榜单。
点击展开全文
打开APP,阅读体验更佳

网友评论

太评甄选

更多优惠

相关推荐

相关产品
取消