腾讯自建的 Agent 基准 WorkBuddy Bench 测试了自家 CodeBuddy Code 和 Claude Code 的表现。260 道真实工作题分为代码、Web、办公、安全四类,7 个模型在两套 Harness 下进行测试。结果显示,Claude Code 在 28 组同模型对比中赢得了 17 组,CodeBuddy 仅赢得 11 组。特别是在代码类题目中,Claude Code 以 7:0 完胜,所有 7 个模型在更换为 Claude Code 后均有得分提升。虽然 CodeBuddy 在 Web 和办公类题目中以 4:3 小胜,但在安全类题目中则被 Claude Code 以 4:3 拿下。测试结果表明,仅更换 Harness 就能导致成绩差异十几分,因此评估 Agent 的强弱不能仅依赖底层模型。然而,腾讯的榜单也存在不足之处,每类题目仅有 50 到 80 道,社区质疑增加难题是否会改变排名,且测试仅使用了两套 Harness,未包含 Codex。
本内容仅供参考,不构成任何金融、投资、法律或税务建议。文中提及的任何活动、奖励、线上活动或相关信息,不应被视为对购买、出售或交易任何加密资产的推荐、招揽或邀请。加密资产具有高波动性,存在价值损失风险。WEEX服务、产品及相关活动的可用性可能因地区而异。用户在参与前有责任确保符合当地适用法律法规。

















