腾讯的AI编码代理基准测试中,安斯罗皮克的克劳德代码在28个模型比较中超越了17个代码伙伴。在编码领域,所有7个模型在使用克劳德代码时得分较高。腾讯的YouTuLab、Kin Security Lab、Winding Security Lab和WorkBuddy公布了由260个任务组成的WorkBuddy基准。这些任务分为80个编码、70个网页、50个办公和60个安全任务。Harnis是负责模型外部上下文管理、工具调用和任务执行的代理执行层。评估结果显示,在网页和办公领域,代码伙伴分别以4比3领先,而在安全领域,克劳德代码则以4比3占优。GLM-5.2的网页得分分别为67.43和60.71,GPT-5.5的安全得分为77.91和64.39。排行榜上,代码伙伴的得分为2.109.3,克劳德代码为2.1.187,得分是通过在think模式下执行三次的平均值得出的。这次结果表明,在评估AI编码工具时,也应考虑执行结构和工具控制方式。然而,评估任务在各领域限制在50到80个,BlockBits提出额外问题可能会改变排名。WorkBuddy基准将通过公开存储库和Hugging Face数据集提供。
本内容仅供参考,不构成任何金融、投资、法律或税务建议。文中提及的任何活动、奖励、线上活动或相关信息,不应被视为对购买、出售或交易任何加密资产的推荐、招揽或邀请。加密资产具有高波动性,存在价值损失风险。WEEX服务、产品及相关活动的可用性可能因地区而异。用户在参与前有责任确保符合当地适用法律法规。

















