法国初创公司Kog发布了一项提高普通数据中心GPU AI推理速度的策略。Kog采用了一种同时设计软件和模型结构的方法,以提高NVIDIA和AMD GPU的利用率。Kog表示,为了改善AI代理对请求的响应速度,他们将运行时、GPU内核和模型架构整合为一个优化的管道。根据5月28日发布的Kog推理引擎技术预览,8个AMD MI300X GPU每秒可以处理3000个输出令牌,而在相同条件下的8个NVIDIA H200 GPU则记录了每秒2100个输出令牌。Kog的主要应用目标是AI编码代理和代理型工作流程。6月24日,Hugging Face发布的Laneformer 2B模型拥有23亿个参数,表现出HumanEval+ 45.1%和MBPP+ 51.6%的性能。Kog在8月的LinkedIn帖子中表示,在实际演示中记录了每秒2857个令牌。然而,对于速度数据的解读存在争议,并且也指出由于模型大小和硬件的不同,比较变得困难。Kog的目标是在现有GPU基础设施上实现低延迟。
本内容仅供参考,不构成任何金融、投资、法律或税务建议。文中提及的任何活动、奖励、线上活动或相关信息,不应被视为对购买、出售或交易任何加密资产的推荐、招揽或邀请。加密资产具有高波动性,存在价值损失风险。WEEX服务、产品及相关活动的可用性可能因地区而异。用户在参与前有责任确保符合当地适用法律法规。

















