新基准测试Arena-Hard发布

[复制链接]
周大 发表于 2024-4-22 21:54:29 | 显示全部楼层 |阅读模式
最新基准测试Arena-Hard推出,模型性能区分度显著,测试数据针对真实用户提示词,降低数据泄露风险。使用GPT-4做评判偏好自身输出,与人类投票结果存在差距。使用Claude 3评判结果偏向开源模型。
来源:https://mp.weixin.qq.com/s/-lZKrLWICRdnabzvoqvGKw

学员登陆|Archiver|手机版|靠浦网络|靠浦ai课堂 ( 鄂ICP备17024134号-3 )

GMT+8, 2024-12-23 17:12 , Processed in 0.285769 second(s), 23 queries .

Powered by Discuz! X3.5

© 2001-2024 Discuz! Team.

快速回复 返回顶部 返回列表