上海交大发布大模型双语编程评估基准 CodeApex|加密货币三大交易所

据机器之心报道，上海交通大学 APEX 实验室推出了 CodeApex，一个专注于评估 LLMs 的编程理解和代码生成能力的双语基准数据集。

在评估大语言模型的编程理解能力上，CodeApex 设计了三种类型的选择题：概念理解、常识推理和多跳推理。此外，CodeApex 也利用算法问题和相应的测试用例来评估 LLMs 的代码生成能力。CodeApex 总共评估了 14 个大语言模型在代码任务上的能力。其中 GPT3.5-turbo 表现出最好的编程能力，在这两个任务上分别实现了大约 50% 和 56% 的精度。可以看到，大语言模型在编程任务上仍有很大的改进空间。

原文链接

加密货币三大交易所

币界新闻

上海交大发布大模型双语编程评估基准 CodeApex

相关新闻

美国SEC“照例”推迟所有比特币现货ETF决议还有可能获批吗？

微软在 Windows 11 上强推 exe 软件弹窗，只为让 Chrome 用户尝试 Bing ？！

Visa面临竞争挑战：PayPal稳定币潜力巨大

全同态加密研究：无需解密即可计算会给Web3带来哪些改变？

亚马逊云科技大中华区解决方案架构总监：安全是构建生成式 AI 应用之根本

值得关注的20个未发币项目