13名LLM考生挑战高考数学卷,GPT-4o仅排第3名!!!


今年,复旦大学的研究团队独辟蹊径,将目光聚焦在全新出炉的2024高考数学试卷上,并开创性地提出用高考题来评测大模型!

这无疑是一个极具创意和挑战性的尝试。

在这次评测中,阿里千问和讯飞星火分别获得了2024高考数学新Ⅰ卷的第一名和第二名,以及高考数学新Ⅱ卷的第二名和第一名。

两份考卷的评测中,GPT-4o均列第三名。GPT-4o居然只得了第三名?

GPT-4o深夜发布!Plus免费可用!icon-default.png?t=N7T8https://www.zhihu.com/pin/1773645611381747712
没体验过OpenAI最新版GPT-4o?快戳最详细升级教程,几分钟搞定:

升级ChatGPT-4o Turbo步骤icon-default.png?t=N7T8https://www.zhihu.com/pin/1768399982598909952



在新Ⅰ卷中,阿里千问和讯飞星火对14道数学客观题的准确率达到70%以上,大幅领先GPT-4o的57%。

字节豆包、智谱清言、百川等大模型紧随其后,准确率超过50%。 而在新Ⅱ卷的评测中,讯飞星火、阿里千问、GPT-4o的准确率均超过60%,



其他大模型的差距较小,除百川、DeepSeek和海螺之外,准确率均在50%以上。

最关键的是,数学能力一直是GPT-4o引以为傲的模块。

OpenAI在5月14日的发布会上推出大语言模型GPT-4o时,曾重点演示其数学能力!

本文教你如何使用WildCard正确方式打开GPT-4o,目前 WildCard 支持的服务非常齐全,可以说是应有尽有!

官网有更详细介绍:WildCard


推荐阅读:



如何免费使用GPT-4o?如何升级GPT...



更强大Mamba-2正式发布啦!!!



黎曼猜想取得重大进展!!

相关推荐

  1. 尝试用 GPT-4o 写 2024高考语文作文

    2024-06-12 22:26:02       11 阅读
  2. GPT-4o

    2024-06-12 22:26:02       9 阅读
  3. GPT-4o详解

    2024-06-12 22:26:02       9 阅读

最近更新

  1. TCP协议是安全的吗?

    2024-06-12 22:26:02       18 阅读
  2. 阿里云服务器执行yum,一直下载docker-ce-stable失败

    2024-06-12 22:26:02       19 阅读
  3. 【Python教程】压缩PDF文件大小

    2024-06-12 22:26:02       18 阅读
  4. 通过文章id递归查询所有评论(xml)

    2024-06-12 22:26:02       20 阅读

热门阅读

  1. 【5】JDK、JRE和JVM的区别与联系

    2024-06-12 22:26:02       8 阅读
  2. 《在人间》唯有自救,方能得救

    2024-06-12 22:26:02       6 阅读
  3. 新型数据库技术一览

    2024-06-12 22:26:02       5 阅读
  4. Matlab 2024a如何切换中英文界面

    2024-06-12 22:26:02       8 阅读
  5. 聊一聊线程池

    2024-06-12 22:26:02       11 阅读
  6. EMI电路

    EMI电路

    2024-06-12 22:26:02      8 阅读
  7. Vim 常用指令

    2024-06-12 22:26:02       7 阅读