网站地图官方微信:
网站首页 石嘴镇 兰巨乡 钱桥镇 红水乡 东北镇 唱歌乡

当前位置: 首页 >

如何看待机器之心重测高考数学全卷,Gemini夺冠,豆包DeepSeek并列第二?

当务之急最该解决的问题是大众对于 AI大模型的正确认知以及最基本的AI用法。

你看这是前两天的测试结果,突出了一个政治正确,6款大模型,OpenAI的o3倒数第一,我当时看到的时候就觉得很奇怪,o3好歹也是曾经的一代王者,高考数学这种题它排名这么低怕不是有什么猫腻。

我们就拿单选题的第五题来测试下,因为这道题除了o3,其他的国产模型都答对了。

这是第五题的原题,正确答案是A. - 1/2。

这是之前的第三方的测试结果,6个模型…。

如何看待机器之心重测高考数学全卷,Gemini夺冠,豆包DeepSeek并列第二?

  • | 系统太稳定了甲方觉得我们没有工作量,怎么收运维费? |

    你猜猜数据中心机房几乎都有每天次数多到离谱的巡检,是因为服务...

    查看详情>>
  • | 江西救护车 800 公里收 2.8 万被停运,该***中还有哪些疑点?这个收费贵不贵? |

  • | 大家都在哪里买电子元器件啊? |

  • | postgresql也很强大,为何在中国大陆,mysql成为主流,postgresql屈居二线呢? |

  • | 如何评价前端框架 Solid? |

  • | 敢不敢留下一张自拍照让人打分? |

  • | 普通人一部手机用多久? |

  • | 有一张巨强的显卡是什么体验? |

  • | 如何评价 Vue.js 纪录片? |

  • | 能够自己一个人创业的全栈web码农fullstack developer要会哪些技术? |

  • | Anthropic 推出的 Claude Code Agent 有哪些亮点值得关注? |

  • Rust本身是很不错的语言,带来了现代语言的不少新特性。 让...

    2025-06-24
  • 我之前也是喜欢严格遵循restful规范,什么get,pos...

    2025-06-24
  • 我认识一个女人,脸蛋像桂纶镁那样青春样子,身高 175,身材...

    2025-06-24
  • Solid 很灵活。 它没有和 Web 绑死,没有和特殊的编...

    2025-06-24

关注我们

添加微信好友,关注最新动态