首页 > 汽车评测 > 汽车评测 > 9.11和9.9哪个大?实测12个大模型8个都答错,ChatGPT也翻车了

9.11和9.9哪个大?实测12个大模型8个都答错,ChatGPT也翻车了

发布时间:2024-07-19 16:28:18

导读

一道小学生的数学题竟然难倒了全球AI大模型,只有4个大模型给出了正确答案!这究竟是怎么一回事?快来看看!

 

全球AI大模型被一道小学生数学题难倒

日前,一道来自小学生的数学题却难倒了不少海内外AI大模型,这道题的内容是“9.11和9.9哪个更大”,而仅有4个大模型给出了正确答案。

 

挑战大模型的数学推理能力

大模型的数学能力一直是短板,即便是目前最好的大模型GPT4也仍然有很大进步空间,而此前笔者在采访12位大模型时也得出了一个惊人的结论,这些大模型中仅有4个回答是正确的,而其他8个大模型却都给出了错误的答案。

 

数字切分问题与模型的理解能力

而针对大模型的数学能力,笔者曾进行过深入的采访,大部分行业人士认为大模型数学能力差的根本原因还是出在分词上,即Tokenizer(分词器)在处理数字时会出现问题,导致模型难以正确理解和计算。

 

正确答案揭晓与未来的发展方向

而这道9.11和9.9的大小比较题,12个大模型中,只有阿里通义千问、百度文心一言、Minimax和腾讯元宝答对,其他8个大模型都认为9.11比9.9更大。

 

虽然最终4个大模型给出了正确答案,但这并不能掩饰大模型数学能力的薄弱,毕竟面对简单的大小比较题,8个大模型都给出了错误答案。

 

而对于未来大模型的发展方向,笔者也咨询了不少专家学者以及从业者,针对此前大模型的回答,不少人表示“并不意外”。

一些专家认为,未来在模型的训练数据上会越来越依赖构造型的数据,而不是直接爬取下来的数据,以提升模型的复杂推理能力。

 

因为直接爬取下来的数据中会夹杂大量的错误数据,这些错误数据会误导模型,导致模型做出错误的判断。

而构造型的数据则可以事先筛选,保证数据的准确性和可靠性,从而培养模型健康的思维方式。

汽车评测更多>>

特斯拉新车没有方向盘没有脚踏板:定价不超20万、不需要人开 消息称三星Galaxy S26系列手机搭载全新降噪算法 苹果iOS 26.4 Beta移除App Store退出登录功能,切换账户更繁琐 科技整活!PS5手柄直接操控大疆扫地机器人 摩托罗拉Edge 70 Fusion手机宣传图曝光:骁龙7s Gen 4芯片、6.78英寸曲面屏 开源压缩工具NanaZip 6.0正式发布:UI大改、支持更多格式 AI时代的资本弃儿:为什么高瓴加仓阿里、拼多多,却清仓了百度 趋势科普:2026年,为什么越来越多人提LE Audio 和 Auracast? 上汽集团实现筑底企稳,回升提速态势渐显,改革攻坚取得了阶段性成效 2025车坛众生相:我们在追求科技进步,还是在制造昂贵的麻烦? 外媒:福特与比亚迪洽谈混合动力车型电池合作 丰田2026:蓄力之年 捷达科技公司成都启航 剑指新能源与出海双赛道 海外加价抢购,极氪9系究竟构建了怎样的“东方豪华”竞争力? 小鹏汽车的“稳进破局”,到底要破什么局? 掌握转型主动权,北京现代如何让合资品牌“老树发新芽”? 雷军:蓝色是SU7的幸运色,绿色是YU7的幸运色 小米YU7推出7年低息政策:月供低至2593元,2月底截止 旧照太“抽象”被疑盗号?QQ辟谣沈腾空间被盗,附送账号找回指南 出圈一周年,DeepSeek的变与不变 理想L6累计交付突破36万辆,成为2025年中大型SUV销冠 曾经盛极一时的VR、元宇宙,现在怎么样了? 台积电3nm打造!OpenAI计划今年推出首款自研AI芯片 爱马仕悠悠球多地售罄 网友:1.8万的童年回忆 西方专家:中国电网一旦最终成熟,将影响全球乃至掀起能源革命 AI的尽头,也可以是储能 59岁王祖贤近况曝光!在加拿大别墅区开艾灸馆,一个人孤苦伶仃生活 旭辉境外债务重组生效 碧桂园、融创、旭辉“三巨头”化债上岸 个人销售未满2年住房增值税降至3%,300万元房源可省5万多 创作者变现将有新渠道?小红书内测笔记付费功能