首页 > 汽车生活 > 汽车生活 > 9.11和9.9哪个大?实测12个大模型8个都答错,ChatGPT也翻车了

9.11和9.9哪个大?实测12个大模型8个都答错,ChatGPT也翻车了

发布时间:2024-07-19 16:28:18来源: 15210273549

导读

一道小学生的数学题竟然难倒了全球AI大模型,只有4个大模型给出了正确答案!这究竟是怎么一回事?快来看看!

 

全球AI大模型被一道小学生数学题难倒

日前,一道来自小学生的数学题却难倒了不少海内外AI大模型,这道题的内容是“9.11和9.9哪个更大”,而仅有4个大模型给出了正确答案。

 

挑战大模型的数学推理能力

大模型的数学能力一直是短板,即便是目前最好的大模型GPT4也仍然有很大进步空间,而此前笔者在采访12位大模型时也得出了一个惊人的结论,这些大模型中仅有4个回答是正确的,而其他8个大模型却都给出了错误的答案。

 

数字切分问题与模型的理解能力

而针对大模型的数学能力,笔者曾进行过深入的采访,大部分行业人士认为大模型数学能力差的根本原因还是出在分词上,即Tokenizer(分词器)在处理数字时会出现问题,导致模型难以正确理解和计算。

 

正确答案揭晓与未来的发展方向

而这道9.11和9.9的大小比较题,12个大模型中,只有阿里通义千问、百度文心一言、Minimax和腾讯元宝答对,其他8个大模型都认为9.11比9.9更大。

 

虽然最终4个大模型给出了正确答案,但这并不能掩饰大模型数学能力的薄弱,毕竟面对简单的大小比较题,8个大模型都给出了错误答案。

 

而对于未来大模型的发展方向,笔者也咨询了不少专家学者以及从业者,针对此前大模型的回答,不少人表示“并不意外”。

一些专家认为,未来在模型的训练数据上会越来越依赖构造型的数据,而不是直接爬取下来的数据,以提升模型的复杂推理能力。

 

因为直接爬取下来的数据中会夹杂大量的错误数据,这些错误数据会误导模型,导致模型做出错误的判断。

而构造型的数据则可以事先筛选,保证数据的准确性和可靠性,从而培养模型健康的思维方式。

汽车生活更多>>

实用派的对决!星海S7对比小鹏MONA M03,12万预算,谁更适合家用 新款智己LS6堪比换代,灵蜥底盘+无图城市NOA,还带准900V超充 王朝网的新IP,比亚迪新车定位中大型MPV,计划成都车展亮相 计划9月份上市,极氪7X开启预售,据说车内有惊喜 售10.99万起,搭载24.6英寸双联屏,与长安UNI-T竞争 以“夏”为名的比亚迪新车,配第五代DM技术,将于年内上市 搭第二代金砖电池,标配双Orin-X芯片,22.99万起售的极氪7X贵吗 到店体验路特斯ELETRE,72.8万起售,百万级纯电SUV,造型够酷 2025 款福特 Bronco Stroppe 版灵感源自传奇的 Baja Racer 比亚迪的薄利多销魔法,卷出新高度,赢在未来 日产发布全新第四代Murano(楼兰),将抛弃CVT 丰田汽车与波士顿动力合作 推进AI人形机器人技术 丰田研究所与波士顿动力合作,推进机器人大规模行为模型等研究 全面升级 吉利中国星东方曜双子新车解读 一汽奥迪以专家造车,打造全周期高品质用车体验 谷歌安卓15引入“空间大师”功能,128GB存储也能拥抱海量应用 华硕笔记本电脑质量怎么样?四款华硕笔记本推荐,真香选择 苏姿丰等亮相联想Tech World:我们正进入最激动人心的创新时代 史无前例,英特尔和AMD在联想“撮合”下合作了 产业链协同视角下的理想汽车:国产豪华品牌高质量发展的先锋 多方“围剿”下蔚来急切“收割”订单:推6亿元购车加电补贴、单车至高3000元 中国车企正在“颠覆”欧洲老牌制造商?小鹏、广汽纷纷“安抚” 创近三年历史新高!深圳二手房单周录得2316套,环比增长649.5% 环涨738.1%!上周青岛二手房成交1760套,单周成交量创年度新高,市场热度有望延续 爆卖1500万台!荣耀X50再创奇迹 一图梳理荣耀产业链 李杰官宣,一加13样样超Pro,下周见,一图看懂第二代2K东方屏 全球手机市场:vivo、华为等中国厂商“增长强劲”,iPhone16仍被看好 中兴畅行 60 Plus:千元机也能拥有旗舰级体验? 红米k80 pro手机!骁龙8Gen 4+超声波指纹+6500mAh大电池! 星纪魅族加速推进软硬一体化生态布局