OpenAI GPT-5.2疑似“作弊”?AI评测真实性引发热议
创始人
2025-12-13 17:44:10
0

近日,AI社区对OpenAI最新发布的GPT-5.2模型的基准测试结果提出质疑。用户发现,在关键评测中,GPT-5.2可能使用了远超对手Gemini3.0Pro的算力资源,通过调整模型的“推理力度”参数。具体来说,在ARCAGI2测试中,GPT-5.2xhigh版每个任务消耗约13.5万个token,而Gemini3.0Pro仅使用了6.7万token,取得相似成绩。如果将算力投入标准化,两个模型的真实能力几乎并驾齐驱。

此外,GPT-5.2在其他测试中的表现并不如预期。在HLE、MMMU-Pro、Video-MMMU和FrontierMathTier4中,即使使用了超过Gemini3两倍的token数,GPT-5.2的表现仍然不佳。在GPQA上,两者基本相当。唯一例外的是GDPVal测试集,由OpenAI自己创建,结果的客观性有待考量。

这一发现引发了网友热议,有人认为如果用户得到的“推理力度”参数和token数与测评时不同,那么OpenAI就涉嫌虚假营销。也有人认为,即使增加Gemini3的token数量,它也未必能赶超GPT-5.2。同时,有用户反映GPT-5.2的实际体验并不理想,如在检查代码时出现严重幻觉现象,无法理解函数代码等。这表明GPT-5.2的实际体验与基准测试结果存在较大差距。

相关内容

热门资讯

AI模型价格战升级:Anthr... Anthropic于8月10日宣布,其人工智能模型ClaudeSonnet5将维持首发期推广优惠价,...
奔驰AMG GT SUV曝光:... 近日,梅赛德斯AMG官方发布了全新纯电SUV的预告图,该车型有望被命名为AMG GT SUV,基于A...
小米汽车座椅新选择:零重力or... 近日,小米汽车针对网友关于前排两款特色座椅的疑问进行了解答,提供了详细的选装思路。官方建议,若车主经...
宇树科技科创板申购中签率仅0.... 8月10日,宇树科技首次公开发行股票并在科创板上市的网上发行申购情况及中签率公布。本次发行价格为15...
AI智能体威胁升级,OpenA... 8月11日,OpenAI宣布扩展其网络防御服务Daybreak,以应对AI智能体带来的威胁。Dayb...
Anthropic联手麦格理、... 8月11日,人工智能研究公司Anthropic宣布与资产管理企业麦格理和新加坡主权财富基金GIC建立...
架起巴西和中国人民相知相亲的桥... 巴西与中国虽相距万里,但两国人民对美好生活的共同向往、对文化传承的共同珍视、对友谊合作的共同追求,让...
中外专家参访红山文化古迹 2026世界红山文化大会于8月5日至8月6日在辽宁朝阳召开,海内外专家学者齐聚一堂。大会召开前,专家...
“三蚊鸡到巴西”冰箱贴到手!羊... 8月9日,广东省第十七届运动会和广东省第十届残疾人运动会将在茂名举行开幕式。8日晚,羊晚记者抵达报到...
广东青年影人再创佳绩!在少女花... 8月8日晚,第38届大众电影百花奖系列活动青年电影之夜暨第十八届华语青年电影周荣誉发布仪式在北京79...