随着ChatGPT热潮,国内外大模型评测榜单陆续推出,但参数规模相近的大模型在不同榜单中的排名差异巨大。产业界和学界分析认为,这主要与评测集的不同有关,还与主观题比例上升导致评测公正性受质疑相关。因此,第三方评测机构如OpenCompass和FlagEval开始受关注。但业内认为,要做出真正全面有效的大模型评测,还需要考量模型鲁棒性、安全性等其他维度,目前仍在探索中。
相关推荐
字节要冲 5 万亿参数:豆包的智商有望拉满,代价是百万显卡级别算力
国产大模型参数规模持续攀升,Qwen3.8Max、Kimi K3已分别达2.4万亿和2.8万亿。字节跳动计划训练超5万亿参数模型,有望成为国内最大,但项目尚处早期,未必发布。5万亿参数被视为GPT-5.6或Opus5级别,标志着能力进一步跃升。
2026年8月7号 11:38
353.3k
模型变小,能力不减:新浪VibeThinker-3B 开源,AI 推理迎来“轻量化”新思路
新浪开源VibeThinker-3B模型仅30亿参数,在数学、编程等基准测试中性能媲美百倍规模大模型,部分竞赛级任务超越顶尖产品。其成功源于基于阿里Qwen2的独特训练策略,挑战了参数量“越大越好”的观念。
2026年6月29号 16:27
250.2k
爆火的DeepSeek-V4 背后:北大开源框架One-Eval如何终结AI测评“噩梦”?
DeepSeek-V4发布仅10小时,北京大学DCAI团队便通过最新开源的One-Eval评测框架,快速生成全量自动化评测报告。传统大模型评测流程繁琐,需耗费大量精力在搭建测试管道上,而One-Eval显著提升了效率,标志着行业进入新阶段。
2026年4月28号 10:30
209.8k
只需2%参数就能“干翻”GPT-4o?阿里通义千问Qwen 3. 5 小模型杀疯了!
阿里通义千问Qwen 3.5系列小模型打破“参数量决定智商”的常规认知。其中仅40亿参数的Qwen 3.5-4B在第三方测试中,与参数量过千亿的GPT-4o同台竞技,表现不落下风甚至略胜一筹。这标志着国产大模型在本地部署和效率优化上取得重要突破,开启“以小博大”的新时代。
2026年3月9号 9:46
253.0k
“百模大战”家家第一,大模型“跑分”作弊何时休?
["📊 <b>大模型的评测体系</b>:当前的大模型评测体系存在开源数据集可刷题、封闭评测数据集引发公平性问题以及评测指标不够科学全面等问题。","💡 <b>大模型的应用趋势</b>:文章提到大模型已经从模型端发展到应用端创新。","🔎 <b>大模型的商业化问题</b>:对大模型团队来说,是否能实现商业化远比排名和参数更重要。"]
2023年11月29号 9:08
189.1k
