腾讯的研究者们发现,大语言模型的性能会随着实例化agent数量的增加而增强,无需复杂的多LLM agents协作框架。实验结果显示多个小LM集成可以超越较大LM的性能。论文探讨了性能提升与问题难度之间的关系,并提出了逐步采样和投票、分层采样和投票两种优化策略。
相关推荐
Epoch AI测试三大AI文本检测器:模仿人类文风后最高近三成内容漏检
Epoch AI研究显示,主流AI文本检测器能近乎完美识别普通AI生成内容,但当大语言模型刻意模仿特定作者写作风格时,准确率明显下降,科学写作最难辨别。实验测试了Pangram、GPTZero和Originality.ai三款工具,采用495篇涵盖博客、小说、科学的人类原创文本(均创作于ChatGPT问世前),发现风格模仿可有效逃逸检测。
2026年7月20号 9:24
168.5k
OpenAI人才流动:前研究员田永龙入职腾讯,深耕视觉语言模型研发
OpenAI前研究员田永龙加盟腾讯大语言模型部,专注视觉语言模型研发。此举被视为腾讯强化多模态大模型布局的关键引援,凸显前沿人才争夺激烈。
2026年7月9号 10:16
230.4k
以 AI 治理 AI:Reddit 升级自动化系统,日均拦截 2300 万条垃圾信息
Reddit 利用升级的大语言模型结合自动化工具,精准监测并打击高度隐蔽的AI生成垃圾内容,包括虚假行为与人为炒作,全力守护社区内容真实性。
2026年7月7号 11:41
193.9k
Anthropic发布重磅大模型Claude Sonnet 5:性能直逼旗舰,价格却大跳水
Anthropic发布新中高阶模型Claude Sonnet 5,主打性价比,性能大幅逼近旗舰Opus系列。该模型具备迄今最强代理能力,可自主规划复杂任务、自查输出,并灵活调用浏览器与终端等外部工具,在推理、编程和知识任务上表现突出。
2026年7月1号 9:47
332.5k
降本增效大动作:Meta 大规模启用 AI 接管内容审核
Meta在扎克伯格力推AI的背景下,加速用大语言模型取代人工审核,已将AI深度融入内容与广告合规审查。目前平台约50%的内容审核已由AI完成,旨在优化成本与效率。
2026年6月26号 9:14
171.4k
