相关推荐
字节开源全新代码大模型评估基准“FullStack Bench”
12月5日,字节豆包大模型团队推出了最新的代码大模型评估基准——FullStack Bench,涵盖了超11类真实场景,支持16种编程语言,并包含3374个问题。这一基准相比之前的评估标准,在更广泛的编程领域中能更准确地评估大模型的代码开发能力,推动了模型在现实世界编程任务中的优化。目前的主流代码评估基准,如HumanEval和MBPP,通常集中在基础和高级编程问题,而DS-1000则专注于数据分析和机器学习任务,且仅支持Python。xCodeEval则侧重于高级编程和数学领域,存在较大的应用场景和语言覆盖限
DeepSeek 发布开源代码大模型 DeepSeek Coder
["DeepSeek(深度求索)发布了开源代码大模型 DeepSeek Coder","DeepSeek Coder 是一个智能代码助手,可以生成各种代码","DeepSeek Coder 已经在 Hugging Face 和 GitHub 上开源","DeepSeek Coder 在国际权威数据集的测试中表现出色","DeepSeek 致力于探索 AGI 的本质,将推出更多研究成果"]
Kimi K3 攻防考卷翻车:漏洞利用只到美国前沿模型四成,蒸馏疑云被安全机构摆上台
英美AI安全机构联合评测Kimi K3:在漏洞利用和模拟网络攻击能力上逊于美国前沿模型,但优于智谱GLM-5.2,成为开放权重模型中的新标杆。
黑森林实验室FLUX3 多模态模型登场:单次生成 20 秒音视频,胜率碾压Grok与Seedance
Black Forest Labs发布FLUX3多模态基础模型,采用统一架构联合学习图像、视频和音频。基于Self-Flow自监督流匹配框架,在FLUX系列基础上扩展多模态生成与理解。支持文生视频、图生视频,单次生成最长20秒视频并原生输出同步音频,性能全面超越前代。
红果短剧发布AI角色规范,专项整治“高频AI脸”与素材侵权
7月24日,红果短剧发布公告,规范AI剧角色创作:要求单部剧主要角色具备高辨识度,禁止复用高度相似形象,以缓解审美疲劳、降低高频AI脸使用。版权方面,未经授权不得使用他人独创性角色、服装道具设计,并严禁盗用有著作权写真。
