相关推荐
字节开源全新代码大模型评估基准“FullStack Bench”
12月5日,字节豆包大模型团队推出了最新的代码大模型评估基准——FullStack Bench,涵盖了超11类真实场景,支持16种编程语言,并包含3374个问题。这一基准相比之前的评估标准,在更广泛的编程领域中能更准确地评估大模型的代码开发能力,推动了模型在现实世界编程任务中的优化。目前的主流代码评估基准,如HumanEval和MBPP,通常集中在基础和高级编程问题,而DS-1000则专注于数据分析和机器学习任务,且仅支持Python。xCodeEval则侧重于高级编程和数学领域,存在较大的应用场景和语言覆盖限
DeepSeek 发布开源代码大模型 DeepSeek Coder
["DeepSeek(深度求索)发布了开源代码大模型 DeepSeek Coder","DeepSeek Coder 是一个智能代码助手,可以生成各种代码","DeepSeek Coder 已经在 Hugging Face 和 GitHub 上开源","DeepSeek Coder 在国际权威数据集的测试中表现出色","DeepSeek 致力于探索 AGI 的本质,将推出更多研究成果"]
月之暗面注册资本飙至 1437 万,年内密集增资动作频频
北京月之暗面科技股份有限公司近日完成工商变更,注册资本由约1157.53万元增至约1437.23万元,增幅约24%。今年以来,该公司注册资本已多次密集增资,从最初100万元一路升至约1437.23万元。作为国内大模型头部企业及备受瞩目的AI独角兽,其资本变动引发关注。
腾讯云开源内部自用 TeamAI 工具,支持跨 Agent 共享 Skill
腾讯云开源内部AI协作工具TeamAI。它基于Git,将团队Skill、工作规范、工具配置和项目知识统一纳入仓库,实现像代码一样的评审与版本控制,并同步至成员各自Agent,做到“一人配置,全员复用”。目前已适配WorkBuddy、CodeBuddy、Claude Code、Codex、Cursor等16款主流Agent。
知名学者怒批:立即全网下架可联网开放式AI智能体
AI学者盖瑞·马库斯呼吁市场立即下架所有具备联网能力的开放式AI智能体,直至技术缺陷与安全隐患彻底修复。该呼吁源于《纽约时报》披露的Anthropic智能体引发严重安全事故。结合此前频发的智能体失控事件,他指出当前一代合成智能体无法被公众或企业完全信任或掌控,行业应正视风险。
VIP会员