相關推薦
字節開源全新代碼大模型評估基準“FullStack Bench”
12月5日,字節豆包大模型團隊推出了最新的代碼大模型評估基準——FullStack Bench,涵蓋了超11類真實場景,支持16種編程語言,幷包含3374個問題。這一基準相比之前的評估標準,在更廣泛的編程領域中能更準確地評估大模型的代碼開發能力,推動了模型在現實世界編程任務中的優化。目前的主流代碼評估基準,如HumanEval和MBPP,通常集中在基礎和高級編程問題,而DS-1000則專注於數據分析和機器學習任務,且僅支持Python。xCodeEval則側重於高級編程和數學領域,存在較大的應用場景和語言覆蓋限
DeepSeek 發佈開源代碼大模型 DeepSeek Coder
["DeepSeek(深度求索)發佈了開源代碼大模型 DeepSeek Coder","DeepSeek Coder 是一個智能代碼助手,可以生成各種代碼","DeepSeek Coder 已經在 Hugging Face 和 GitHub 上開源","DeepSeek Coder 在國際權威數據集的測試中表現出色","DeepSeek 致力於探索 AGI 的本質,將推出更多研究成果"]
谷歌AI搜索一年翻倍:43%搜索結果現AI概覽,傳統網頁正被"直接給答案"取代
Similarweb最新報告揭示了一個不可忽視的趨勢:人工智能搜索正重塑傳統搜索體驗。谷歌AI概覽出現比例從15%躍升至43%,AI模式月訪問量由1.26億次翻倍至2.79億次,AI驅動信息獲取已成默認體驗。用戶搜索行爲發生根本變化,越來越多的人不再依賴傳統鏈接。
火山引擎上線豆包搜索服務,爲AI Agent提供可信聯網檢索能力
近日,火山引擎上線豆包搜索服務,面向企業開發者提供跨語言、多模態、多垂類聯網搜索,爲AI Agent注入實時可信信息,推動其從問答轉向複雜任務執行。應對長流程任務趨勢,傳統單次搜索式微,新智能體需持續檢索、理解網頁、交叉驗證並動態推進進程。
AI大模型將全面擁抱IPv6,雄安新區率先試點"單棧"網絡
中央網信辦攜京滬浙深網信辦及五家頭部AI企業,在雄安啓動爲期一年的“人工智能大模型IPv6能力提升專項行動”。行動旨在推動生成式AI應用全面支持IPv6,應對Token流量爆發式增長帶來的網絡壓力,利用IPv6的海量地址優勢爲智能時代築牢網絡根基。
