google

Opus 5 新對手 !Google 發布 Gemini 3.8 Flash,Coding 性能看齊 Claude 旗艦模型

六週內三度進化!Google DeepMind 近日再於自家部落格上,發布推出 Gemini 3.8 Flash 與資安版本 Gemini 3.8 Flash Cyber。這不僅是繼三週前推出 3.7 Flash 後的新力作模型,更是讓模型在短短六週內迎來第三度更新,展現 Google 在 AI 模型研發上的緊湊推進節奏。

程式碼與 AI 代理能力大躍進,跑分直逼 Claude Opus 5

Google 強調,Gemini 3.8 Flash 在程式碼撰寫與 AI 代理(Agent)任務上的表現,較前代實現了跨越式的突破。官方評測數據顯示,在長週期軟體工程基準 DeepSWE v1.1 中,3.8 Flash 斬獲 71.0% 的高分,不僅超越 3.7 Flash 的 65.3%,更進一步縮小了與勁敵 Claude Opus 5(74.0%)的差距。

此外,在垂直領域的表現更是亮眼:於 Vals Finance Agent v2(金融)與 Harvey’s Legal Agent Benchmark(法律)測試中,3.8 Flash 分別取得 61.4% 與 10.0% 的成績,雙雙擊敗 Claude Opus 5 的 58.6% 與 6.7%;而在多學科推理 HLE-Verified 評測中,亦繳出 54.9% 的優異水準。

首創資安特化版 Cyber:精準揪蟲、自動修復

針對網路安全場景,Google 此次同步推出了同源衍生版本 Gemini 3.8 Flash Cyber。該模型聚焦於漏洞發掘與自動產出修補程式(Patch),目前正透過全新的「Fairwind Program」向受信任的資安防禦方開放申請。

在成本效益與精準度上,Cyber 版本展現了極大的優勢。於 Collinear 維護的 CWE-Bench 基準中,其 pass@1 達到 47.2%,位居柏拉圖前緣(Pareto Front),效能直逼頂尖前沿模型的 47.8%,但運算成本卻顯著降低。根據 Chrome 資安團隊的回饋,該模型產出的正確修補程式數量是對照組商用模型的 2.6 倍;資安大廠 Wiz 的內部滲透測試也指出,其召回率(Recall Rate)提升了 7.5 至 9.7 個百分點,而成本僅為同級前沿模型的 1/2.3 到 1/5.2。

維持推廣優惠價,全面部署 Google 生態系

在定價策略上,Gemini 3.8 Flash 繼續沿用前代的推廣優惠價:每百萬輸入 Token 為 0.75 美元,輸出則為 3.75 美元。Google 官方提醒,此優惠將於 2026 年 12 月 31 日截止;自 2027 年 1 月 1 日起,費率將調回正常的 1.50 美元(輸入)與 7.50 美元(輸出)。

目前,Gemini 3.8 Flash 已全面上線,開發者可透過 Gemini API、Google AI Studio、Android Studio 及 Antigravity 平台進行存取;企業端客戶可於 Gemini Enterprise 中呼叫;一般消費者則能在 Gemini App、AI Mode 及 Google 試算表(Google Sheets)中體驗最新功能。

 

消息來源 : 1

Previous post

庫克蘋果執行長任期的第一支與最後一支iPhone都是60Hz

Next post

《THE KING OF FIGHTERS AFK》1週年慶典火熱進行中 八神庵全新造型等內容登場

The Author

shu

shu