谷歌发布办公 Agent Gemini Agent,支持调用 Claude
Google Cloud 发布长文介绍 Gemini 在企业 Agent 领域的更新,核心是全新发布的 Gemini Agent,可查资料、写邮件、做 PPT、分析数据、编写运行代码并跨应用调用工具。
推荐理由:谷歌把办公 Agent 的模型选择、企业身份与四类记忆机制一并公开,可对照 Meta、OpenAI 的路线差异。
Google Cloud 发布长文介绍 Gemini 在企业 Agent 领域的更新,核心是全新发布的 Gemini Agent,可查资料、写邮件、做 PPT、分析数据、编写运行代码并跨应用调用工具。
推荐理由:谷歌把办公 Agent 的模型选择、企业身份与四类记忆机制一并公开,可对照 Meta、OpenAI 的路线差异。
Google 发布 AQuA(Ambient Quality Agent),一个在 Google Cloud 项目内旁路运行的质量智能体,按计划、部署后或按需扫描 Cloud Trace、Cloud Logging 或 BigQuery 中的生产轨迹,经采样、评审、聚类、验证、跟踪五阶段流水线输出可验证的故障洞察。
推荐理由:原文给出 AQuA 的五阶段流水线、成本数据和一次真实多智能体排查案例,可据此判断生产环境智能体质量监控的可行做法。
Google AI Edge 团队以 Apache 2.0 协议开源端侧 GPU 计算引擎 ML Drift,它抽象 OpenGL ES、OpenCL、Metal 和 WebGPU,作为 LiteRT 的核心 GPU 加速引擎,也可独立使用。
推荐理由:Google 开源端侧 GPU 推理引擎 ML Drift,并给出 Chrome、YouTube Shorts、Adobe 等迁移后的实测提速数据。
Google Research 在 NBER 发布一项为期三个月的专利撰写实地实验,将当时未发布的 Google Labs AI 专利写作助手(现属 Gemini Notebook)随机开放给 11 家知识产权律所的 133 名律师,其中三分之二获得早期访问权。
推荐理由:三个月专利撰写实验区分了 AI 带来的即时产出提升与无辅助判断力的变化,为理解 AI 对专业能力的影响提供了实证。
Google 发布实验性游戏平台 Playground,用户通过对话式界面输入提示词即可创建、游玩和分享自定义游戏,无需编程经验。平台基于浏览器,支持手机和笔记本游玩,游戏可设为私密、生成分享链接或发布到 Explore 画廊,部分品类支持排行榜和多人对战。Playground 今日面向美国 18 岁以上用户开放,创建权限按 Google AI 订阅分级,后续将接入 Unity Spark。
推荐理由:Google 官方发布实验性游戏平台 Playground,读者可了解其提示词生成游戏的能力边界与开放范围。
OpenAI 以公开 GitHub 仓库形式发布内部前沿模型的数学成果,包含 722 篇手稿、分为 372 个相关结果族,来自约 4000 道研究问题的评测,平均每个结果消耗约 3 小时 ChatGPT Pro 思考算力,模型本身未发布。
推荐理由:OpenAI 内部模型一次性产出 722 篇数学手稿,读者可据此了解其规模、算力成本与学界争议。
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、Apache 2.0 许可的开源多模态嵌入模型,可把文本、图像、音频和视频映射到统一嵌入空间。
推荐理由:官方给出 740M 参数、模块化编码器与端侧内存占用,可据此判断本地多模态检索的落地门槛。
Unsloth 发布 v0.1.903-beta,在聊天旁加入内置浏览器面板,文件、网页和模型生成的 HTML 都以标签页打开,并支持对页面内容提问。该版本同时支持 Google DeepMind 的多模态嵌入模型 EmbeddingGemma 2,提供 740M 参数版本(纯文本 270M)、100+ 语言和 8K 上下文窗口,代码任务比上一代提升约 14%。
推荐理由:Unsloth 一次更新同时加入内置浏览器、EmbeddingGemma 2 支持与语音克隆页面,可据此判断本地微调工具链的边界扩展。
Google 发布基于 Gemma 4 的 EmbeddingGemma 2,这是一个 Apache 2.0 许可的 sub-1B 开源嵌入模型,可将文本、代码、图像、视频和音频映射到统一的 768 维空间。
推荐理由:EmbeddingGemma 2 的模块化编码器与 MRL 截断方案,为多模态 RAG 的显存与存储取舍提供了可量化的参考。
Google DeepMind 发布开放权重多模态嵌入模型 EmbeddingGemma 2,可将文本、图像、视频帧和音频映射到统一向量空间,参数量 740M,文本权重最低约 191MB 内存,完整多模态模型在 Google Pixel 11 Pro 上约 567MB。
推荐理由:EmbeddingGemma 2 把文本、图像、视频帧和音频映射到同一向量空间,并给出端侧内存与延迟数据,可据此判断本地多模态检索的落地边界。
Google 发布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。新系统把客户端梯度计算移到服务端,训练时间瓶颈从设备可用性转为 TEE 资源,此前每个模型训练需 1-2 个月。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的实际部署效果。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者,起步价每百万输入 token 2 美元、输出 token 10 美元。
推荐理由:官方披露了 Argon 在编码、企业知识与网络安全上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与获取门槛。
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印不仅能在数字模型上验证,也能在合成出的实体蛋白质上验证,同时保持其生物功能。
推荐理由:SynthID 水印从图像扩展到合成生物,读者可了解其在 DNA 合成筛查与数据库标注上的验证思路。
Google Research 发布 AI video co-director,一个构建在 Gemini 和 Veo 之上的多智能体编排框架,用于生成连贯的多镜头长视频。
推荐理由:Google 把长视频生成拆成四个可复用的智能体框架,并给出多镜头一致性的评测基准与量化结果。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在原生实时对话模型上加入近实时视频生成,实现带口型同步、自然表情和流畅轮次的视觉化对话,已在 Gemini Enterprise 上线。
推荐理由:官方给出 Live Avatar 的实时音视频能力、异步工具调用与 97 种语言支持,可据此判断企业级对话智能体的形态变化。
Google Cloud API Gateway 进入 Public Preview,可作为远程 MCP 服务器,在已有 OpenAPI 3.0.x 或 3.1.x 规范上通过 x-google-api-management.mcp 注解,把现有 REST 操作暴露为智能体可调用的 MCP 工具,无需另建服务器。
推荐理由:原文给出把现有 REST API 直接暴露为 MCP 工具的具体配置步骤与限制,可据此评估改造成本。
Google Private AI Compute 团队公布为 Private AI Compute 平台引入私有服务端记忆的技术方案,让云端 AI 在跨设备场景下持久保留上下文,同时维持端侧级隐私标准。
推荐理由:Google 公开了 Private AI Compute 的持久化服务端记忆方案,读者可了解云端 AI 如何在保留跨设备上下文的同时维持端侧级隐私。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与深度创作控制,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:官方给出两款 TTS 的定位差异、语音克隆与逐行导演能力,以及多项基准排名,便于判断其在配音与语音智能体场景的适用性。
联合国系统发布 UN System Data Commons,这是一个基于 Google Data Commons 构建的开源平台,把分散的全球统计数据整合为可搜索的 AI-ready 知识图谱。
推荐理由:联合国系统与 Google 合作把分散的全球统计数据整合为可自然语言查询、可被 AI 智能体调用的知识图谱。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型在语音质量与智能体任务基准上的排名和分数,可据此判断实时语音智能体的能力水位。