JetBrains 发布 Mellum2.1:面向编码智能体的快速开源模型
JetBrains 发布 Mellum2.1,这是其 6 月开源的 12B MoE 模型的新版本,架构不变,仍为 2.5B 激活参数、Apache 2.0 许可。
推荐理由:JetBrains 开源编码智能体模型 Mellum2.1,读者可了解其 RL 后训练路线与自托管部署方式。
JetBrains 发布 Mellum2.1,这是其 6 月开源的 12B MoE 模型的新版本,架构不变,仍为 2.5B 激活参数、Apache 2.0 许可。
推荐理由:JetBrains 开源编码智能体模型 Mellum2.1,读者可了解其 RL 后训练路线与自托管部署方式。
AWS 宣布 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上线。
推荐理由:AWS 官方给出 Haiku 5.5 的定位、成本变化与 Bedrock 接入方式,可据此判断它在多智能体分层中的分工。
Google Earth AI 的 Population Dynamics Foundation Model(PDFM)将匿名搜索趋势、人口流动、建成环境密度和环境数据压缩为按月更新的位置嵌入向量,无需任务微调即可直接接入现有流行病学模型。
Google DeepMind 发布开放权重多模态嵌入模型 EmbeddingGemma 2,可将文本、图像、视频帧和音频映射到统一向量空间,参数量 740M,文本权重最低约 191MB 内存,完整多模态模型在 Google Pixel 11 Pro 上约 567MB。
推荐理由:EmbeddingGemma 2 把文本、图像、视频帧和音频映射到同一向量空间,并给出端侧内存与延迟数据,可据此判断本地多模态检索的落地边界。
针对扩散 Transformer 长序列生成中稀疏注意力导致质量下降的问题,研究者提出免训练框架 MC-Sparse,通过缓存查询分组、KV 索引与稠密-稀疏注意力残差并在去噪步骤间复用,实现更高保真度。在 Minimax-H3-Base 上取得 1.80 倍去噪加速,3D 资产生成上达 2.32 倍,质量损失可忽略。
Google 发布新一代联邦学习系统,用可信执行环境(TEE)为数据匿名化提供可验证、可审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。新系统把客户端梯度计算移到服务端,训练时间瓶颈从设备可用性转为 TEE 资源,此前每个模型训练需 1-2 个月。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的实际部署效果。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例与更强教师的成功示范,自动生成并验证新的可执行训练任务,并随模型进步动态调整课程。该流程以 EnterpriseOps Gym 数据集为例演示,生成的任务需满足可行性、真实性与难度三项要求,验证器则需保证一致性、可靠性与完整性。
微软研究院开发了一套端到端机器学习流水线,利用 L1 太阳风观测和 AE、Dst 指数预报,结合纬度、地质电导率与电网数据,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
微软研究院对移动操作机器人工作负载做了首次系统性测量,发现把物理 AI 推理从机器人端侧 GPU 卸载到边缘或云端 GPU 可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软研究院系统测量了机器人端侧 GPU 推理的瓶颈,并给出可复用的 Kubernetes 卸载工具链,读者可据此判断物理 AI 的部署取舍。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。
推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,并给出注意力与 Mamba 两类内核的实测对比。