Unsloth 发布 v0.1.905-beta,新增跨平台沙箱与决策模型训练
Unsloth 发布 v0.1.905-beta,为 Windows、Mac 和 Linux 引入沙箱机制,分别使用 MXC、Seatbelt 和 Bwrap 隔离模型运行的代码。
推荐理由:Unsloth 新增跨平台沙箱与决策模型训练流程,读者可据此判断本地微调与部署的可用性变化。
Unsloth 发布 v0.1.905-beta,为 Windows、Mac 和 Linux 引入沙箱机制,分别使用 MXC、Seatbelt 和 Bwrap 隔离模型运行的代码。
推荐理由:Unsloth 新增跨平台沙箱与决策模型训练流程,读者可据此判断本地微调与部署的可用性变化。
Google AI Edge 团队以 Apache 2.0 协议开源端侧 GPU 计算引擎 ML Drift,它抽象 OpenGL ES、OpenCL、Metal 和 WebGPU,作为 LiteRT 的核心 GPU 加速引擎,也可独立使用。
推荐理由:Google 开源端侧 GPU 推理引擎 ML Drift,并给出 Chrome、YouTube Shorts、Adobe 等迁移后的实测提速数据。
在旧金山举行的 Windows AI and Surface 活动上,NVIDIA 与 Microsoft 宣布为 Windows PC 上的 AI 智能体共同设计软硬件,并公布 RTX Spark 笔记本即日开启预售、10 月 16 日开售,紧凑型台式机 11 月上市。
推荐理由:英伟达与微软把智能体运行所需的系统级容器和本地算力硬件一起端出,读者可据此判断本地智能体落地的软硬件门槛。
Liquid AI 发布 d1 决策模型家族的两款开源权重模型 d1-3B 和 d1-omni-600M(实验性)。
推荐理由:Liquid AI 开源两款决策模型,给出端侧延迟与七项基准对比,可判断小模型做结构化决策的可行性。
Google DeepMind 发布 EmbeddingGemma 2,一个基于 Gemma 4 架构、Apache 2.0 许可的开源多模态嵌入模型,可把文本、图像、音频和视频映射到统一嵌入空间。
推荐理由:官方给出 740M 参数、模块化编码器与端侧内存占用,可据此判断本地多模态检索的落地门槛。
Cursor 上线 Remote Control,用户可在 Cursor iOS app 中查看并回复运行在自己电脑上的本地智能体。该功能默认对除 Enterprise 组织外的所有用户开启,电脑需保持开机联网,可在桌面设置中开启 Keep this computer awake 防止休眠。
推荐理由:官方说明远程控制本地智能体的开启方式与限制,可据此判断移动端接管本地编码流程的可行性。
Google DeepMind 发布开放权重多模态嵌入模型 EmbeddingGemma 2,可将文本、图像、视频帧和音频映射到统一向量空间,参数量 740M,文本权重最低约 191MB 内存,完整多模态模型在 Google Pixel 11 Pro 上约 567MB。
推荐理由:EmbeddingGemma 2 把文本、图像、视频帧和音频映射到同一向量空间,并给出端侧内存与延迟数据,可据此判断本地多模态检索的落地边界。
NVIDIA 将于本月通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 等厂商推出 64GB 统一内存版 DGX Spark,10 月 23 日开售,起售价 4,999 美元,保留 GB10 Grace Blackwell 超级芯片、DGX OS 与完整 NVIDIA AI 软件栈,支持最高 1000 亿参数模型在设备端运行。
推荐理由:原文给出 64GB 新配置的定价、上市时间与双机集群方式,读者可据此判断本地跑大模型的硬件门槛。
Google 宣布 Antigravity SDK 支持本地模型与多种执行方式,首发通过 Google AI Edge 的 LiteRT 支持 Gemma 4 26B A4B,可在完全离线状态下提供智能体辅助。
推荐理由:官方给出本地模型接入 Antigravity SDK 的完整配置与混合编排示例,可据此评估离线智能体工作流的成本与隐私取舍。
Google Cloud 将原生 TPU 支持集成进 vLLM,并以 Qwen3-Embedding-8B 和 Qwen3-VL-Embedding-8B 为目标模型做了多项工程优化,支持 4K+ token 文本和 15K+ token 多模态输入。
推荐理由:原文给出 vLLM-TPU 上部署 Qwen3 嵌入模型的具体优化与开源配方,可了解长上下文多模态嵌入的工程路径。