跳到正文
今天10月9日周五12 条
  1. Ollama Releases20

    Ollama v0.40.2 发布:旧模型后台自动升级至 llama.cpp

    Ollama v0.40.2 让旧版本下载的模型在首次运行时后台自动升级,以在 llama.cpp 上获得更好性能与兼容性,并保留原始副本作为备份以便安全降级。该版本还修复了 ollama list 对已升级模型重复显示的问题,ollama launch claude 现使用模型完整上下文长度。备份模型将在未来版本自动清除。

10月8日周四
  1. Ollama Releases8

    Ollama v0.40.1 发布

    Ollama 发布 v0.40.1,新增代理云端用量与余额 API,并移除 CLI 引导中的账户步骤。该版本修复了 Windows 上 llama 读取超过 2GiB 的问题,同时避免 Windows 上的符号链接,并清理了 README 中的失效链接。

  2. Google Developers Blog75

    Google 开源端侧 GPU 推理引擎 ML Drift

    Google AI Edge 团队以 Apache 2.0 协议开源端侧 GPU 计算引擎 ML Drift,它抽象 OpenGL ES、OpenCL、Metal 和 WebGPU,作为 LiteRT 的核心 GPU 加速引擎,也可独立使用。

    推荐理由:Google 开源端侧 GPU 推理引擎 ML Drift,并给出 Chrome、YouTube Shorts、Adobe 等迁移后的实测提速数据。

  3. Microsoft Research71

    微软开源 Agent Lightning v1.0:3500 行代码的轻量智能体 RL 框架

    微软研究院开源 Agent Lightning v1.0,一个约 3500 行代码的轻量智能体强化学习框架,提出 Harnessed Agentic RL 范式,让部署时使用的同一套 agent harness 直接参与训练,无需在训练框架内重新实现智能体。

    推荐理由:微软开源 Agent Lightning v1.0,用约 3500 行代码把真实 harness 直接接入 RL 训练,并给出 6000 样本的编码智能体训练结果。

10月7日周三
  1. Ollama Releases62

    Ollama v0.40.0 发布:Apple Silicon 上模型默认改用 MLX 运行

    Ollama 发布 v0.40.0,在 Apple Silicon 设备上,MLX 运行时支持的模型架构将自动改用 MLX 运行。此次支持的模型包括 qwen3.8、gemma4、qwen3.6 和 qwen3.5,决策模型 Nimble、tev1、clef、clef-flash 也已上线 MLX,嵌入模型 embeddinggemma-2 同样获得 MLX 支持。

    推荐理由:Ollama 在 Apple Silicon 上默认切换到 MLX 运行时,读者可据此了解本地部署的默认行为变化与已支持模型范围。

  2. Unsloth Releases60

    Unsloth 发布 v0.1.903-beta:内置浏览器、EmbeddingGemma 2 与语音克隆

    Unsloth 发布 v0.1.903-beta,在聊天旁加入内置浏览器面板,文件、网页和模型生成的 HTML 都以标签页打开,并支持对页面内容提问。该版本同时支持 Google DeepMind 的多模态嵌入模型 EmbeddingGemma 2,提供 740M 参数版本(纯文本 270M)、100+ 语言和 8K 上下文窗口,代码任务比上一代提升约 14%。

    推荐理由:Unsloth 一次更新同时加入内置浏览器、EmbeddingGemma 2 支持与语音克隆页面,可据此判断本地微调工具链的边界扩展。

10月6日周二
  1. Google Developers Blog72

    Google 发布 EmbeddingGemma 2 多模态嵌入模型

    Google 发布基于 Gemma 4 的 EmbeddingGemma 2,这是一个 Apache 2.0 许可的 sub-1B 开源嵌入模型,可将文本、代码、图像、视频和音频映射到统一的 768 维空间。

    推荐理由:EmbeddingGemma 2 的模块化编码器与 MRL 截断方案,为多模态 RAG 的显存与存储取舍提供了可量化的参考。

10月4日周日
10月3日周六