Google Cloud 在 TPU 上为 vLLM 加入长上下文多模态嵌入推理支持
Google Cloud 将原生 TPU 支持集成进 vLLM,并以 Qwen3-Embedding-8B 和 Qwen3-VL-Embedding-8B 为目标模型做了多项工程优化,支持 4K+ token 文本和 15K+ token 多模态输入。
推荐理由:原文给出 vLLM-TPU 上部署 Qwen3 嵌入模型的具体优化与开源配方,可了解长上下文多模态嵌入的工程路径。
技术方向
开源项目与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
24 条精选近 30 天 19 条共收录 192 条
Google Cloud 将原生 TPU 支持集成进 vLLM,并以 Qwen3-Embedding-8B 和 Qwen3-VL-Embedding-8B 为目标模型做了多项工程优化,支持 4K+ token 文本和 15K+ token 多模态输入。
推荐理由:原文给出 vLLM-TPU 上部署 Qwen3 嵌入模型的具体优化与开源配方,可了解长上下文多模态嵌入的工程路径。
Zed 团队发布 Delta,一个面向智能体编码与代码审阅的多人协作环境,首批用户已进入私测。Delta 基于自研 DeltaDB,将对话与 worktree 实时同步,兼容现有 git 仓库,评论可锚定到任意代码行并随代码演进;DeltaDB 还支持云端运行,关闭笔记本后智能体继续工作,并可通过链接在浏览器打开。
推荐理由:Zed 团队把 DeltaDB 的实时同步能力做成独立应用,读者可了解多人协作写代码与审阅智能体产出的新形态。
Berkeley AI Research 与 IBM Research 将 K-Search 进化式内核搜索框架扩展到 MLX,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA 内核经验迁移到 Apple Silicon。
推荐理由:展示了把 CUDA 内核优化经验结构化迁移到 Apple Silicon 的方法,并给出注意力与 Mamba 两类内核的实测对比。
Model Context Protocol 发布 2025-11-25 修订版的稳定版本,规范已在 MCP 官网提供。该修订版的详细变更可查阅 2025-11-25 changelog。
推荐理由:MCP 2025-11-25 修订版转为稳定版,读者可据此确认协议版本状态并查阅变更清单。