llama.cpp b11517:CUDA 向 host MMQ 配置辅助函数传递 src1 精度(#30168)
llama.cpp 发布 b11517 版本,CUDA 后端在调用 host MMQ 配置辅助函数时开始传递 src1 精度,并将 src1 精度参数改为显式传入。该改动由 ynankani 提交,对应 PR #30168。
llama.cpp 发布 b11517 版本,CUDA 后端在调用 host MMQ 配置辅助函数时开始传递 src1 精度,并将 src1 精度参数改为显式传入。该改动由 ynankani 提交,对应 PR #30168。
研究提出在 Arm TrustZone 的 OP-TEE 中通过 WebAssembly Micro Runtime(WAMR)运行未经修改的 AI 模型,并配套一个加密 WebAssembly 二进制、将密钥存入设备熔丝的模型分发器,使只有 OP-TEE 中的 WAMR 可信应用能解密执行。
llama.cpp 发布 b11506,server 在 slot 保存/恢复时保留上下文检查点,恢复后的 slot 可直接回滚到检查点,无需重新处理整个 prompt。
llama.cpp 发布 b11516,修复 Hexagon 后端 IM2COL patch-embed 的 DMA ring 溢出问题:精确 tiling(stride == kernel。
联想 YOGA Pro 15 RTX Spark 于 10 月 8 日 9:00 开启全网盲约,是全球首批搭载 NVIDIA RTX Spark N1X 超级芯片的本地智能体 AIPC。
Unsloth 发布 v0.1.905-beta,为 Windows、Mac 和 Linux 引入沙箱机制,分别使用 MXC、Seatbelt 和 Bwrap 隔离模型运行的代码。
推荐理由:Unsloth 新增跨平台沙箱与决策模型训练流程,读者可据此判断本地微调与部署的可用性变化。
Google Cloud 将原生 TPU 支持集成进 vLLM,并以 Qwen3-Embedding-8B 和 Qwen3-VL-Embedding-8B 为目标模型做了多项工程优化,支持 4K+ token 文本和 15K+ token 多模态输入。
推荐理由:原文给出 vLLM-TPU 上部署 Qwen3 嵌入模型的具体优化与开源配方,可了解长上下文多模态嵌入的工程路径。