百度开源 vLLM-Kunlun:让 vLLM 跑在昆仑 XPU 上
指南2026年7月31日8 分钟阅读
百度开源的 vLLM-Kunlun 是一个社区维护的硬件插件,让 vLLM 能无缝运行在昆仑 XPU 上。目前支持 20+ 主流模型,包括 Qwen、Llama、DeepSeek 等,还支持 W8A8、AWQ 等量化方案和 LoRA 微调。
本文编译自 vLLM for Baidu Kunlun,版权归原作者所有。
觉得有用?分享给更多人
觉得有用?分享给更多人
LLM 0.32rc2 带来两个新特性:默认模型更新为 GPT-5.6 Luna(价格略高但性能更好),以及新增 `llm openai endpoint` 命令,支持直接对任意 OpenAI 兼容端点发送提示。该命令还支持通过 `uvx` 一行运行,无需安装 LLM。
作者分享使用 GitHub Copilot 应用的堆叠会话和堆叠 PR 功能,现代化一个使用 React 15 等陈旧依赖的个人项目。通过将任务拆分为多个有序的 PR,避免了 scope creep,体验非常流畅。