百度开源 vLLM-Kunlun:让 vLLM 跑在昆仑 XPU 上

指南2026年7月31日8 分钟阅读
百度开源 vLLM-Kunlun:让 vLLM 跑在昆仑 XPU 上
百度开源的 vLLM-Kunlun 是一个社区维护的硬件插件,让 vLLM 能无缝运行在昆仑 XPU 上。目前支持 20+ 主流模型,包括 Qwen、Llama、DeepSeek 等,还支持 W8A8、AWQ 等量化方案和 LoRA 微调。
本文编译自 vLLM for Baidu Kunlun,版权归原作者所有。

觉得有用?分享给更多人

获取每周 AI 工具精选

工具推荐、实战教程和生态洞察,每周更新。

相关文章

LLM 0.32rc2 带来两个新特性:默认模型更新为 GPT-5.6 Luna(价格略高但性能更好),以及新增 `llm openai endpoint` 命令,支持直接对任意 OpenAI 兼容端点发送提示。该命令还支持通过 `uvx` 一行运行,无需安装 LLM。

指南Simon Willison·7月30日·2 分钟

作者分享使用 GitHub Copilot 应用的堆叠会话和堆叠 PR 功能,现代化一个使用 React 15 等陈旧依赖的个人项目。通过将任务拆分为多个有序的 PR,避免了 scope creep,体验非常流畅。

指南GitHub·7月30日·8 分钟

评论