Llava.cpp 路由服务器与 Pi 集成实现多模型按需加载 本文介绍了如何将 llava.cpp 的路由服务器与 Pi 集成,实现按需加载或卸载多个 GGUF 模型。内容包括启动路由服务器(需指定模型目录、禁用自动加载、启用 Jinja 模板等关键选项)、配置 Pi 客户端、通过 /llama 命令管理模型(加载/卸载、从 Hugging Face 下载)、以及常见问题的排查方法。适合需要在本地灵活部署多个大语言模型的开发者。 llama.cpp 路由服务器 GGUF模型 模型管理 本地部署 Pi badlogic 发布于 2026-07-18 14 0 0