LLaMA.cpp HTTP Server 是一个基于 llama.cpp 的轻量级 C/C++ HTTP 服务器,提供与 OpenAI API 兼容的聊天补全、嵌入、重新排序等端点,并支持多模型路由、多模态输入、函数调用、推测解码、JSON 模式输出和内置 Web UI。本文档详细说明了服务器启动参数(包括通用、采样和服务器特有参数)、构建方法、快速启动指南、各 API 端点的请求格式与响应示例,以及多模型路由模式下的模型管理与 SSE 事件。该服务器可作为本地或自托管 LLM 推理服务的基础架构,适合开发者和高级用户用于集成或部署。