llama-server 开发文档 本文是llama-server的开发者文档,详细介绍了其后端架构、特性范围、批处理机制、线程管理、请求处理流程、可恢复流式传输(SSE重播缓冲区)、测试方法、工具API、路由模式下的子进程通信与模型管理API,以及基于SvelteKit的Web UI的架构、功能与技术栈。文章面向贡献者,深入探讨了核心设计决策和实现细节。 llama-server 推理服务器 批处理 可恢复流式传输 多模型路由 SvelteKit ggml-org 发布于 1 天前 31 0 0