llama-server 开发文档 本文是llama-server的开发者文档,详细介绍了其后端架构、特性范围、批处理机制、线程管理、请求处理流程、可恢复流式传输(SSE重播缓冲区)、测试方法、工具API、路由模式下的子进程通信与模型管理API,以及基于SvelteKit的Web UI的架构、功能与技术栈。文章面向贡献者,深入探讨了核心设计决策和实现细节。 llama-server 推理服务器 批处理 可恢复流式传输 多模型路由 SvelteKit ggml-org 发布于 1 天前 30 0 0
使用pytest测试llama-server的完整指南 本文介绍如何使用pytest对llama-server进行基于Python的服务器测试,包括环境搭建、运行测试、环境变量配置以及调试外部llama-server的方法。内容涵盖安装依赖、执行测试脚本、并行测试设置、慢测试运行、实时调试等实用技巧。 服务器测试 pytest llama-server 环境变量 调试 单元测试 ggml-org 发布于 2026-03-06 8 0 0