这篇文章详细介绍了 camelAI 团队如何通过自托管 DeepSeek V4 Flash 模型来提供免费 API 服务。他们选择了 AWS g7e.24xlarge 实例(4×RTX PRO 6000 Blackwell GPU),使用量化后的 MXFP4 权重(~150GB)。通过 DSpark 推测解码实现约 300 tokens/s 的流式生成,并重点优化了 KV cache:利用 DeepSeek V4 的压缩注意力机制将 GPU KV cache 容量提升至约 270 万 token,同时采用上下文窗口限制(256K)、量化缓存、闲置缓存卸载和会话粘性路由。成本方面,按需实例约 $12K/月,而 Spot 实例可降至 $4-6K/月,且费用固定,不会随用户量线性增长。整个方案开源在 GitHub。