本文是《Why Software Factories Fail》系列第三部分,聚焦于新提出的长期编程基准测试SlopCodeBench。作者测试了Claude Opus 5、Sonnet 5和Opus 4.8在逐步揭示需求的编程挑战中的表现,发现即使是最先进的模型也仅取得24%的严格通过率(Opus 5),且随着检查点推进,代码膨胀、复杂度上升、重复率增加等“垃圾代码”指标显著恶化。文章指出,当前模型在需要长期维护代码库的真实软件工程任务中仍不可靠,无法实现“无人值守”开发。作者认为SlopCodeBench是衡量模型维护代码能力的有前途的信号,并讨论了未来方向,如使用更小的模型来放大代码质量信号。