meng shao

深读免费书「Inference Engineering」:Prefill 吃算力、Decode 吃带宽,讲透从 CUDA 到生产部署的推理优化

本文作者:meng shao(@shao__meng)。版权归作者所有,未经授权禁止转载。 Inference Engineering Baseten 出版的一本系统化讲授「如何把 AI 模型在生产环境中跑得快、跑得省、跑得稳」的工程书籍,作者 @philipkiely,支持在线免费阅读。它覆盖从 CUDA 内核到 Kubernetes 的完整技术栈,
AI一起学
00:00:00 00:00:00