LLM推理
an archive of posts with this tag
| Jul 06, 2026 | vllm v1 源码精读(三):KV Cache 管理、Chunked Prefill 与异步架构 |
|---|---|
| Jul 06, 2026 | vllm v1 源码精读(二):generate() 计算流——model.forward() 在哪里被调用? |
| Jul 06, 2026 | vllm v1 源码精读(一):为什么要重写,以及 LLM() 这行代码背后发生了什么 |
| Jun 26, 2026 | 长音频转写慢 10 倍,99% 的 Attention 在白做功——MURMUR 如何破解这道难题 |
| May 17, 2026 | KDD'25 | BurstGPT:我们收集了 1031 万条 Azure OpenAI 真实 trace,LLM 推理系统没你想的那么稳 |