跳转到主要内容

AI 系统

GPU 计算、分布式训练、Profiling、框架与推理优化

GPU 计算、分布式训练、Profiling、框架与推理优化

53 篇文章

LLM 推理 30 学习路径顺序 · 日期为更新时间

LLM 推理系统全栈地图 KV Cache:推理性能的命根子 Compute-bound vs Memory-bound:推理的两大瓶颈 从 AVX/AMX 到 Tensor Core:CPU 工程师理解 LLM 量化 量化:从 Scale 到 W4A8 的完整坐标 量化方法与评测:从 PTQ/QAT 到可复现实验 批处理与调度:推理服务的灵魂 投机解码:突破 decode 一次只出一个 token 的限制 推理 Kernel / Runtime 优化:少搬、少启、少等 推理并行:DP、TP、PP、EP 与 CP 怎么选 Token Flow 与 Hidden State:从 Attention 到 LM Head GLM-5.2 量化执行图:W4A8、BMM 与 KV8 Attention 架构演化:从多头注意力(MHA)到 GQA、MLA GDN 与 Chunked Prefill:为什么 prepare_chunk_indices 会出现在 trace 里 Causal Attention:为什么 KV hit 后 Attention 按 1 - h² 缩放 vLLM Async Scheduling:三态配置、投机解码与状态提交 Kimi K3:架构、训练与推理系统研究 模拟器建模指南:显存与吞吐公式 KV Cache Hit Ratio 修正模型:从直觉到统一公式 MoE 推理:Expert Parallelism(EP)、显存与调度 FP4/FP8 量化:值域、Scale 与运行时合同 Prefill Trace:Worker 供给、DSA/MLA 与 Chunked Prefill DeepSeek MLA:低秩 KV Cache 与推理效率 Chunked Prefill 深入分析:调度、Chunk Size 与 Attention 形状 推理框架对比 2026:从 Engine 到 Serving Stack DSpark 与 MTP:DeepSeek 投机解码调研 CSA/HCA 注意力:DeepSeek-V4 的混合压缩稀疏机制 Hyperloom Specialist 与配置调优:一个 Agentic 调参系统的源码拆解 DeepSeek-V3 Technical Report:中英对照解读 Agentic Infra:LLM 推理性能优化与 GPU 利用率提升

性能分析 9

GPU 计算 5

推理 3

分布式训练 3

训练框架 1

Agentic Infra 1

AMX 1