01
GLM-5.2 量化执行图:W4A8、BMM 与 KV8
ai-systems / llm-inference
llm-inferencequantizationfp4fp8
+2
02
量化方法与评测:从 PTQ/QAT 到可复现实验
ai-systems / llm-inference
llm-inferencequantizationprofilingresearch
03
从 Profiling 到 Simulation:推理性能分析的证据链方法
ai-systems / profiling
profilingsimulationllm-inferenceperformance-analysis
+1
04
GDN 与 Chunked Prefill:为什么 prepare_chunk_indices 会出现在 trace 里
ai-systems / llm-inference
llm-inferencegdnqwen3nextchunked-prefill
+3
05
AWP Profiling API
toolbox
profilingapigpucpu
+2
06
Agentic Infra:LLM 推理性能优化与 GPU 利用率提升
ai-systems / llm-inference
llm-inferencegpu-optimizationprofilingawp
+4
07
Agentic AWP:规模化 Profiling 驱动的 GPU 效率 Breakdown 与能力体系
ai-systems / profiling
awpgpu-profilingbreakdowngpu-efficiency
+3
08
GPU Trace 时间分解与通信计算重叠分析
ai-systems / profiling
GPUProfilingPerformanceDistributed Training
09
Cprof C++ Profiling 核心技术
ai-systems / profiling
profilingperfDWARFeBPF
+2
10
HTA 算法原理与实现
ai-systems / profiling
profilingpytorchgpudistributed-training
+2
11
Critical Path of AI Trace
ai-systems / profiling
AITraceCritical PathGPU
+1