跳转到主要内容
WeiGao
首页
AI 系统
体系结构
编程基础
工具箱
更多
⌘
K
搜索文档
ESC
输入关键词开始搜索
最近搜索
搜索中...
未找到相关结果
尝试使用不同的关键词
找到
0
个结果
↑
↓
导航
Enter
选择
点击结果跳转
Powered by Pagefind
导航
首页
AI 系统
体系结构
编程基础
工具箱
当前章节
LLM 推理
概览
LLM 推理系统全栈地图
KV Cache:推理性能的命根子
Compute-bound vs Memory-bound:推理的两大瓶颈
从 AVX/AMX 到 Tensor Core:CPU 工程师理解 LLM 量化
量化:从 Scale 到 W4A8 的完整坐标
量化方法与评测:从 PTQ/QAT 到可复现实验
批处理与调度:推理服务的灵魂
投机解码:突破 decode 一次只出一个 token 的限制
推理 Kernel / Runtime 优化:少搬、少启、少等
推理并行:DP、TP、PP、EP 与 CP 怎么选
Token Flow 与 Hidden State:从 Attention 到 LM Head
GLM-5.2 量化执行图:W4A8、BMM 与 KV8
Attention 架构演化:从多头注意力(MHA)到 GQA、MLA
GDN 与 Chunked Prefill:为什么 prepare_chunk_indices 会出现在 trace 里
Causal Attention:为什么 KV hit 后 Attention 按 1 - h² 缩放
vLLM Async Scheduling:三态配置、投机解码与状态提交
Kimi K3:架构、训练与推理系统研究
模拟器建模指南:显存与吞吐公式
KV Cache Hit Ratio 修正模型:从直觉到统一公式
MoE 推理:Expert Parallelism(EP)、显存与调度
FP4/FP8 量化:值域、Scale 与运行时合同
Prefill Trace:Worker 供给、DSA/MLA 与 Chunked Prefill
DeepSeek MLA:低秩 KV Cache 与推理效率
Chunked Prefill 深入分析:调度、Chunk Size 与 Attention 形状
推理框架对比 2026:从 Engine 到 Serving Stack
DSpark 与 MTP:DeepSeek 投机解码调研
CSA/HCA 注意力:DeepSeek-V4 的混合压缩稀疏机制
Hyperloom Specialist 与配置调优:一个 Agentic 调参系统的源码拆解
DeepSeek-V3 Technical Report:中英对照解读
Agentic Infra:LLM 推理性能优化与 GPU 利用率提升
性能分析
概览
从 Profiling 到 Simulation:推理性能分析的证据链方法
Critical Path of AI Trace
Temporal Breakdown 计算分析
GPU Trace 时间分解与通信计算重叠分析
NVTX 原理分析
HTA 算法原理与实现
Cprof C++ Profiling 核心技术
Python AI Profiling
Agentic AWP:规模化 Profiling 驱动的 GPU 效率 Breakdown 与能力体系
GPU 计算
概览
GPU Architecture Deep Dive
GPU Communication
PTX 技术详解
CUDA Agent
SAC: Sharing-Aware Caching in Multi-Chip GPUs
推理
概览
01. 什么是 AI 推理
02. Reasoning Model、Agent 与长任务
03. RAG、Memory、Fine-tuning 与 Distillation
分布式训练
概览
Megatron & Parallel
nccl-test run
Gavel: Heterogeneity-Aware Cluster Scheduling (OSDI'20)
训练框架
概览
Dynamic Batching 分析
Agentic Infra
概览
OpenClaw 完全指南:从入门到多代理架构
AMX
概览
OpenVino
章节
AI 系统
AMX
首页
/
Ai Systems
/
AMX
AMX
1 篇文章
文章
01
OpenVino
Intel OpenVINO 推理优化框架与 MKL-DNN 加速方式
7月14日