Hyperloom Specialist 与配置调优:一个 Agentic 调参系统的源码拆解
拆解 AMD Hyperloom 的 specialist 实现与服务配置调优链路:knob 面、变体指纹、贪心爬山、衰减接受线与单次测量的方法学边界
共 192 篇文章 · 按发布时间倒序
拆解 AMD Hyperloom 的 specialist 实现与服务配置调优链路:knob 面、变体指纹、贪心爬山、衰减接受线与单次测量的方法学边界
沿 vLLM 源码解释 async scheduling 的三态配置、output placeholder、EAGLE/MTP 状态归属,以及 accepted-count 同步如何影响真实重叠
沿一次 Kimi K3 前向过程,系统解释 Hybrid KDA–MLA、AttnRes、Stable LatentMoE、长上下文训练和在线推理系统
cmux(Ghostty 内核的 macOS AI 终端)的配色、侧栏、远程 SSH 全套配置,附一次实配过程中踩到的 12 个坑与实测数据。
从显存、计算、通信与拓扑四个约束理解推理侧 DP、TP、PP、EP、CP 的作用域和组合方法
用 HBM 流量、并行度、Kernel launch 与同步四个控制点理解 FlashAttention、Decode Kernel、Fusion 和 CUDA Graph
在固定配置下把 KV prefix hit 映射到 compute、cache load、overlap、TTFT 与 Delivered/Physical TPM
MoE 推理中的参数口径、dispatch-compute-combine 数据流、EP 边界与显存合同
LLM 推理容量模拟器的场景输入、显存、吞吐、scope、低精度格式与校准合同
用一次 decode step 串起 hidden state、Attention、FFN/MoE、LM Head 和 Sampling
用算力、带宽、容量与通信四种压力串起 Token 数据流、KV Cache、量化、调度、并行、Kernel 和 Serving
理解 KV Cache 的复用语义、容量公式、分页与共享机制,以及从分配到驱逐的生命周期
从第一性原理解释量化对象、数值格式、Scale 粒度、PTQ/QAT、运行时 Kernel 与性能验收边界
把 INT8、VNNI、AMX、Cache、Memory Wall 和 perf/IBS 的 CPU 心智模型映射到 Scale、Tensor Core、HBM 与 GPU Kernel 验证
区分 FP4/FP8 数值格式、Current/Delayed/Block scaling、NVFP4 与 MXFP8,并说明 Checkpoint 到 Kernel 的能力边界
用待 Trace 复核的 GLM-5.2 Prefill 示例路径解释 W4A8、E2M1/E4M3、低精度 BMM、BF16 Attention 与 FP8 KV Cache
按控制点理解 GPTQ、AWQ、SmoothQuant、Rotation 与 QAT,并用执行真实性、质量、容量、性能四道门验收量化方案
Intel AMX 的 Tile 寄存器、TMUL、低精度输入与宽精度累加合同
用 KV 共享、表示压缩、访问稀疏和递推状态四条路线理解现代 LLM Attention
把线上 profiling 证据和仿真假设验证组织到同一个推理性能分析框架里
用 GLM-5.2 Prefill Trace 区分 worker 供给、模型计算、KV 数据路径、通信与同步
区分 scheduler chunk 与 GDN kernel chunk,并解释 prepare_chunk_indices 的映射和同步边界
解释 MLA 的低秩 KV、RoPE 解耦、矩阵吸收、容量公式与 serving 边界
从调度合同、Attention/GEMM 形状与验收矩阵理解 Chunked Prefill 的收益和边界
用 Serving Stack、实现差异和选型合同比较 LLM 推理框架,而不是寻找脱离 workload 的最快引擎
对 DeepSeek-V3 Technical Report 的中英对照导读:架构、MoE 负载均衡、MTP、FP8 训练、Prefill/Decode 部署和推理工程启发
调研 DeepSeek DSpark 的半自回归草稿模型、置信度调度验证、DeepSpec 源码实现,并和 MTP-1 对比其工程边界
验证文章中嵌入 agent 生成的 HTML 交互图。
用 causal attention 的下三角区域推导 prefix cache hit 后 attention 近似按 1-h² 缩放
AWP 性能分析平台的 REST API 文档:异步提交 GPU/CPU profiling 任务并查询分析结果
基于摄入材料整理 CSA/HCA 的逐层压缩、Indexer、异构 cache 与百万上下文估算,并明确待核验边界
一份可一键复刻的 Zsh / Oh-My-Zsh 配置:插件、主题、别名与跨机迁移脚本。
深度优先搜索与广度优先搜索的原理及应用
动态规划基础:斐波那契、记忆化搜索与状态转移
滑动窗口与双指针技巧及例题
前缀和算法原理与经典例题汇总
排序算法与 Python 自定义排序技巧
C 语言指针的定义、用法与常见陷阱
C/C++ 中 size_t 类型的定义、原理与使用场景
Makefile 规则语法与编写实践
CMake 构建系统的核心概念与常用配置
Markdown 中图片尺寸控制的特殊语法说明
VPS 服务器配置 Shadowsocks 代理教程
HPCA14 论文解读:上下文相关的 Load Value 预测器
卷积神经网络基础:Filter、Padding 与 Stride 操作
CVPR 无边界框目标检测论文笔记
IPython、timeit 等 Python 开发辅助工具
Effective Python 编程技巧与最佳实践
Python logging 模块使用与日志级别配置
pip 镜像源配置与包管理技巧
Python 数据结构:切片、列表与元组操作
Pytest 与 Unittest 测试框架使用指南
Python 高阶函数与字符串处理技巧
Python 与 C/C++ 混合编程方法
论文总结 - Heterogeneity-Aware Cluster Scheduling Policies for Deep Learning Workloads
Agentic Infra 推理优化方法论摘要:从 Profiling、根因分类和分层优化走到 A/B 验证闭环
Agentic AWP 平台建设文档摘要:六维 Breakdown、L0-L3 能力体系与从观测到验证的归因路径
Java 设计模式分类与总览
2019 新年目标规划与学习方向记录
编程与生活的日常随笔感悟集
2018 年日常开发与调试工作日志
常见数据结构概念与应用索引
从新手视角解释 AI 推理的基本概念:推理和记忆的区别、token 生成与推理的关系、演绎归纳溯因,以及什么样的问题真正考验推理。
reasoning model 和普通模型有什么区别?为什么模型知道很多却一推就错?为什么接上工具后小模型短任务聪明、长任务却容易崩?
梳理 RAG、memory、session summary、fine-tuning、post-training、distillation 的区别,以及什么时候该用什么方案。
详解 GPU 性能分析中的区间合并、扫描线算法原理,以及 Temporal Breakdown 和 Overlap Analysis 两个核心分析模块的计算逻辑
OpenClaw 自托管 AI 网关的完整学习笔记,涵盖架构协议、配置详解、聊天通道、工具系统、Skills 技能、会话管理、多代理路由、插件系统、模型安全、CLI 速查,以及 AWP Task DAG 与 learn-claude-code 的深度对比分析
论文精读 — CUDA Agent 通过大规模 Agentic 强化学习系统,让 LLM 学会自主编写和优化 CUDA kernel,在 KernelBench 上全面超越 torch.compile 和顶级闭源模型
用算术强度和 Roofline 判断 LLM 推理的算力、显存带宽与数据搬运瓶颈
从请求队列、token budget 与连续批处理理解 LLM Serving 调度器的核心合同
理解投机解码的 draft、verify、accept/reject 稳定原理,分布等价条件与真实性能边界
C++ 采样分析中 DWARF 栈回溯与 eBPF 技术实现
MMU 页表遍历单元的硬件结构与地址转换流程
论文精读 — SAC 通过动态重配置 LLC 路由策略,根据跨芯片数据共享特征在 memory-side 和 SM-side LLC 组织方式间切换,在多芯片 GPU 上实现平均 63% 的性能提升
NVLink、NVSwitch 与 GPU 间高速互连通信技术
x86 指令类型分类、占比分析与高频指令解读
POSIX 线程条件变量与超时等待机制详解
Linux 透明大页机制与 Hugepages 内存优化
CPU 缓存原理、映射策略、替换算法与一致性协议
系统性解析现代GPU架构设计原理,涵盖SIMT执行模型、SM微架构、内存层次结构及线程调度机制
ART 虚拟机创建过程与 JNI_CreateJavaVM 流程
dex2oat 编译触发时机与 oat 文件结构分析
ART 中 JNI 原理、native 函数注册与调用流程
栈式与寄存器虚拟机对比及 ART/Dalvik 设计杂谈
Value Prediction 经典论文解读与投机执行分类
ARM 汇编指令集速查表与指令格式说明
链接器与加载器原理:ELF 文件格式与目标文件结构
Thermal 模块初始化流程与 DTS 解析过程
二叉树遍历的递归与迭代实现及例题解析
Linux init.h 中 initcall 机制与模块加载顺序
Linux Thermal 框架的 Zone、Governor 与 Cool Device 架构
MIT xv6 教学操作系统的 RISC-V 架构与寄存器基础
Spring 框架核心特性:IoC 与 AOP
Node.js 与 npm/yarn 的安装配置指南
MySQL 基础操作、索引与存储引擎
Python ORM 框架 Peewee 使用指南
二分搜索模板与区间开合分析
YOLO 目标检测算法原理与人脸识别应用
最长公共子串与最长公共子序列算法
栈的应用:括号匹配与递归问题求解
Redis 服务与 redis-py 客户端使用
字符串操作与常见算法题目总结