人工智能
未读
QKV 注意力:交互式图解,一步一步"算"懂 Attention
三个可交互组件把注意力机制点出来:QKV 投影的分步推导、从打分到加权求和的完整链路(含温度滑块)、多头 reshape/transpose 的视图变换。全部数值真实可验算。
人工智能
未读
AI Agent 应用架构:Function Calling、ReAct 与多智能体编排
从 Function Calling 协议到 ReAct 循环、记忆设计、多智能体编排与 MCP 生态,附一个不到 80 行的最小可用 Agent 实现与生产工程清单。
人工智能
未读
RAG 系统设计:从 Embedding、混合检索到重排的完整链路
检索增强生成的完整设计链路:语义切块、Embedding 选型、向量与 BM25 混合检索、交叉编码器重排、引用约束生成与评估指标。
人工智能
未读
大模型量化:从 INT8、GPTQ 到 GGUF 的压缩实践
用更低的数值精度换显存与速度:线性量化原理、PTQ 与 QAT 路线、GPTQ/AWQ/GGUF 三大方案对比与选型建议,附可运行的量化代码。
人工智能
未读
LLM 推理引擎设计:KV Cache、PagedAttention 与连续批处理
从显存账本出发拆解 vLLM 三大支柱:KV Cache、PagedAttention 分页管理与 Continuous Batching 动态调度,外加投机解码无损加速与采样参数实践。
人工智能
未读
大模型训练全景:预训练、SFT 与 RLHF/DPO 对齐的完整链路
从预训练的下一个 token 预测,到 SFT 的指令微调与 Loss Masking,再到 RLHF/DPO 偏好对齐——完整梳理大模型训练三阶段的数据、方法与工程要点。
人工智能
未读
Transformer 架构详解:从注意力机制到现代 LLM 的工程演进
逐层拆解 Decoder-only Transformer:QKV 注意力与因果掩码、RoPE 位置编码、SwiGLU 前馈网络、Pre-Norm 与 RMSNorm,附 50 行最小实现与 7B 模型参数量估算。
人工智能
未读
LLM 的底层基石:Tokenizer 与 BPE 分词算法的设计与实现
分词器是大模型技术栈的最底层。本文从字符与词级方案的缺陷讲起,完整推导 BPE 算法并给出可运行的 Python 实现,覆盖 Byte-level BPE、词表大小权衡与对话模板等工程细节。

