QKV 注意力:交互式图解,一步一步"算"懂 Attention
算力调度与推理集群:K8s、NPU 切分与弹性部署
千卡训练集群:互联网络、集合通信与故障容忍
NPU 编程栈拆解:以昇腾 CANN 为例,对照 CUDA 生态
AI 算力硬件:从 CPU 的三堵墙到 NPU 的达芬奇架构
AI Agent 应用架构:Function Calling、ReAct 与多智能体编排
RAG 系统设计:从 Embedding、混合检索到重排的完整链路
大模型量化:从 INT8、GPTQ 到 GGUF 的压缩实践
LLM 推理引擎设计:KV Cache、PagedAttention 与连续批处理
大模型训练全景:预训练、SFT 与 RLHF/DPO 对齐的完整链路
Transformer 架构详解:从注意力机制到现代 LLM 的工程演进
LLM 的底层基石:Tokenizer 与 BPE 分词算法的设计与实现
你好啊!我是
恒星不见
最新评论
最近发布
引用到评论