人工智能
未读
矩阵数学(四):现代 AI 架构的矩阵身份证
Attention 的 GEMM+行算子解剖、卷积=im2col+GEMM、MoE=稀疏寻址、KV Cache 的增量矩阵乘结构——用矩阵语言串联模型/系统/硬件三层。附卷积 im2col 双视角演示。
人工智能
未读
矩阵数学(一):线性变换 —— 矩阵乘法的几何本质
矩阵不是数字表格,是对空间的变换:列是基向量落点,det 是面积因子,矩阵乘法是变换复合。附 2D 线性变换游乐场与矩阵乘法四视角交互组件。
人工智能
未读
QKV 注意力:交互式图解,一步一步"算"懂 Attention
三个可交互组件把注意力机制点出来:QKV 投影的分步推导、从打分到加权求和的完整链路(含温度滑块)、多头 reshape/transpose 的视图变换。全部数值真实可验算。
人工智能
未读
算力调度与推理集群:K8s、NPU 切分与弹性部署
裸金属到云原生的算力运营:K8s device plugin 与 NPU 接入、vNPU 动态切分、Volcano 的成组调度与队列管理、推理服务的弹性伸缩与多租户隔离,以及可观测体系。
人工智能
未读
千卡训练集群:互联网络、集合通信与故障容忍
大模型训练的瓶颈一半在通信。详解 all-reduce 环算法的带宽推导、RDMA/RoCE 参数面网络设计、TP/PP/DP 的通信占比账本、HCCL/NCCL 的关系,以及千卡集群的故障处理体系。
人工智能
未读
NPU 编程栈拆解:以昇腾 CANN 为例,对照 CUDA 生态
从 CUDA 栈的分层出发,逐层拆解 CANN:AscendCL 运行时接口、GE 图引擎、TBE 算子开发、HCCL 集合通信与 torch_npu 适配层,附 CUDA→NPU 迁移的工程清单与常见坑。

