人工智能
未读
QKV 注意力:交互式图解,一步一步"算"懂 Attention
三个可交互组件把注意力机制点出来:QKV 投影的分步推导、从打分到加权求和的完整链路(含温度滑块)、多头 reshape/transpose 的视图变换。全部数值真实可验算。
人工智能
未读
算力调度与推理集群:K8s、NPU 切分与弹性部署
裸金属到云原生的算力运营:K8s device plugin 与 NPU 接入、vNPU 动态切分、Volcano 的成组调度与队列管理、推理服务的弹性伸缩与多租户隔离,以及可观测体系。
人工智能
未读
千卡训练集群:互联网络、集合通信与故障容忍
大模型训练的瓶颈一半在通信。详解 all-reduce 环算法的带宽推导、RDMA/RoCE 参数面网络设计、TP/PP/DP 的通信占比账本、HCCL/NCCL 的关系,以及千卡集群的故障处理体系。
人工智能
未读
NPU 编程栈拆解:以昇腾 CANN 为例,对照 CUDA 生态
从 CUDA 栈的分层出发,逐层拆解 CANN:AscendCL 运行时接口、GE 图引擎、TBE 算子开发、HCCL 集合通信与 torch_npu 适配层,附 CUDA→NPU 迁移的工程清单与常见坑。
人工智能
未读
AI 算力硬件:从 CPU 的三堵墙到 NPU 的达芬奇架构
为什么 CPU 跑不动大模型?从计算墙、内存墙、功耗墙出发,拆解 GPU 的 SIMT/Tensor Core 设计,详解昇腾达芬奇架构的 3D Cube/Vector/Scalar 与存储层次,并覆盖端侧 NPU(RK3588)的取舍。
人工智能
未读
AI Agent 应用架构:Function Calling、ReAct 与多智能体编排
从 Function Calling 协议到 ReAct 循环、记忆设计、多智能体编排与 MCP 生态,附一个不到 80 行的最小可用 Agent 实现与生产工程清单。
人工智能
未读
RAG 系统设计:从 Embedding、混合检索到重排的完整链路
检索增强生成的完整设计链路:语义切块、Embedding 选型、向量与 BM25 混合检索、交叉编码器重排、引用约束生成与评估指标。
人工智能
未读
大模型量化:从 INT8、GPTQ 到 GGUF 的压缩实践
用更低的数值精度换显存与速度:线性量化原理、PTQ 与 QAT 路线、GPTQ/AWQ/GGUF 三大方案对比与选型建议,附可运行的量化代码。

