Hardware Architecture
本分区整理 AI 加速硬件的架构与编程模型:端侧 NPU 的计算单元划分、片上存储、 寄存器/指令接口,以及"模型算子如何落到这些硬件资源上"。
与 Generative AI 分区平行:Generative AI 关注模型本身(架构设计与 演进),Hardware Architecture 分区关注承载模型的加速器(数据通路、内存层级、编程接口)。
收录条目
| 子分类 | 主题 |
|---|---|
| 端侧 NPU 推理 | 手机/端侧 NPU 的系统与内核知识:Qualcomm Hexagon(HVX/HMX)与 Rockchip RKNPU(CNA→CORE→DPU) |
| ↳ NPU 上的 Kernel Fusion | 独立任务的资源互补横向融合、多引擎调度、相关工作与实验设计 |
| ↳ RKNPU:架构与编程模型 | Rockchip RKNPU 专题:块流水线、CBUF、regcmd 任务模型、matmul-as-1×1-conv |
说明:新增页面前请先阅读仓库根目录的
AGENTS.md与 写作规范,并在SUMMARY.md中登记。
© 2026 Yang Huan · yanghuan9812@qq.com