NEURONIX // CODE LAB 交互式算力实验台
大模型显存墙与内核算子实时推演台
调节并发批次(Batch Size)与上下文长度(Context Length),实时观察 MLA 架构相比传统 MHA/GQA 的显存压缩比与吞吐量曲线。
算子仿真参数调节 (Hyperparameters)
TRITON 兼容
公式假设: MHA / GQA-8 采用 "Dense-70B-class" 参考架构(80 层,head_dim=128,MHA 64 个 KV 头 / GQA 8 个 KV 头,bf16 2 字节);MLA 采用 DeepSeek-V3-class 参考架构(61 层,kv_lora_rank=512 + qk_rope_dim=64 的联合潜在向量,bf16 2 字节)。显存 = 层数 × 每层每 token 字节数 × batch × 实际 token 数,非装饰性缩放。
KV Cache 显存占用实时计算对比 (GB):
标准多头注意力 (MHA, Dense-70B-class)-- GB
分组查询注意力 (GQA-8, Dense-70B-class)-- GB
DeepSeek MLA (低秩联合潜在压缩)-- GB
neuronix_profiler_terminal.sh
流式输出
Target Device: NVIDIA H100 SXM5 (80GB HBM3e)
CUDA Driver: 12.4 | Triton Version: 3.0.0
点击左侧「启动 GPU 算子仿真」按钮,即可观察底层显存调度与算子流水线日志。