跳转到主内容
NEURONIX3D LIQUID v3.5 超构 IT 前沿技术矩阵
EN 中文
14ms
NEURONIX // CODE LAB 交互式算力实验台

大模型显存墙与内核算子实时推演台

调节并发批次(Batch Size)与上下文长度(Context Length),实时观察 MLA 架构相比传统 MHA/GQA 的显存压缩比与吞吐量曲线。

算子仿真参数调节 (Hyperparameters) TRITON 兼容
8 并发 Streams
1163264
64K Tokens (65,536 词元)
8K32K64K128K

公式假设: MHA / GQA-8 采用 "Dense-70B-class" 参考架构(80 层,head_dim=128,MHA 64 个 KV 头 / GQA 8 个 KV 头,bf16 2 字节);MLA 采用 DeepSeek-V3-class 参考架构(61 层,kv_lora_rank=512 + qk_rope_dim=64 的联合潜在向量,bf16 2 字节)。显存 = 层数 × 每层每 token 字节数 × batch × 实际 token 数,非装饰性缩放。

KV Cache 显存占用实时计算对比 (GB):

标准多头注意力 (MHA, Dense-70B-class)-- GB
分组查询注意力 (GQA-8, Dense-70B-class)-- GB
DeepSeek MLA (低秩联合潜在压缩)-- GB

neuronix_profiler_terminal.sh 流式输出
Target Device: NVIDIA H100 SXM5 (80GB HBM3e)
CUDA Driver: 12.4 | Triton Version: 3.0.0

点击左侧「启动 GPU 算子仿真」按钮,即可观察底层显存调度与算子流水线日志。