VRAM · 12 GiB CARD
allocated 与 reserved 均为每次请求结束后的快照,不是 CUDA high-water mark; reserved 还包含 PyTorch 分配器保留的缓存。因此这里不能当作"模型峰值显存"来引用。