代价账本
记忆带来的延迟、解码速度、前缀长度与显存开销,以及显存快照的口径说明。
26.35ms 读取路径额外耗时(批次 B;批次 A 为 61.10 ms)
VRAM · 12 GiB CARD
allocated 与 reserved 均为每次请求结束后的快照,不是 CUDA high-water mark; reserved 还包含 PyTorch 分配器保留的缓存。因此这里不能当作"模型峰值显存"来引用。
记忆带来的延迟、解码速度、前缀长度与显存开销,以及显存快照的口径说明。
26.35ms 读取路径额外耗时(批次 B;批次 A 为 61.10 ms)
VRAM · 12 GiB CARD
allocated 与 reserved 均为每次请求结束后的快照,不是 CUDA high-water mark; reserved 还包含 PyTorch 分配器保留的缓存。因此这里不能当作"模型峰值显存"来引用。