Qwen2.5VL 是可以直接在V100运行的,量化后,部署时发现几种scheme都超过了V100的计算能力。比较好奇是哪里引入的计算导致V100的算力无法推理
Qwen2.5VL 是可以直接在V100运行的,量化后,部署时发现几种scheme都超过了V100的计算能力。比较好奇是哪里引入的计算导致V100的算力无法推理