485b 510GB 文件,感觉量化了也很难在 2 台 dgx spark 上运行。
好事是每 token 的 kv 缓存只有原来的 1/5 ,稍微量化下,留个 15g kv ,4 台 spark 跑起来应该很舒服