2 hours ago 有人在说开源模型降智可能部署了量化版本,可是哪来的量化版本🌐 链接: https://linux.do/t/topic/2721611🔍 关键词: #api #gpt🏷️ 分组: LinuxDo论坛🕒 时间: 2026-08-08 00:29:23 LINUX DO 有人在说开源模型降智可能部署了量化版本,可是哪来的量化版本 现在能卖得出去的模型,只有glm-5.2有bf16 vs fp8 vs nvfp4三个版本,官方api在openrouter上显示是fp8,别的地方最多降到fp4,应该没人会用bf16的。 kimi-k3和deepseek-v4都基本上是fp4的模型权重了(deepseek的非moe部分是fp8),发行就是最低精度的QAT了,没有地方可以降了啊? 还有一种情况是把fp4 requant成gptq/awq int4,但是首先在B300上fp4本来就是最快的格式;在Hopper及以前的显卡上fp4和int4都不是native…