an hour ago agent和大模型的个人实测评分(个人向)🌐 链接: https://linux.do/t/topic/2892706🔍 关键词: #codex🏷️ 分组: LinuxDo论坛🕒 时间: 2026-09-12 11:51:00 LINUX DO agent和大模型的个人实测评分(个人向) 趁着手里正在搞个人小项目,就用三个flash模型和四大agent平台分别测试了一下,最后用kimi统一评分,评分标准包括六大维度:准确性与证据质量/分析深度与洞察/覆盖广度/建议可操作性/结构与表达/内部一致性与结论可靠性。最后得分分差<=2可以视为同一水平。 结果如图: 大模型对比: ds4f(76.3) 存在系统性短板,在 4 个系列中均为最低分(尤其是 ZCode-ds4f 仅得 60 分)。 glm5.3f(85.5) 与 qwen3.8f(85.3) 均值基本打平,但 glm5.3f…