认证评测员
Kimi 认证测评:长文本真的稳,但工具调用偏保守
用长合同与长论文做压力测试,评估 Kimi 的长上下文与工具能力。
压力测试设计
用一份 18 万字的技术合同与一篇 6 万字的论文做长上下文测试,检验信息抽取与跨段落推理。
结论
- 长文本定位与总结几乎没有丢信息,这是 Kimi 最扎实的能力。
- 工具调用与联网相较同类偏保守,多步任务的自动完成度一般。
建议
把 Kimi 当作「长文本阅读器 + 可靠摘要」来用最合适;需要多步自动化的场景建议搭配工作流产品。
本测评为认证评测员独立产出,不代表平台立场。