返回 AI 问题库

PaperBridge 长尾问题

怎么判断一篇 AI 论文的方法推理成本有多高?

先数一次用户请求会触发多少次模型、检索器和外部工具调用,再记录每次调用的输入输出长度、硬件、批量和精度。论文只报告 FLOPs、参数量或单次延迟时,还不足以估算产品成本;你还需要吞吐、并发、缓存命中和失败重试。

PaperBridge Editorial·

画出一次请求的完整调用链

Agent、RAG 和多阶段系统往往多次调用模型。列出查询改写、检索、重排、生成、验证和重试,标记哪些步骤并行、哪些必须串行。

平均调用次数会掩盖失败路径。查看长尾请求是否需要更多检索轮次、工具调用或人工接管。

让延迟和吞吐处在同一条件下

记录模型版本、硬件、数值精度、batch size、上下文长度和输出长度。不同配置下的毫秒数不能直接比较。

在线产品通常关注首 token 延迟、每 token 速度和并发下的尾延迟;离线任务更看总吞吐。选择与自己的场景相同的指标。

把系统成本换成每个有效结果的成本

把 GPU 时间、API 费用、检索服务、存储和人工审核加到同一请求上,再除以成功完成的任务数量。高失败率会显著提高有效成本。

做一个小规模真实输入测试,比从论文中的单一数字外推更稳。固定质量门槛后再比较成本,避免用更差的输出换来便宜数字。

推理成本的 6 个变量

  1. 一次请求调用模型和工具多少次?
  2. 输入与输出各有多少 token 或样本?
  3. 使用什么硬件、精度和 batch size?
  4. 首 token、总延迟和吞吐是多少?
  5. 缓存、并发和重试如何影响长尾?
  6. 每个通过质量门槛的结果成本多少?

原论文、研究与官方文档

以下来源用于核对事实;流程与比较建议是 PaperBridge 对研究、官方文档和工程实践的综合。

MLPerf Inference Benchmarks展示推理比较需要明确硬件、场景、延迟约束、吞吐和精度条件。NeurIPS Paper Checklist要求作者说明局限、假设、实验设置、计算资源、数据与代码信息。