返回报告库

AI / Technology

TAPR:让小模型先把提示改写得更适合任务

这篇论文研究的是一个很实用的问题:用户给大模型的提示词常常不够好,而很多人又不会写出能稳定发挥模型能力的提示。作者把“先改写提示,再做任务”做成了一个自动系统,目标是让同一个基础模型在问答、摘要和算术推理上表现更好。

为什么提示重写值得做

为什么要做任务感知提示改写

很多大模型对提示词很敏感。提示写得清楚,模型更容易给出正确、可执行的输出;提示写得含糊,性能就会掉。对普通用户来说,反复试提示词既费时,也需要经验。

因此,这篇论文关心的不是“怎样再造一个更大的语言模型”,而是“怎样把用户原话改成更适合当前任务的输入”。这把难点从人工提示工程,转移到自动提示改写。

传统提示工程:人写、试错、再改

只靠手工提示设计的局限

最常见的方法是人工设计提示,然后不断试错。它的缺点很直接:需要经验,而且很难扩展到大量任务或大量用户输入。

这类方法的性能上限,往往受限于写提示的人是否知道该任务需要什么格式、什么约束、什么推理步骤。

TAPR 的基本结构

TAPR 的训练闭环

TAPR 是一个较小的语言模型,输入原始用户提示,输出一个重写后的提示。这个重写后的提示再送给冻结的任务大模型去完成真正的任务。

也就是说,TAPR 学的不是答案本身,而是“怎么把问题问得更好”。

  • 输入:原始提示。
  • 中间:TAPR 改写提示。
  • 输出:任务模型基于改写后的提示生成结果。

训练信号:任务分数加上提示质量分数

奖励是怎样把“清晰提示”和“任务结果”绑在一起的

作者用强化学习训练 TAPR,并采用 GRPO。奖励不是单一来源,而是把任务表现 T 和提示质量 Q 组合起来:R = αT + βQ。

这里的任务表现来自 LLM-as-a-judge,对改写提示后的任务输出做判断;提示质量分数则鼓励改写结果更清晰、更有指导性。

  • 任务分数:看改写后是否更帮助下游任务。
  • 提示质量分数:看改写后的提示是否更清楚、更可执行。
  • 组合奖励:同时优化“能用”和“好用”。

这些证据,能把结论推到哪一步

和基线、PPO、选择机制相比,哪里更强,哪里不稳

TAPR 的核心目标是把用户原始提示自动改写成更适合具体任务的提示,以降低提示工程门槛并提升下游表现。

TAPR 使用较小的 LLM 作为提示重写器,并用 GRPO 进行强化学习训练;奖励由 LLM-as-a-judge 对改写提示和任务输出共同评估。

作者报告 TAPR 在多个任务上有一致提升,尤其在 Natural Questions 和 GSM8K 上提升更明显;例如表中 NQ 从 56.30% 提升到 59.20%,GSM8K 从 82.38% 提升到 83.60%。

摘要未给出许多结果的完整提升幅度和统计显著性。

路径一:自动改写,再交给任务模型

把 TAPR 接到产品里会改变什么

最直接的实现是把用户原始提示送进 TAPR,让它生成一个更清晰的版本,然后把这个版本交给冻结的任务模型。

论文中的结果表明,这条路径已经能带来稳定收益,尤其在 Natural Questions、HotpotQA 和 GSM8K 这类任务上。

  • 原始提示。
  • TAPR 生成改写提示。
  • 冻结的任务模型输出答案或摘要。
  • 用任务分数和提示质量分数评价。
研究附录术语、来源与待验证问题

论文证据

高可信

TAPR 的核心目标是把用户原始提示自动改写成更适合具体任务的提示,以降低提示工程门槛并提升下游表现。

arXiv metadata / 摘要:LLM 往往依赖精心设计的提示词,TAPR 通过任务感知提示重写来改善问答、摘要和算术推理表现。

高可信

TAPR 使用较小的 LLM 作为提示重写器,并用 GRPO 进行强化学习训练;奖励由 LLM-as-a-judge 对改写提示和任务输出共同评估。

Paper section 3:方法描述;以 Phi-4-mini-instruct 作为 TAPR 的基础模型,采用 GRPO 和 LLM-as-a-judge 奖励。

高可信

作者报告 TAPR 在多个任务上有一致提升,尤其在 Natural Questions 和 GSM8K 上提升更明显;例如表中 NQ 从 56.30% 提升到 59.20%,GSM8K 从 82.38% 提升到 83.60%。

Paper section 3/4:NQ、GSM8K 的结果;section 6 还给出更强模型上的更高结果。数值以提供的证据笔记为准。

高可信

在摘要任务上,TAPR 相关变体提升了输出质量,但结果更受任务和设定影响;例如 CNN/Daily Mail 上 TAPR 为 3.782、TAPR+Selection 为 3.774,基线为 3.373;SciTLDR 上 TAPR+Selection 为 3.869,基线为 3.182。

Paper section 4:CNN/Daily Mail 与 SciTLDR 的 LLM-as-a-judge 分数(满分 5 分)。

高可信

与 PPO 相比,GRPO 在作者报告的设置中更稳定,PPO 在部分配置下会停滞或模型崩溃,而 GRPO 在 NQ/GSM8K 上给出更好的结果。

Paper section 4:GRPO 与 PPO 的对比;证据笔记指出 PPO 在部分设置下停滞或崩溃,GRPO 更稳。

中可信

作者将 LLM-as-a-judge 作为奖励和评估的一部分,并声称内部测试中 Natural Questions 上 100 次判断只有 1 次错误。

Paper section 3:judge 质量说明;内部测试结果为 NQ 100 次判断中 1 次错误。

中可信

多数据集联合训练并未总体优于单数据集训练;作者笔记显示训练于 NQ 和 GSM8K 通常带来最大增益,跨数据集迁移有收益但不稳定。

Paper section 6:多数据集训练与跨数据集热图;证据笔记指出单数据集训练通常更强。

能力边界与局限

  • 摘要未给出许多结果的完整提升幅度和统计显著性。
  • 没有提供失败案例、适用边界或详细外推条件。
  • 每个训练和评估只跑一次,缺少不同随机种子的重复实验。
  • LLM-as-a-judge 可能有偏置,尤其存在第二选项偏好风险。
  • 提示选择带来额外计算成本,收益并不稳定。

和其他方案放在一起看

方案类型优势限制判断
Baseline prompt手工/基础提示作为直接对照,CNN/Daily Mail、SciTLDR、NQ、GSM8K 上的结果可见 TAPR 改写后通常更高。依赖人工提示工程,难以自动适配不同任务。TAPR 在所给证据中通常优于该基线。
PPO强化学习优化方法是与 GRPO 的直接训练对照。证据笔记显示其在部分设置下停滞或崩溃,稳定性较弱。在作者报告的设置中,GRPO 更合适。
TAPR+Selection候选提示选择机制在部分任务上可进一步提高结果,例如 SciTLDR 与 GPT-4o-mini 的一些设置。额外计算开销更高,且提升不稳定;有时不如直接 TAPR。可作为补充,但不是始终更优的默认方案。

还不能确定的地方

“首个把 LLM-as-a-judge 分数用于奖励和评估来指导自动提示重写”的主张是否成立。

这是作者主张,需结合更广泛相关工作核验。

检索同类提示重写/奖励建模文献,比较是否已有先例。

LLM-as-a-judge 在不同数据集和不同 judge 模型上的稳定性。

仅看到内部测试与少量结果,缺少完整偏差分析和跨模型复现。

在更多数据集上重复使用不同 judge,报告一致性、偏置和人工对照。

TAPR 的提升是否足以抵消训练与推理时的额外计算成本。

证据笔记未给出成本、延迟或吞吐数据。

补充端到端成本分析,包括训练时间、推理开销和性价比。

不同随机种子下结果是否稳定复现。

每个训练和评估只运行一次。

对关键基准多次重复实验,报告均值、方差和置信区间。

多数据集训练是否能在更广泛任务上推广为通用提示改写器。

当前证据显示收益有限且不稳定,外推到更多任务不明确。

在更多任务类型与更多 Task LLM 上做跨数据集泛化实验。

术语表

Task-Aware Prompt Rewriter(TAPR)
一个先改写用户提示、再把改写后的提示交给任务模型的语言模型。
Task LLM
真正执行问答、摘要或推理任务的冻结大模型。
LLM-as-a-judge
用另一个大语言模型来给输出打分或做比较判断。
GRPO
一种强化学习优化方法,论文用它来训练 TAPR。
PPO
另一种常见的强化学习方法,论文把它作为对比并报告 GRPO 更稳。
prompt quality reward
鼓励改写后的提示更清晰、更有指导性的奖励项。
baseline prompt
未经过 TAPR 改写的原始提示,作为对照组。
TAPR+Selection
先生成多个候选提示,再选择一个最优提示的版本。

参考来源

来源追踪

摘要: TAPR 旨在把用户提示改写为更适合任务的提示,并在问答、摘要、算术推理上提升性能。 arXiv PDF

第 3 节: 方法使用 Task-Aware Prompt Rewriter、GRPO、LLM-as-a-judge 奖励,以及 Phi-4-mini-instruct 作为基础模型。 arXiv PDF

第 3 节: Natural Questions 上内部判断测试为 100 次中 1 次错误。 arXiv PDF

第 4 节: CNN/Daily Mail 与 SciTLDR 的 LLM-as-a-judge 分数显示 TAPR 与 TAPR+Selection 的摘要质量高于基线的若干设置。 arXiv PDF

第 4 节: NQ 和 GSM8K 上 TAPR 的准确率高于 baseline prompt,且 GRPO 优于 PPO。 arXiv PDF

第 5 节: 作者讨论了选择机制不稳定、LLM-as-a-judge 偏置、以及结果受超参数影响等限制。 arXiv PDF

第 6 节: 跨数据集与多数据集训练结果表明,收益存在但不稳定,且更大模型/不同任务上的泛化仍未完全验证。 arXiv PDF

关于这篇论文的三个关键问题

TAPR:让小模型先把提示改写得更适合任务 解决了什么问题?

很多大模型对提示词很敏感。提示写得清楚,模型更容易给出正确、可执行的输出;提示写得含糊,性能就会掉。对普通用户来说,反复试提示词既费时,也需要经验。

TAPR:让小模型先把提示改写得更适合任务 的核心结论有哪些证据?

TAPR 的核心目标是把用户原始提示自动改写成更适合具体任务的提示,以降低提示工程门槛并提升下游表现。 arXiv metadata / 摘要:LLM 往往依赖精心设计的提示词,TAPR 通过任务感知提示重写来改善问答、摘要和算术推理表现。

阅读 TAPR:让小模型先把提示改写得更适合任务 时最需要注意什么局限?

LLM-as-a-judge 可能有偏置,尤其存在第二选项偏好风险。

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro