AI / Technology
TAPR:让小模型先把提示改写得更适合任务
这篇论文研究的是一个很实用的问题:用户给大模型的提示词常常不够好,而很多人又不会写出能稳定发挥模型能力的提示。作者把“先改写提示,再做任务”做成了一个自动系统,目标是让同一个基础模型在问答、摘要和算术推理上表现更好。
为什么提示重写值得做
很多大模型对提示词很敏感。提示写得清楚,模型更容易给出正确、可执行的输出;提示写得含糊,性能就会掉。对普通用户来说,反复试提示词既费时,也需要经验。
因此,这篇论文关心的不是“怎样再造一个更大的语言模型”,而是“怎样把用户原话改成更适合当前任务的输入”。这把难点从人工提示工程,转移到自动提示改写。
传统提示工程:人写、试错、再改
最常见的方法是人工设计提示,然后不断试错。它的缺点很直接:需要经验,而且很难扩展到大量任务或大量用户输入。
这类方法的性能上限,往往受限于写提示的人是否知道该任务需要什么格式、什么约束、什么推理步骤。
TAPR 的基本结构
TAPR 是一个较小的语言模型,输入原始用户提示,输出一个重写后的提示。这个重写后的提示再送给冻结的任务大模型去完成真正的任务。
也就是说,TAPR 学的不是答案本身,而是“怎么把问题问得更好”。
- 输入:原始提示。
- 中间:TAPR 改写提示。
- 输出:任务模型基于改写后的提示生成结果。
训练信号:任务分数加上提示质量分数
作者用强化学习训练 TAPR,并采用 GRPO。奖励不是单一来源,而是把任务表现 T 和提示质量 Q 组合起来:R = αT + βQ。
这里的任务表现来自 LLM-as-a-judge,对改写提示后的任务输出做判断;提示质量分数则鼓励改写结果更清晰、更有指导性。
- 任务分数:看改写后是否更帮助下游任务。
- 提示质量分数:看改写后的提示是否更清楚、更可执行。
- 组合奖励:同时优化“能用”和“好用”。
这些证据,能把结论推到哪一步
TAPR 的核心目标是把用户原始提示自动改写成更适合具体任务的提示,以降低提示工程门槛并提升下游表现。
TAPR 使用较小的 LLM 作为提示重写器,并用 GRPO 进行强化学习训练;奖励由 LLM-as-a-judge 对改写提示和任务输出共同评估。
作者报告 TAPR 在多个任务上有一致提升,尤其在 Natural Questions 和 GSM8K 上提升更明显;例如表中 NQ 从 56.30% 提升到 59.20%,GSM8K 从 82.38% 提升到 83.60%。
摘要未给出许多结果的完整提升幅度和统计显著性。
路径一:自动改写,再交给任务模型
最直接的实现是把用户原始提示送进 TAPR,让它生成一个更清晰的版本,然后把这个版本交给冻结的任务模型。
论文中的结果表明,这条路径已经能带来稳定收益,尤其在 Natural Questions、HotpotQA 和 GSM8K 这类任务上。
- 原始提示。
- TAPR 生成改写提示。
- 冻结的任务模型输出答案或摘要。
- 用任务分数和提示质量分数评价。
研究附录术语、来源与待验证问题
论文证据
TAPR 的核心目标是把用户原始提示自动改写成更适合具体任务的提示,以降低提示工程门槛并提升下游表现。
arXiv metadata / 摘要:LLM 往往依赖精心设计的提示词,TAPR 通过任务感知提示重写来改善问答、摘要和算术推理表现。
TAPR 使用较小的 LLM 作为提示重写器,并用 GRPO 进行强化学习训练;奖励由 LLM-as-a-judge 对改写提示和任务输出共同评估。
Paper section 3:方法描述;以 Phi-4-mini-instruct 作为 TAPR 的基础模型,采用 GRPO 和 LLM-as-a-judge 奖励。
作者报告 TAPR 在多个任务上有一致提升,尤其在 Natural Questions 和 GSM8K 上提升更明显;例如表中 NQ 从 56.30% 提升到 59.20%,GSM8K 从 82.38% 提升到 83.60%。
Paper section 3/4:NQ、GSM8K 的结果;section 6 还给出更强模型上的更高结果。数值以提供的证据笔记为准。
在摘要任务上,TAPR 相关变体提升了输出质量,但结果更受任务和设定影响;例如 CNN/Daily Mail 上 TAPR 为 3.782、TAPR+Selection 为 3.774,基线为 3.373;SciTLDR 上 TAPR+Selection 为 3.869,基线为 3.182。
Paper section 4:CNN/Daily Mail 与 SciTLDR 的 LLM-as-a-judge 分数(满分 5 分)。
与 PPO 相比,GRPO 在作者报告的设置中更稳定,PPO 在部分配置下会停滞或模型崩溃,而 GRPO 在 NQ/GSM8K 上给出更好的结果。
Paper section 4:GRPO 与 PPO 的对比;证据笔记指出 PPO 在部分设置下停滞或崩溃,GRPO 更稳。
作者将 LLM-as-a-judge 作为奖励和评估的一部分,并声称内部测试中 Natural Questions 上 100 次判断只有 1 次错误。
Paper section 3:judge 质量说明;内部测试结果为 NQ 100 次判断中 1 次错误。
多数据集联合训练并未总体优于单数据集训练;作者笔记显示训练于 NQ 和 GSM8K 通常带来最大增益,跨数据集迁移有收益但不稳定。
Paper section 6:多数据集训练与跨数据集热图;证据笔记指出单数据集训练通常更强。
能力边界与局限
- 摘要未给出许多结果的完整提升幅度和统计显著性。
- 没有提供失败案例、适用边界或详细外推条件。
- 每个训练和评估只跑一次,缺少不同随机种子的重复实验。
- LLM-as-a-judge 可能有偏置,尤其存在第二选项偏好风险。
- 提示选择带来额外计算成本,收益并不稳定。
和其他方案放在一起看
还不能确定的地方
“首个把 LLM-as-a-judge 分数用于奖励和评估来指导自动提示重写”的主张是否成立。
这是作者主张,需结合更广泛相关工作核验。
检索同类提示重写/奖励建模文献,比较是否已有先例。
LLM-as-a-judge 在不同数据集和不同 judge 模型上的稳定性。
仅看到内部测试与少量结果,缺少完整偏差分析和跨模型复现。
在更多数据集上重复使用不同 judge,报告一致性、偏置和人工对照。
TAPR 的提升是否足以抵消训练与推理时的额外计算成本。
证据笔记未给出成本、延迟或吞吐数据。
补充端到端成本分析,包括训练时间、推理开销和性价比。
不同随机种子下结果是否稳定复现。
每个训练和评估只运行一次。
对关键基准多次重复实验,报告均值、方差和置信区间。
多数据集训练是否能在更广泛任务上推广为通用提示改写器。
当前证据显示收益有限且不稳定,外推到更多任务不明确。
在更多任务类型与更多 Task LLM 上做跨数据集泛化实验。
术语表
- Task-Aware Prompt Rewriter(TAPR)
- 一个先改写用户提示、再把改写后的提示交给任务模型的语言模型。
- Task LLM
- 真正执行问答、摘要或推理任务的冻结大模型。
- LLM-as-a-judge
- 用另一个大语言模型来给输出打分或做比较判断。
- GRPO
- 一种强化学习优化方法,论文用它来训练 TAPR。
- PPO
- 另一种常见的强化学习方法,论文把它作为对比并报告 GRPO 更稳。
- prompt quality reward
- 鼓励改写后的提示更清晰、更有指导性的奖励项。
- baseline prompt
- 未经过 TAPR 改写的原始提示,作为对照组。
- TAPR+Selection
- 先生成多个候选提示,再选择一个最优提示的版本。
参考来源
来源追踪
摘要: TAPR 旨在把用户提示改写为更适合任务的提示,并在问答、摘要、算术推理上提升性能。 arXiv PDF
第 3 节: 方法使用 Task-Aware Prompt Rewriter、GRPO、LLM-as-a-judge 奖励,以及 Phi-4-mini-instruct 作为基础模型。 arXiv PDF
第 3 节: Natural Questions 上内部判断测试为 100 次中 1 次错误。 arXiv PDF
第 4 节: CNN/Daily Mail 与 SciTLDR 的 LLM-as-a-judge 分数显示 TAPR 与 TAPR+Selection 的摘要质量高于基线的若干设置。 arXiv PDF
第 4 节: NQ 和 GSM8K 上 TAPR 的准确率高于 baseline prompt,且 GRPO 优于 PPO。 arXiv PDF
第 5 节: 作者讨论了选择机制不稳定、LLM-as-a-judge 偏置、以及结果受超参数影响等限制。 arXiv PDF
第 6 节: 跨数据集与多数据集训练结果表明,收益存在但不稳定,且更大模型/不同任务上的泛化仍未完全验证。 arXiv PDF
关于这篇论文的三个关键问题
TAPR:让小模型先把提示改写得更适合任务 解决了什么问题?
很多大模型对提示词很敏感。提示写得清楚,模型更容易给出正确、可执行的输出;提示写得含糊,性能就会掉。对普通用户来说,反复试提示词既费时,也需要经验。
TAPR:让小模型先把提示改写得更适合任务 的核心结论有哪些证据?
TAPR 的核心目标是把用户原始提示自动改写成更适合具体任务的提示,以降低提示工程门槛并提升下游表现。 arXiv metadata / 摘要:LLM 往往依赖精心设计的提示词,TAPR 通过任务感知提示重写来改善问答、摘要和算术推理表现。
阅读 TAPR:让小模型先把提示改写得更适合任务 时最需要注意什么局限?
LLM-as-a-judge 可能有偏置,尤其存在第二选项偏好风险。