论文 | LARGE LANGUAGE MODELS ARE HUMAN-LEVEL PROMPT ENGINEERS

作者: Yongchao Zhou, Andrei Ioan Muresanu, Ziwen Han, Keiran Paster, Silviu Pitis, Harris Chan, Jimmy Ba

发表时间: 2023 年 ICLR 会议论文

主要内容

本文提出了一种名为 APE (Automatic Prompt Engineer) 的方法,旨在自动生成和选择用于指导大型语言模型 (LLM) 的指令。文章的主要贡献可以概括为以下几点:

  • 自然语言程序合成: 将指令生成问题与程序合成问题进行类比,将指令视为"程序",并使用 LLM 进行优化,从而找到最优的指令。
  • 人类级别的零样本学习性能: 在多个任务中验证了 APE 的有效性,包括 24 个指令诱导任务和 21 个 BIG-Bench 任务。在所有这些任务中,APE 生成的指令在零样本学习方面达到了与人类标注者相当甚至更好的性能。
  • 性能分析: 论文进行了广泛的定性和定量分析,探索了 APE 的各个方面,包括提案分布、评分函数和迭代搜索。结果表明,使用更大的 LLM 和人类对齐的模型可以生成更好的提案分布,并且迭代蒙特卡洛搜索可以略微提高指令质量。
  • 应用案例: 论文展示了 APE 在几个任务中的应用,例如指令诱导、零样本思维链和真实性。APE 生成的指令可以显著提高零样本和少样本学习性能,找到比"让我们一步一步思考"更好的思维链提示,以及指导 LLM 生成更真实和更信息的答案。
  • 成本分析: 论文进行了成本分析,结果表明,尽管大型模型的每 tokens 成本更高,但它们在生成最佳指令方面更具成本效益。这主要是因为大型模型可以生成更简洁的指令,从而减少评分所需的计算资源。

结论

APE 是一种很有前景的方法,可以自动生成和选择用于指导 LLM 的指令。它具有效率高、性能好、可扩展性强等优点,为控制和管理生成式人工智能提供了新的思路。

个人思考

这篇论文展示了一个有趣的想法,即利用 LLM 自动生成和选择指令,从而提高模型在下游任务中的性能。这种方法可以显著减少人工编写和验证有效指令所需的时间,并使 LLM 更易于使用。未来,我们可以进一步探索 APE 的应用场景,例如将其用于其他具有自然语言界面的模型,并开发用于优化提示长度的方法,以进一步降低成本。

相关推荐
摇滚侠2 小时前
AI 编程工具 《TRAE 官方手册》阅读笔记 AI 编程核心 上
人工智能·笔记
一个王同学3 小时前
从零到一 | CV转多模态大模型 | week19 | 基于 FastAPI 和 vLLM 的多模态大模型部署
人工智能·深度学习·计算机视觉·fastapi·改行学it·vllm
m沐沐4 小时前
【深度学习】YOLOv2目标检测算法——改进点、网络结构与聚类先验框解析
人工智能·pytorch·深度学习·算法·yolo·目标检测·transformer
企业老板ai培训4 小时前
破解中小企业AI变现难:2026年企业AI培训与陪跑行业趋势深度报告,为何从‘陪跑’到‘变现’才是关键?
大数据·人工智能
神奇霸王龙5 小时前
国产音乐视频 Prompt 三段式屠夫榜:5 个国产视频模型实测对比
人工智能·ai·prompt·音视频·agent·ai编程·agi
OpenCSG5 小时前
Hugging Face遭遇AI Agent攻击:AI资产管理正在进入新阶段
人工智能·大模型
神奇霸王龙5 小时前
AI视频Prompt结构化实战指南:可灵/万相/豆包
人工智能·ai·prompt·aigc·音视频·ai编程
aax12134535 小时前
VOC 集群治理工程实操|美丽蓝天绿岛项目 RTO 工艺选型、管控方案与申报要
大数据·数据库·人工智能
Scott9999HH5 小时前
【工控选型破局】拒绝盲目溢价与低质陷阱:基于 Modbus-RTU 状态诊断与自适应滑动中值滤波的 C++ 实战,兼论“性价比高又好用的仪器仪表厂家”选型之道
人工智能
To_OC5 小时前
调了一上午 DeepSeek 参数,我终于摸透了 temperature 和 Top K 的真实作用
人工智能·llm·deepseek