【文献阅读 ICLR 2026】LLMs get lost in multi-turn conversationLLM是对话接口,不仅能帮助用户明确手头的任务,还能通过多轮对话交互按用户需求定义、探索、改进。这篇论文进行了大规模的模拟实验对比LLM在单轮和多轮对话中的性能。实验证实无论开源闭源LLM的多轮对话明显比单轮对话性能更低,在6项生成任务中平均下降39%。通过对20w+的模拟对话进行分析,性能降低可拆解成2个部分:能力的小幅衰减、不可靠性的显著上升。研究发现,LLM常在对话初期做出预设,并过早尝试生成最终答案,且会过度依赖这些答案。简单来说,LLM一旦在对话中走错方向,就会陷入偏差,无法自我修正。