论文标题 : ReToolSQL: Agentic Reinforcement Learning for Robust Text-to-SQL
论文地址 : https://arxiv.org/abs/2608.27796
作者单位 : JPMorgan Chase
发表时间: 2026年8月28日
背景知识
在深入解读 ReToolSQL 之前,有必要先厘清几个核心概念。
什么是 Text-to-SQL? 指将自然语言问题自动转换为可执行的结构化查询语言(SQL)的任务。它是自然语言访问数据库的核心接口,广泛应用于数据分析、智能客服、企业知识库等场景。与早期基于语法规则的系统不同,现代 Text-to-SQL 主要依赖大语言模型(LLM)理解问题语义、数据库 schema 和领域术语,生成符合语法的 SQL 查询。
什么是 BIRD-SQL? 由 Li 等人于 2023 年提出的跨域大规模数据库基准测试,包含 12,751 对问题-SQL 数据,覆盖 95 个真实、嘈杂、大规模数据库,跨越 37 个以上领域。BIRD 通过**执行准确率(Execution Accuracy, EX)**评估系统:将预测 SQL 与标准 SQL 分别在数据库上执行,比较返回结果集合是否完全一致(无序集合比较)。这要求系统不仅生成语法正确的 SQL,还必须正确处理 schema 链接、值接地、数值/时序推理和复杂 join 路径。
什么是 Reinforcement Learning from Execution Feedback (RLVR)? 一种利用可验证的执行信号作为奖励来微调语言模型的强化学习范式。与传统依赖人工标注或模型打分的奖励不同,RLVR 使用二进制或结构化执行结果(如 SQL 执行是否返回正确结果集)作为直接优化信号。GRPO(Group Relative Policy Optimization)是其中的代表性算法,通过组内采样结果的奖励统计估计优势函数,无需额外的价值网络。
什么是 Agentic Tool Use(智能体工具使用)? 指语言模型在生成过程中主动调用外部工具(如代码解释器、数据库执行器、搜索引擎),并根据工具返回的观察结果进行多轮推理和修正。与单次生成不同,agentic workflow 允许模型在"提出-验证-修复"的循环中迭代改进输出,将外部执行反馈内化为推理过程的一部分。
什么是 M-Schema? 一种半结构化的、值增强的数据库 schema 序列化格式。相比原始 DDL 或扁平列名列表,M-Schema 为每列注入类型、自然语言含义、主键/空值标志、统计摘要(非空数、去重数、最小/平均/最大值)、高频分类值 Top-k 和代表性示例值,以及外键关系。这种表示使 schema 链接决策基于数据证据而非列名相似性。
一、背景:为什么需要 ReToolSQL?
1.1 Text-to-SQL 的现实部署困境
尽管指令微调的大语言模型在标准 Text-to-SQL 任务上表现强劲,但在真实企业环境中部署仍面临三重挑战:
- Schema 规模大且结构复杂:真实数据库通常包含数十甚至上百张表,列名具有领域特异性缩写,外键关系错综复杂。模型必须在庞大的候选空间中精确识别相关表和列,任何链接错误都会导致后续 SQL 整体失效。
- 值空间嘈杂且动态:数据库中存储的值往往包含拼写变体、单位不一致、格式差异(如日期格式)和缺失值。模型生成的 WHERE 子句若使用与存储值不完全匹配的字面量,将返回空结果或错误集合。
- 执行正确性 vs 表面形式匹配:BIRD 的 EX 指标要求结果集合完全等价,而非 SQL 字符串或 AST 的相似。一个错误的 join 条件、聚合函数或类型转换就能导致完全错误的结果,而模型在单轮生成中无法感知这些执行层面的失败。
1.2 现有方法的结构性盲区
- 单轮生成的不可恢复性:大多数现有方法将 SQL 生成视为单轮任务------模型提出一个查询,接收终端奖励,训练过程不包含迭代修正。一旦生成错误的 join 路径或字面量,系统没有机会在执行反馈的基础上自我诊断和修复。
- Pipeline 系统的复杂性与成本:当前 BIRD 榜单领先系统(如 CHESS、CHASE-SQL、XiYan-SQL、Agentar-Scale-SQL)普遍依赖多组件 pipeline:多生成器采样、学习式候选选择器、多智能体编排、分治提示等。虽然这些系统在测试时通过扩展计算提升准确率,但也显著增加了服务复杂度、延迟和运维成本,难以在资源受限环境中部署。
- RL 训练的单轮局限:近期的 RLVR 工作(如 Arctic-Text2SQL-R1)证明执行反馈能显著提升小模型性能,但它们仍局限于单轮 SQL 生成,未将执行器和数据库工具纳入训练环境,模型学不会"何时验证、检索什么证据、如何修复"。
ReToolSQL 的核心洞见是:将 SQL 生成建模为工具增强的序列决策过程,通过多轮 agentic 强化学习让单一稠密模型内建"提出-验证-修复"能力,从而在保持简单服务架构的同时达到 pipeline 级精度。这要求训练框架具备三个能力:将数据库工具嵌入 RL 环境、设计执行锚定的复合奖励、以及通过两阶段训练解决硬样本覆盖与单轮精度的互补优化。
二、核心创新:Agentic 强化学习与两阶段训练框架
ReToolSQL 的技术精髓可以概括为:以拒绝采样的特权教师轨迹进行监督暖启动扩展硬样本覆盖,以多轮工具交互的 GRPO 强化学习将覆盖转化为单轮精度,通过复合奖励和动态采样稳定训练,最终在单一 31B 稠密模型中实现验证优先的 SQL 生成策略。
2.1 两阶段 SFT→RFT Pipeline
ReToolSQL 提出一个关键的两阶段训练流程,两阶段作用于互补的优化维度:
阶段一:监督暖启动(SFT) 。针对基础模型完全无法解决的"硬样本带"(pass@16 全错的问题),提供特权教师轨迹:将标准答案 SQL 作为上下文引导,让模型生成逐步推理链并验证执行正确性。对于基础模型已能解决的简单/中等样本,则收集模型自身的正确轨迹(无特权信息)。最终合并为 SFT 数据集,训练模型扩展对困难问题的覆盖能力。
阶段二:Agentic 强化微调(RFT)。从 SFT 检查点初始化,在 GRPO 框架下训练模型与数据库工具的多轮交互。SFT 提升 pass@k 覆盖率(硬样本从 0 到至少 1 个正确样本),RFT 则将这些潜在正确能力转化为贪婪解码下的高单轮准确率。
实验表明(表 2):SFT 将 pass@16 从 76.9% 提升至 81.29%,但 temp-0 仅提升 1.50%;RFT 从基础模型将 temp-0 提升 2.47%,但 pass@16 几乎不变;SFT→RFT 组合达到 74.32% temp-0 和 74.77% SC,同时保持 pass@16 在 81.94%,实现了覆盖与精度的双重提升。
2.2 验证优先的数据库工具套件
ReToolSQL 将三个只读数据库工具直接嵌入 RL 环境,而非仅作为后处理过滤:
- sqlite_query:沙盒化 SQL 执行器,限制为 SELECT/WITH 语句,返回结果集或结构化错误信息。使模型能在草稿阶段执行候选 SQL,根据空结果或错误信息触发修复。
- sqlite_peek:列分析器,返回声明类型、空值/去重统计、值范围、字符类摘要和代表性样本。用于解决类型歧义(如百分比 vs 小数)、日期格式、除零保护和 join 键类型不匹配。
- bm25_search_sqlite:混合词法搜索工具,结合 BM25 排序和正则回退,用于将问题中的实体映射到数据库存储的精确拼写,修复 WHERE 子句的字面量不匹配。
工具调用遵循严格的轮次协议:每轮包含有限的 <scratch_pad>(意图、预期输出列、候选 SQL),然后是一个单一工具调用或 <final_answer>。在最终答案前,模型必须显式标注 <relevant_tables> 和 <relevant_columns>,这些标注直接作为 schema 链接奖励的信号来源。
2.3 复合奖励设计(Composite Reward)
仅使用二进制执行匹配奖励会导致稀疏且经常退化的训练组(组内所有样本奖励相同,梯度为零)。ReToolSQL 将奖励分解为七个可验证组件的加权和:
| 组件 | 类型 | 信号 | 权重 | 加权范围 |
|---|---|---|---|---|
| R_format | 二进制 | 输出模板合规 | 0.2 | {0, 0.2} |
| R_syntax | 二进制 | SQL 可解析执行 | 0.5 | {0, 0.5} |
| R_exec | 二进制 | BIRD EX 执行匹配 | 2.0 | {0, 2.0} |
| R_tables | 二进制 | 预测表集合包含标准表集合 | 0.5 | {0, 0.5} |
| R_columns | 连续 | 预测列与标准列的 Jaccard | 0.5 | 0, 0.5 |
| R_nonempty | 二进制 | 执行返回非空结果 | 0.1 | {0, 0.1} |
| R_len | 连续 | DAPO 软超长惩罚 | 0.1 | -0.1, 0 |
最大可获奖励为 3.8,执行项占主导(2.0)。当执行奖励在组内坍缩为全 0 或全 1 时,辅助项(尤其是 schema 链接的连续/二进制信号)保持组内优势非平坦,确保梯度流动。权重为启发式设置,性能对精确辅助值不敏感。
2.4 GRPO + DAPO 动态采样与工具掩码
GRPO 与不对称裁剪:采用 DAPO 变体的 GRPO 损失,使用不对称裁剪界 (ε_lo=0.20, ε_hi=0.28),允许策略对稀有高奖励轨迹增加概率的幅度大于对失败轨迹的惩罚幅度,保留向上探索能力。配合退火 KL 惩罚调度(β: 0.005→0.001→0),早期保留熵与探索能力,后期由奖励塑造和不对称裁剪单独正则化。
动态采样(Dynamic Sampling):针对组内奖励方差为零(所有 16 个样本执行结果相同)导致的零梯度问题,采用 DAPO 的过采样-替换策略。每步尝试 B×K 个候选提示,仅保留奖励标准差 ≥ 1e-6 的异质组,计算奖励后再进行昂贵的对数概率前向传播,避免在无效组上浪费算力。
工具观察掩码 :多轮轨迹中环境注入的工具返回结果(行数据、列分析、BM25 命中)包含原始数据库内容。若对完整补全计算损失,会奖励模型记忆特定数据库内容并污染策略梯度。ReToolSQL 维护 token 级工具掩码,仅对模型自身生成的 token(推理、工具调用、SQL)计算损失,工具观察 token 保留在注意力上下文中但不出现在目标中。这防止训练/测试 schema 泄漏,并确保模型学习"何时检索"而非"记忆内容"。
2.5 执行共识的推理时扩展(Execution Consensus)
测试时采用无需训练的执行共识机制实现推理时扩展:对同一问题采样 16 条轨迹(temperature=1.2),提取最终 SQL,在沙盒中执行并聚类结果集合。返回最大结果集合的 representative SQL,平局时按最早样本索引和更短 SQL 打破。
由于语义不同的幻觉倾向于分散为多个小簇,而正确表述收敛于共享输出,多数投票机制天然偏向正确性。在 31B 模型上,SC@16 将 RFT 从 73.66% 提升至 74.12%,SFT→RFT 从 74.32% 提升至 74.77%。
三、实验验证:BIRD-SQL 开发集的系统评估
3.1 主结果与训练阶段消融
在 BIRD-SQL 开发集(1,534 题,11 个数据库)上的训练阶段消融(表 2)显示:
| 配置 | SC | 相对基础模型 Δ | EX (%) | pass@16 (%) |
|---|---|---|---|---|
| Gemma 4 31B Instruct (基础) | ✗ | --- | 71.19 | 76.90 |
| + SFT | ✗ | +1.50 | 72.69 | 81.29 |
| + RFT (从基础) | ✗ | +2.47 | 73.66 | 77.20 |
| + RFT + SC | ✓ | +2.93 | 74.12 | --- |
| + SFT→RFT | ✗ | +3.13 | 74.32 | 81.94 |
| + SFT→RFT + SC | ✓ | +3.58 | 74.77 | --- |
关键发现:
- SFT 扩展覆盖:pass@16 从 76.9% 跃升至 81.29%,证明特权教师轨迹成功注入了硬样本的解决方案。
- RFT 提升精度:temp-0 提升 2.47%,但 pass@16 几乎不变,说明 RL 将模型已能偶尔找到的正确程序打磨为高频行为。
- 组合最优 :SFT→RFT 在保持高覆盖(81.94%)的同时达到最高单轮精度(74.32%),SC 进一步提升至 74.77%,在 2026 年 8 月 26 日的 BIRD 单模型开发集榜单上排名第一。
3.2 组件隔离:RL 训练 × 工具访问
2×2 因子分解(表 4)揭示了显著的交互效应:
| 训练 \ 推理 | 无工具 | +工具 | 工具增益 |
|---|---|---|---|
| 无 RL (基础模型) | 69.69% | 71.71% | +2.02 |
| Agentic RL | +0.45 | 73.66% | --- |
| RL 增益 | --- | +1.95 | --- |
| + SC@16 | --- | 74.12% | +4.43 vs 基础 |
工具访问单独带来 +2.02%,RL 无工具仅 +0.45%,但两者结合产生 +3.97%,超出可加性 1.50% 。这证实 agentic RL 并非泛泛地提升模型能力,而是专门教会模型如何利用执行反馈和工具证据进行迭代修正。
3.3 难度分层分析
按 BIRD 难度标注的分层结果(表 6)显示:
| 配置 | 简单 (860) | 中等 (443) | 困难 (231) |
|---|---|---|---|
| 基础模型 (无工具) | 69.30% | 67.72% | 74.89% |
| ReToolSQL (无工具) | 70.23% | 68.85% | 72.29% |
| ReToolSQL (工具) | 73.60% | 72.91% | 75.32% |
| ReToolSQL + SC@16 | 73.95% | 73.81% | 75.32% |
RL 训练对中等难度问题提升最显著(+5.19% vs 基础),表明 GRPO 教会模型区分"何时需要工具验证"与"何时直接推理足够"。困难问题保持最高绝对精度(75.32%),验证优先策略对复杂多步查询价值最大。
3.4 模型规模消融
在 Gemma 4E4B(有效 4B 参数)上复制完整训练(表 5):
| 模型 | 基础 EX | RL EX | Δ RL | SC EX |
|---|---|---|---|---|
| Gemma 4E4B | 65.12% | 68.45% | +3.33% | 70.73% |
| Gemma 4 (31B) | 71.71% | 73.66% | +1.95% | 74.12% |
小模型的 RL 边际增益更大(3.33% vs 1.95%),因其基础策略较弱、提升空间更大。E4B 的 16 样本多样性更高(6.31 个唯一 SQL vs 31B 的 3.37),SC 收益也更显著(+2.28% vs +0.46%)。尽管绝对精度仍低于大模型,结果证明方法具有规模无关性。
3.5 熵保留与 Beta 调度
在 Gemma 4E4B 上对比两种 KL 正则化配置(图 4 vs 图 5):
- 无 KL 惩罚 (β=0):策略熵在约 40 步内从 0.40 急剧崩塌至 0.10,此后贪婪和 SC 精度停滞,pass@k 余量反而在最早检查点最大。
- 退火 Beta 调度 (0.005→0.001→0):早期 KL 惩罚减缓熵衰减(0.40→0.20),使策略保持探索能力,精度和 SC 在 100 步后仍持续提升。
31B 模型初始化熵已较低(0.17),进一步降至 0.02--0.08,这解释了为何 31B 的 RL 绝对增益小于 E4B。熵保留是 RL 在强基础模型上持续改进的关键决定因素。
3.6 训练动态与 Pass@k 分析
31B 模型的动态采样填充率仅 8--67%(每步尝试 192 组,仅 1--15 组有奖励方差),反映其高样本一致性:能解决时 16 样本常全对,不能解决时常全错。E4B 异质性更高,每步获得更多有效训练信号。
Pass@16 上界约为 77.2%,而 SC@16 为 74.12%,存在 3.08% 的未实现潜力------即 16 样本中至少有一个正确,但多数投票选错了簇。这表明改进的选择机制(如学习式验证器或奖励模型重排序)可在不增加训练的情况下进一步解锁性能。
四、学术洞见:ReToolSQL 揭示了哪些深层规律?
洞见一:SFT 与 RL 作用于互补的优化轴
ReToolSQL 的两阶段结果揭示了一个清晰的职责分离:监督学习扩展能力边界(覆盖),强化学习优化行为分布(精度)。SFT 通过特权教师轨迹将硬样本从"完全不可解"推入"至少偶尔可解",提升 pass@k;RFT 则通过执行反馈将这些偶尔正确的轨迹转化为贪婪解码下的高概率行为。单独使用任一阶段都无法同时达到高覆盖和高单轮精度,这一互补性为复杂推理任务的训练设计提供了通用范式。
洞见二:工具访问与 RL 训练存在超加性交互效应
组件隔离实验表明,工具访问和 RL 训练的组合增益(+3.97%)显著大于各自增益之和(2.02% + 0.45% = 2.47%),超加部分达 1.50%。这说明:仅提供工具提示不足以释放工具潜力,必须通过 RL 在完整 propose-verify-repair 轨迹上优化,模型才能学会有效的工具调用策略。工具 proficiency 是梯度更新的产物,而非提示工程或预训练知识的简单延伸。
洞见三:熵保留是大模型 RL 持续改进的核心瓶颈
在 31B 强基础模型上,策略初始化熵已较低(0.17),训练后进一步降至 0.02--0.08,导致 RL 增益空间受限(仅 +1.95%)。退化的 Beta 调度通过早期 KL 约束将 E4B 的熵崩塌从 40 步延缓至更长周期,带来 2.09% 的贪婪精度提升。这提示:对于已经高度优化的基础模型,RL 训练的首要挑战不是奖励设计,而是防止策略过早坍缩到低熵局部最优。不对称裁剪和退火 KL 是实用的熵管理手段。
洞见四:验证优先的 Agentic Workflow 可内置于单一稠密模型
此前 BIRD 领先系统普遍依赖多组件 pipeline(多生成器、选择器、编排器)。ReToolSQL 证明:单一 31B 稠密模型通过 agentic RL 训练,可同时承担生成器、验证器和修复器的角色,在测试时仅需要简单的执行共识即可达到 pipeline 级精度(74.77%)。这降低了服务架构复杂度,使系统可在单 GPU 标准服务框架上部署,对企业级实际落地具有重要工程价值。
洞见五:复合奖励是稀疏执行信号下的必要梯度保障
当组内所有样本的执行结果相同时(全对或全错),纯二进制执行奖励导致方差为零、优势为零、梯度为零。ReToolSQL 的 schema 链接项(R_tables, R_columns)和格式/语法项在 EX 信号退化时提供密集的替代梯度。这揭示了一个鲁棒 RL 训练原则:在主要奖励稀疏或二元时,必须设计可验证的辅助奖励维度来维持组内优势多样性,否则动态采样将过滤掉过多训练组,导致有效数据极度稀缺。
五、局限性与未来方向
论文坦诚讨论了以下局限:
- 基准范围:当前评估集中于 BIRD-SQL 开发集,未在 BIRD 测试集或其他 Text-to-SQL 基准(如 Spider、Spider-Realistic、KaggleDBQA)上验证泛化性。
- 模型架构:实验集中于稠密 decoder-only 模型(Gemma 4),未探索混合专家(MoE)架构或编码器-解码器模型的适用性。MoE 的路由机制可能与工具使用策略产生复杂交互。
- 选择机制的未实现潜力:Pass@16 上界(77.2%)与 SC@16(74.12%)之间存在 3.08% 差距,表明简单的执行共识并非最优选择器。学习式验证器或奖励模型重排序可能进一步释放性能,但会增加系统复杂度。
- 固定工具预算:每轮交互设有最大 8 轮的工具预算,对于极复杂查询可能不足,而对于简单查询可能浪费推理时间。动态预算分配机制尚未探索。
- 领域特异性:BIRD 的数据库虽跨域,但均为关系型 SQLite 数据库。对 NoSQL、图数据库或具有复杂存储过程的企业数据仓库的适应性未验证。
- 安全与副作用:工具虽限制为只读,但生产环境中 SQL 执行仍可能涉及敏感数据访问。更细粒度的权限控制和审计机制需要额外工程。
未来方向包括:
- 学习式候选选择器:结合奖励模型或过程监督模型,替代简单的执行共识,缩小 pass@k 与 SC 之间的差距。
- 动态工具预算与自适应检索:根据问题复杂度动态调整最大轮次,或在预填充阶段预测所需工具类型以减少推理延迟。
- 跨基准与跨模型验证:在 Spider、WikiSQL、以及私有企业 schema 上验证方法通用性;扩展到 CodeLlama、Qwen、DeepSeek 等模型家族。
- 与 KV 缓存优化联合:结合 BinaryPC 等稀疏注意力技术,进一步降低长 schema 上下文下的推理内存和延迟。
- 多模态数据库接口:将 agentic tool use 扩展到包含表格、图像和文本的多模态数据库查询场景。
六、核心思想总结与可借鉴点
ReToolSQL 的核心思想可以用一句话概括:通过拒绝采样的监督暖启动扩展困难问题的覆盖边界,通过多轮数据库工具交互的 agentic 强化学习将覆盖转化为单轮精度,利用复合奖励和动态采样稳定训练,在单一稠密模型中实现验证优先的鲁棒 Text-to-SQL 生成。这个原则背后,是四层可迁移的方法论:
- 覆盖与精度分阶段优化:当基础模型对硬样本完全无能为力时,先用监督学习注入正确解(即使需要特权信息),再用 RL 优化单轮行为分布。这比直接从基础模型进行 RL 更有效。
- 工具是训练环境的一部分,而非推理附件:将数据库执行器、列分析器和值搜索器直接嵌入 RL 的观察-动作循环,让模型在完整轨迹上学习何时验证、检索什么、如何修复。
- 可验证辅助奖励维持梯度流动:当主要奖励(执行正确性)过于稀疏时,schema 链接、语法合规等可验证信号是防止训练组退化、保持策略梯度有效的关键。
- 熵管理是强模型 RL 的隐藏瓶颈:对于已经很强的基础模型,策略熵的过早崩塌比奖励设计更能限制最终性能。不对称裁剪和退火 KL 是实用的熵保留策略。
对研究者的借鉴:
- 当设计复杂推理任务的 RL 训练时,若基础模型在部分数据上完全失败,直接 RL 往往无效。先通过监督暖启动(即使是特权轨迹)扩展覆盖,再进行 RL 优化,是更稳健的路径。
- 工具使用的熟练度必须通过端到端轨迹优化获得,而非仅靠提示工程。将工具调用和观察纳入 RL 的马尔可夫决策过程,是让模型真正学会利用外部计算的核心。
- 组相对 RL 中的组内方差是稀缺资源。设计奖励函数时,应确保即使主要奖励坍缩,仍有辅助维度维持组内异质性,否则大量训练数据将被动态采样过滤。
对工程师的借鉴:
- 如果你正在部署企业级 Text-to-SQL 系统,优先考虑单模型 agentic 架构而非复杂 pipeline。ReToolSQL 证明,31B 单模型配合执行共识即可达到 74.77% EX,接近或超越多组件系统,且服务成本显著更低。
- 务必为模型配备执行反馈循环。在训练阶段让模型与只读数据库执行器交互,比在推理阶段仅做后验过滤更有效。执行错误应成为模型自我修正的信号,而非仅用于丢弃候选。
- 为 schema 表示注入数据证据。采用 M-Schema 式的值增强序列化(统计量、示例值、外键关系),使模型的链接决策基于数据分布而非列名猜测,这对嘈杂真实数据库至关重要。
- 监控策略熵作为 RL 训练的健康指标。若训练过程中熵快速崩塌至接近零,往往意味着模型陷入局部最优,应调整 KL 系数或裁剪策略以恢复探索。
ReToolSQL 通过将拒绝采样监督暖启动、多轮数据库工具交互、GRPO 强化学习与复合奖励设计有机结合,在 BIRD-SQL 开发集上系统性地证明了:验证优先的 agentic workflow 可以内置于单一稠密模型,通过两阶段训练实现困难样本覆盖与单轮精度的互补提升,以相对简单的服务架构达到 pipeline 级性能。该方法为构建可部署、可维护、企业级的自然语言数据库接口提供了从算法设计到工程落地的完整路径。