【RL相关笔记】RL 效率综述

RL 效率综述

范围

本综述记录与提升 LLM RL/RLVR 效率相关的已有工作,重点关注难样本处理、信用分配、隐状态信号、rollout 分配和训练动态。

收录规则

允许来源:ICML、NeurIPS/NIPS、AAAI、ACL、ICLR、EMNLP,以及大公司技术报告。每篇论文笔记必须包含 arXiv 链接、代码状态、会议或机构证据。

路线图

路线 代表论文 核心机制 重叠风险 未解决问题
隐式计算槽位 Pause Tokens; Coconut 在输出词元前加入暂停/隐式计算,让部分推理不落成自然语言词元 仅加隐式/暂停词元已被覆盖;Coconut 已覆盖连续隐式思考 + 课程学习 如何把标准答案转成可验证的证明状态目标,而不是只靠剩余词元交叉熵
表示读出与控制 Representation Engineering; CAA 从正负刺激 / 解答中读出隐状态方向,并进行激活控制/投影 均值差控制、PCA 方向、RepE 评估框架已被覆盖 数学推理中的方向必须通过因果干预,且不能只是风格、长度、模板
表示微调 ReFT 冻结基座语言模型,训练作用于隐状态的低秩干预 直接做隐状态干预 SFT 与 ReFT 重叠 如何让干预表示答案/证明状态,而不是仍然由词元交叉熵驱动
世界模型探针 Language Models Represent Space and Time 隐状态中可线性读出空间/时间等结构变量 探针成功不是因果使用 数学中的证明状态/约束状态是否可读、可控、可训练
零阶 / ES / swarm 后训练 ES at Scale; EGGROLL; Model Swarms; LOZO; ZO-Finetuner; LOREN; MeZO-SVRG; QuZO 覆盖全参数 ES、fresh low-rank population、LoRA/LLM 权重粒子的完整 PSO、低秩子空间、自适应协方差、方差控制和量化训练 LoRA + no backprop + population/PSO search 已不是空白;Model Swarms 已完整使用 velocity、personal/global best 和 reward utility 能否在 matched query 下突破 Model Swarms 的初始 expert 仿射包,并同时保留已发现方向
RLVR reward baseline OPO; SPO; BV-Blend; James-Stein Baselines; POISE 覆盖 score-norm/length-weighted optimal baseline、persistent global tracker、semantic-cluster historical moments、跨 prompt shrinkage、actor hidden-state value estimation 普通 cluster EMA、global tracker、length weighting、轻量 value probe 均已有直接近邻 尚可检验:在 prompt semantic function space 中直接估计 score-weighted variance-optimal projection,并证明 gradient MSE 独立下降
严格在线 single-rollout (G=1) InstructGPT/PPO; RTO; (A^\star)-PO; Single-stream PO PPO 用 learned critic;RTO 用 preference-derived token reward;(A^\star)-PO 用离线固定最优 value;Single-stream PO 用每题历史 Beta/EMA tracker 不能把 GRPO 直接设 G=1;A*PO 与 Single-stream PO 默认都在初始化阶段每题采 8 条,RTO 依赖额外 preference data 真正未解决的是:不做额外分支 rollout 时,如何获得可靠的 token/segment signed credit,而不只是 sequence advantage 调幅
相关 rollout 的无偏 policy gradient CARMS; QuasiMoTTo; XQPO CARMS 允许已知 joint PMF 的 categorical antithetic estimator;QuasiMoTTo 已计算 arithmetic-QMC sequence pair law,但 lattice 不覆盖 iid pair target;XQPO 通过独立 blocks 绕开依赖 FACS-RL 用 q_rho=(1-rho)pi⊗pi+rho q_Q 把 lattice coupling 变成 full-support、ratio 有界的 sequence-level proposal,再用 pairwise PoD 校正 weak-to-pass;必须先同时超过 iid-RLOO 与 XQPO 的 fixed-checkpoint gradient MSE,并证明 overlap/weight 成本没有吞掉 coverage 收益
Counterfactual credit / reset RL RRPO; SRPO 从 thought-level prefix reset 并重采样 suffix,mask shared prefix,只在可区分 continuation 的 suffix 上做 outcome RL trajectory advantage × token importance 只调幅度,不能替代 action-conditioned counterfactual value;FlowTracer/EAPO/STARE 已覆盖 saliency/entropy/surprisal reweight 若用 BT,只能拟合同 prefix 的 action/suffix relative value;二元可靠 verifier 下先用直接 suffix success-rate,且任何新方法必须 compute-matched 超过 SRPO
业务场景动态 Skill 加载 AutoGuide; AutoManual; UPRISE; AWM; RouteLLM; Memp; SkillsBench; SRA-Bench; SkillRet 覆盖状态感知 guideline 选择、外部手册/流程构建、提示检索训练、偏好路由、程序性记忆维护和 2026 Agent Skill 评测 embedding top-k + prompt 注入 已非空白;不能把业务 Skill 问题写成功能调用,也不能用固定 skill ID 证明新增 Skill 泛化 开放问题是用业务效用训练带 NONE/ASK/DEFER 的描述条件化 Router,并单独训练加载后的 Skill incorporation,在完全未见 Skill、错误 Skill 拒绝、规则冲突和多轮状态变化上泛化;详见项目根目录 dynamic_skill_loading_survey.md
On-policy / privileged self-distillation GKD; MiniLLM; OPSD; PI-Distill; RLSD; RLCSD; Purified OPSD; EDGE-OPD; PW-OPSD; DOPD; PHF; Rethinking OPSD; LEAP; PromptKD; MetaDistil; RSR; Variational Reasoning student-prefix KD、PI-conditioned self-teacher、evidence-ratio RL、correct/wrong hint contrast、reference-only purification、evidence token mask、position weighting、dual token routing、hidden-flow distillation与高熵分叉诊断 静态 PI teacher、token evidence/mask/position weight、privileged teacher/student token routing、直接复制 privileged hidden flow 均已有近邻;raw attention token weighting 风险极高 可检验空白:不重权 token,而以 attention-path intervention 构造 reward-constrained minimal-information teacher,检验 teacher utility--PI dependence frontier 是否预测最终无 PI transfer
失败触发的反馈纠正 STaR; LEMA; SELF-EXPLORE; SCoRe; Guide; HiLL; Feedback Friction 覆盖答错后给答案/提示重试、错误解释与修正数据、首错误细粒度偏好、在线多轮纠错 RL、全错组自适应提示、hint transfer weighting 与反馈抗拒 wrong→hint→correct、三元组纠错、全错触发提示和按无提示似然选择 hint 均已被覆盖;同题二次答对不等于训练后能力固化 可检验残差:更新后在无提示、同技能不同实例上的 cross-consolidation gain,是否比 difficulty、hint lift 与 HiLL reliance 更能预测最终训练收益
Instruction following / context use IFEval; AgentIF; IFBench; AdvancedIF; Context-faithful Prompting; ReasonIF(未收录预印本); POPE(未收录预印本) 已覆盖可验证格式约束、真实 agent 长指令与 tool/condition constraints、held-out constraint RLVR、复杂多轮/system prompt rubric RL、上下文与参数知识冲突 "模型经常忽略 Skill/上下文"和"做 IF-RL 能提高遵循"不是新 claim;AgentIF 已有 CSR/ISR,AdvancedIF 已有 rubric verifier+RL,IFBench 已有 OOD constraint RLVR 尚缺的是 Skill-specific incorporation:检索/加载正确后,模型能否根据任意未见 Skill 改变工具与回答、拒绝 matched wrong Skill,并把 teacher-only correction 迁移到保留 Skill 的 deployment policy
固定多项 Rubric Judge 蒸馏 LLM-Rubric; Prometheus; JudgeLM; Con-J; EvalPlanner; J1; Think-J; ArmoRM 覆盖多维 rubric 概率+校准、custom criterion evaluator SFT、GPT-4 Judge 蒸馏、受控 judgment DPO、Judge correctness GRPO、multi-objective RM "生成式 Judge 在 SFT 后用 DPO/GRPO 可提升"已被覆盖;本项目step-200的裸0.8*item_F2+0.2*Better reward约0.75震荡且record recall下降3.79pp。SFT缓存24组×64条中83.3%组有reward方差且mean oracle gap为0.234,说明并非完全无候选信号;但64条极值需subsample到真实训练G 下一步不能仅凭clipfrac=0/ppo_kl≈0判定LR过小:先确认verl指标时点,用固定probe测SFT→checkpoint累计KL/log-prob漂移,拆分Must/Better组内方差,再做同起点20--50步1e-6/3e-6/5e-6 sweep。JSON可保留;DPO不是必经步骤

当前想法重叠图

想法 / 机制 最接近的已有工作 重叠点 差异 判断
LCR / 隐状态反事实稳健 reward MC Dropout robustness, Activation uncertainty, Hidden-Align, DynaMO 都利用扰动/隐状态/不确定性 不训练 confidence model,不构造数据;用最终验证器复验隐状态扰动后的短答案,作为 RLVR reward 稳健估计 weak-to-pass;前置实验需证明不是 entropy/logprob 换皮且成本低于多 rollout
LRD / 自然修正隐状态蒸馏 Oops Wait, Single-Utterance Self-Correction, Coconut, Hidden-Align 都关注自我修正、latent slots 或 hidden states 不强化 wait token,不人工扰动 CoT;蒸馏自然成功修正前后的隐状态跃迁为 latent revision operator rejected;自然成功修正事件稀疏且有冷启动死局,诱导数据会破坏自然性假设
ACIPS / 答案控制不变证明子空间 Hidden-Align, TILR, Coconut, ReFT, HARP 都使用隐状态、低秩子空间或 latent slots 显式把答案泄露、格式、长度作为 nuisance,要求同答案不同题分离,并用 proof subspace 训练 latent slots rejected;核心依赖大量人工 answer-controlled 对照组,数据构造本身会制造伪信号
MIPS / 多解不变证明状态优化 Hidden-Align, Coconut, ReFT, RepE, CAA, TILR 都使用隐状态、隐式槽位或表示方向;Hidden-Align 已覆盖正确 rollout hidden-state 对齐 当前版本新颖性一般;必须从单均值 c_q 改成 answer-controlled invariant proof subspace / prototype set,并证明不是 answer state weak-to-revise;Hidden-Align 必须作为强 baseline
答案状态蒸馏 RepE, CAA, ReFT, Coconut 都使用隐状态表示 / 隐式状态 需要强调同题多解不变性、因果干预、短答监督,而不是词元级 CoT 模仿 可探索,但必须先做隐状态前置实验
隐槽位 SFT Pause Tokens, Coconut 输出前隐式计算 / 连续思考 若只替换 CoT 词元,则与 Coconut 高重叠;可加入证明状态对齐或验证器约束的隐状态目标 可探索,创新点必须在目标和验证
正确/错误解激活均值差控制 CAA, RepE 均值差激活方向 无明显差异 不能作为独立 idea,只能作为诊断或组件
SDPT-PSO / 固定低维 LoRA 粒子群搜索 ES at Scale, EGGROLL, LOZO, ZO-Finetuner, LOREN, Derivative-Free LoRA 都是 forward-only 参数空间搜索;EGGROLL 已在 7B GSM8K 做 fresh low-rank ES 当前 PSO 使用固定 U,全程仍在同一 16D 空间;跨 batch pbest 不可比 fail as paper;仅保留"置信重评 swarm memory 是否比 EGGROLL 更省 query"的前置实验
CIES / 置信可识别参数搜索 Guided ES, EGGROLL, LOREN, SDPT-PSO 都在参数空间用函数值选择更新;RL gradient subspace 也不是全新对象 删除永久 pbest/gbest,把 antithetic probes 作为带噪线性测量,仅提交置信集合内仍为正的方向 weak-to-revise;必须先证明在 matched query budget 下减少错误 commit 并超过 EGGROLL/Guided ES
PSO-LoRA / Model Swarms 邻域 Model Swarms, EGGROLL, Particle Swarm Guided ES Model Swarms 已把 LoRA/LLM 当粒子并使用完整 PSO;EGGROLL 提供 fresh low-rank 支持扩张;经典 PSGES 已融合 PSO 与 ES mutation 唯一尚可检验的问题是"PSO 利用初始 expert span、ES 只探索其正交补"的严格分工是否带来不可被 PSGES/EGGROLL 复现的 query efficiency open but high-risk;必须先做 affine-hull escape 与 compute-matched falsification
SNBPO / semantic historical baseline BV-Blend, OPO, SPO, James-Stein Baselines, POISE BV-Blend 已直接覆盖 fixed KMeans + semantic-cluster historical EMA moments + uncertainty blending;OPO 已推导 score-norm-weighted optimal baseline;SPO/POISE 已覆盖 single-stream 或 lightweight value estimation 当前可检验修订 VOSB:把 prompt semantics 作为 baseline function basis,直接求 score-weighted variance-optimal projection;G=1 仅为结果 weak-to-pass;必须在 fixed-checkpoint gradient MSE 上同时超过 const、ordinary semantic regression、BV-Blend 和 OPO length proxy,否则语义 baseline 主线失败
Orbit-Invariant RLVR / 等构 verifier reward IPT / LLMs Gaming Verifiers(arXiv:2604.15149) 都用逻辑等构变换检查是否真正学到规则,而非只通过原 verifier IPT 已在受控 RLVR 中比较 extensional 与 isomorphic verifier,并报告后者消除 shortcut;变换 reward 的直接主张已被覆盖 rejected;只能作为 reward-hacking 审计,不能作为主算法
PIVOT-OPSD / 反事实 PI 接口选择 MetaDistil; LEAP; PI-Distill; PromptKD; RSR; OPSD 都关注 teacher/student capacity、PI realizability、student-friendly supervision 或 post-update student performance 不优化 teacher 相似度或 token 权重;对多种 PI 做稀疏一步试更新,用独立无 PI verifier reward 定义操作值,允许 NULL 并随 checkpoint 重审计 weak-to-pass;MetaDistil 是最大历史碰撞。只有接口排序反转、一步 transfer 预测长期收益、且 compute-matched 超过 fixed-best PI 时才成立
PIE-OPSD / PI 执行能力隔离与固化 PI-Distill; Variational Reasoning; MetaDistil; Deep Context Distillation; POPE; ReasonIF 都训练 teacher/posterior、压缩 context 或指出 instruction following 影响推理 不改变 PI 构造、不做 meta-gradient;用无 PI 时严格为零的 PI-only executor 隔离 acquisition,冻结 backbone 学 PI utilization,再冻结 executor 做 on-policy consolidation,最终丢弃 executor weak-to-pass;若共享 π-Distill 不存在 correct-vs-shuffled false-utilization,或 matched compute 无优势,则退化为 teacher-only adapter + EM,应直接否决
RIFT-OPSD / 层级可实现 PI 残差投影 PIE-OPSD; Auxiliary Modality Learning; Multimodal Representation Collapse; Deep Context Distillation; intermediate-layer KD 都涉及训练期辅助信息、跨层融合/蒸馏、缺失模态或隐状态匹配 不以 raw teacher accuracy 选层;在输出 Fisher metric 下把 PI residual 投影到无 PI hidden 可实现函数空间,用 reachable teacher 做 OPSD,并以 retained reward 选择层 weak-to-pass;原始"PI 当模态 + layer sweep"接近 fail。只有 raw utility 与 reachable utility 稳定排序反转、Fisher projection 胜 hidden MSE/logit-only、且 matched-compute 胜 OPSD/PIE 时才成立
MIST-OPSD / 最小信息 privileged teacher RLSD; EDGE-OPD; PW-OPSD; DOPD; Purified OPSD; PHF; ContextCite; causal attention pruning 都诊断或修改 PI token/hidden/context signal raw attention 只定位候选通路;通过 PI-on/off attention gate 干预测 JSD 依赖,在保留 PI reward 增益的约束下搜索最少依赖 PI 的整体 teacher,再执行未重权的 OPSD weak-to-pass;若只是 attention token mask 则 fail。只有 utility--dependence frontier 稳定存在、依赖指标胜 raw attention/evidence/position 预测 transfer,且 matched-compute 胜 Purified OPSD/EDGE/DOPD 才可保留
SCD / Skill-Causal Distillation OPSD; PI-Distill; RLSD; Purified OPSD; SkillsBench; SRA-Bench; AgentIF; AdvancedIF 试图把 privileged correction 与 runtime Skill 统一进同一 counterfactual distillation 目标 项目当前明确要求两条独立路线:OPSD 不加载 Skill;动态 Skill 不考虑 OPSD rejected;问题边界不符。后续不得用"都是外部信息"作为合并两条路线的理由
CCT / 跨题无提示固化选择 STaR; LEMA; SCoRe; Guide; HiLL; MetaDistil 都用错误、提示、修正或 student post-update performance 改善训练 CCT 不以同题 hinted success 为"学会",而用短 pilot update 后、同技能兄弟题上的 no-hint reward change 测固化;不直接 meta-train teacher weak-to-pass;若该分数不能在 matched cost 下额外预测长期收益,或只在同题有效,则降级为分析工具
DR-FPO / 纠错提议策略优化 RLTF-SD; VPD; Guide; HiLL; DistIL; DR-Off-PAC 首答失败后获取文字反馈并二答、再把反馈条件能力迁回无反馈策略;DR off-policy gradient 本身亦有经典先例 不把二答当 demonstration,而把它视为由失败选择、反馈上下文生成的 proposal;用 propensity、context ratio 与 outcome residual 估计同一个无反馈 reward gradient rejected / Level 2 high overlap;用户明确不接受该重合等级,停止作为论文候选
FUSE / 反馈条件更新后验 MEND; CaMeLS; Text2Grad; RLTF-SD; LETI; Text-to-LoRA; Bi-NAC 都覆盖 learned update rule、文本到梯度/adapter、二元+文本反馈或以 post-update 表现衡量反馈 额外学习 update posterior,本质上仍是另外的更新模型;不符合"单一简单原理"的约束 rejected;用户明确否决模型堆叠和隐藏的 loss 融合,不再推进
CAP-Map / OPSD 特权信息因果通路与迁移图谱 RLSD; RLCSD; Purified OPSD; EDGE-OPD; ContextCite; Attention Flow; ALTI 都测量 PI 引起的 logit、token evidence、context attribution 或 attention flow 不立即改 loss;在固定 student trajectory 上对 PI→response attention edges 做因果 gate,使用 same-length shuffled/wrong/null PI 消除位置与模板混淆,检验内部通路特征是否预测最终无 PI transfer diagnostic candidate / Level 3 question;若因果通路不能比 raw attention、RLSD log-ratio、ContextCite 更好地预测 transfer,立即否决
Feedback-Triggered Boundary Training STaR; ILF; LEMA; SCoRe; RLTF-SD; Guide; HiLL; DAPO; CoDaPO; Step-DPO 覆盖失败重试、文本反馈修正、0→10\to10→1 奖励、迁回 no-feedback policy、易/难/可学边界采样与首错偏好训练 将所有训练数据统一成动态 (y+,y−)(y^+,y^-)(y+,y−) 边界对,反馈仅用于 minimal repair 数据生成,易题衰减改为采样衰减而不改 reward review draft / Level 2 high overlap;只有证明 0→10\to10→1 boundary episodes 在等计算下带来稳定更高的跨样本 no-feedback transfer,才能升级
CCF / Counterfactually Coupled Feedback RLTF-SD; SCoRe; InT; Gumbel Counterfactual Generation; Coupled Token Generation; DPO 反馈纠正、局部 intervention、Gumbel coupling 与 preference optimization 已分别被覆盖 同噪声只改善 pair construction,最终目标仍是标准局部 DPO rejected / fail;已有 counterfactual sampling + DPO 的组合不足以形成 ICLR 方法创新

开放问题

  • 如何把一条正确答案转成可泛化、可干预、跨解法不变的隐式证明状态。
  • 如何证明隐状态信号是因果能力对象,而不是探针伪影或风格/模板特征。
  • 如何把 SFT/RL 的监督从完整 CoT 词元模仿转移到隐式槽位 / 隐状态干预,同时保留最终答案正确率。
  • 详细综述见 all_ref/hidden_state_sft_internalization_survey.md
  • 零阶/ES 专题见 all_ref/zo_es_post_training_survey.md
  • 单 rollout、PPO/GRPO 与 rollout 成本专题见项目根目录 allinone.md
  • 动态 Agent Skills 的独立方案(召回训练、使用训练、Skill 组织、使用能力评测)见项目根目录 skill_training_retrieval_execution_benchmark.md;背景综述见 dynamic_skill_loading_survey.md
  • OPSD 的独立优化方案(RLSD、PI 遵循、PI-USE-Agent Benchmark、无 PI 迁移)见项目根目录 opsd_optimization_pi_following_survey.md;早期综述与 PIVOT-OPSD 提案见 opsd_iclr2027_survey_and_pivot.md
  • PI instruction execution 新方向与 PIE-OPSD 详案见 ideas/2026-08-10_pie_opsd.md
  • PI 作为训练期辅助模态的层级融合、Fisher-reachable projection 与 RIFT-OPSD 详案见 ideas/2026-08-14_rift_opsd.md
  • PI attention 因果干预、最小充分 privileged teacher 与 MIST-OPSD 详案见 ideas/2026-08-17_mist_opsd.md;ContextCite 论文笔记见 all_ref/papers/2409.00729_contextcite.md
  • 开放式工具 Agent 的 PI utilization / instruction following 评测近邻见 all_ref/agent_pi_utilization_survey.md
  • 固定 Must/Better 多项 LLM Judge 的 partial-label SFT、DPO/GRPO 和 constrained reward 综述见项目根目录 llm_judge_training_survey.md
  • ideas/skill_conditioned_opsd_dynamic_skills_plan.md 是已否决的混合路线存档,不再作为后续方案依据。
  • 单 rollout 异质反馈统一的新近邻包括 UFT、SRFT/CHORD、BRAIn、Text2Grad、Provably Learning from Language Feedback、Post-Training is About States, Not Tokens,以及 GKD/OPSD/PI-Distill/RLSD/EDGE-OPD。single rollout + rich feedbackfeedback bandwidth hierarchyreward posteriorSFT/RL loss mixing 均已被覆盖;尚可检验的残差是把 demo/verdict/PI 编译为相交的 policy constraint set,求 minimum-KL feasible target,并用 infeasibility certificate 处理反馈冲突。详见 ideas/2026-08-18_single_rollout_feedback_projection.md
  • 失败条件二答的新近邻以 RLTF-SD(ICML 2026)为首:它已覆盖首答、critique、二答、paired advantage、成功二答 SFT,以及 exact context IS 与 practical AWR 的取舍。可检验残差 DR-FPO 聚焦 failure-selection 与 feedback-context 的双重偏差;详见 ideas/2026-08-18_corrective_proposal_policy_optimization.md,逐步 novelty 审计见 ideaspark_run/right-wrong-how-correction/scoop/
  • CCF 已否决,见 ideas/2026-08-21_counterfactually_coupled_feedback.md。决定性问题不是 coverage,而是优化目标完全退化为局部 DPO;same-noise SCM 只提供更干净的数据对。后续不得把新的 pair 筛选、coupling、minimal edit 或局部 span 构造直接包装为新算法,必须先说明新的学习对象或 estimator 为何不能被标准 DPO/SFT/RL 复现。
  • Refine B / Failure Closure Distillation 见 ideas/2026-08-27_refine_b_failure_experience_internalization.md。纠正后的学习对象是有序失败集状态 F_0→F_1→...→∅:每轮修复后重评,记录 resolved、persistent、regressed 与 newly exposed failures,并把整个 closure policy 压到无 Checklist 首答。PRECHECK 只是可能实现,不是核心定义。
  • 2026-08-31 纠正裁决:撤回 Level 2 high overlap,改为 not scooped / Level 3 medium adjacency。Self-Refine 覆盖多轮历史 refine 但不内化;TRD 覆盖单次 refine-then-distill;SGSD/SEED 覆盖经验型 mistake/avoidance skill 蒸馏;SD-Zero/RLTF-SD 只覆盖一次 revision;ReflexiCoder 在推理时仍执行反思循环;TTPO 无 refine。尚未发现工作同时覆盖"修复后才暴露残余失败"的有序闭合与首轮参数内化。必须用 Full-Closure 对 Final-Only、One-Revision、Last-Failure-Only、Shuffled-History 的 held-out no-checklist 增益和失败复发率来支撑该 delta;详见 step1.md--step7.md
  • 2026-09-04 实施口径按真实流水线修正:主机制采用n=1 chain mode,每题每轮一答,错误经策略诊断后追加到题级有序history再继续回答;n=4 aggregate mode则将同题本轮多条错答汇总为一张题级经验卡,只作为failure-discovery/coverage配置,不再描述成四条互不共享经验的独立链。AIME24上Qwen3-4B think/6k配Qwen3.8-27B judge从7/30闭合到15/30,前三轮救回7/8,支持三轮collection,但仍缺matched no-feedback/shuffled因果对照与参数内化证据;详见experiments/2026-09-04_qwen3_8_27b_judge_direct_refine.md
相关推荐
番茄不是西红柿kk40 分钟前
OpenCode Go 与 Command Code 性价比深度分析(2026.09.04 更新)
人工智能·opencode·commondcode
STQY燊桐启元(深圳)电子科技44 分钟前
5G 射频光模块场景,ST‑XDP 微波吸波导热垫片应用优势,对比 DP 导热硅胶片
经验分享·笔记·5g
Carl_奕然1 小时前
【智能体】Agent的四种设计模式之:React(2026最新版)
javascript·人工智能·python·react.js·设计模式·语言模型
Thomas.Sir1 小时前
第24课:TensorFlow|图像分类实战训练【手写数字、日常图像分类完整项目】
人工智能·分类·tensorflow
AI视觉网奇1 小时前
blende 下载安装学习笔记
笔记·学习
Herlie1 小时前
2026,当AI不再是“玩具”:01Agent如何终结内容创作的“碎片化时代”?
人工智能
2601_967659881 小时前
AI重构流量入口,本地GEO服务正在成为一门新生意
人工智能
是翎1 小时前
Vibe Coding零基础入门:六步工作流拆解
大数据·人工智能·学习·机器学习·数据挖掘