0722 LLM及其科研进展

大模型不能直接自由生成设备控制命令

7月19日前后公开的研究 Schema-Bound LLM Control of Scientific Instrumentation,针对LLM控制科研仪器时容易生成非法参数、遗漏安全条件或调用不存在命令的问题,提出使用严格Schema约束模型输出。

https://arxiv.org/html/2607.17012v1?utm_source=chatgpt.com

其核心思想是将自然语言命令先转换为结构化、可验证的控制对象:

自然语言任务→Schema约束参数→合法性和安全检查→仪器执行

例如,模型不能直接输出"把采样频率调高一些",而必须生成类似:

复制代码
设备:GPR-01
采样间隔:0.1 ns
测线间距:0.02 m
时间窗:30 ns
增益方案:用户已批准方案A

系统再检查参数是否处于设备范围内、是否与网格和测距配置冲突、是否需要人工确认。

对无损检测科研智能体的意义

连接GPR、超声、红外、加载台和环境箱时,建议采用三级控制:

  1. 大模型负责理解任务
  2. 确定性程序负责参数验证和命令生成
  3. 设备控制器负责执行安全联锁

IdeaTrail:科研智能体训练从"最终答案"转向"完整研究过程轨迹"

7月11日发布的 IdeaTrail: Full-Process Agent Trajectories for Scientific Ideation,提供科研智能体过程监督数据和合成方法。它不只记录最终研究建议,而是保存从问题理解、证据检索、想法形成到逐步收敛的多轮轨迹。

解决的问题

现有科研大模型训练样本通常是:

研究问题→最终答案

模型看不到中间如何:

  • 搜集证据;
  • 排除错误方向;
  • 比较多个方案;
  • 修改假设;
  • 识别不确定性。

IdeaTrail采用从真实科学成果反向构建、再正向生成研究过程的方法,使训练轨迹尽量与真实科研产物保持一致,同时模拟研究过程中的不确定性、证据使用和逐步收敛

自动驾驶VLA进入系统化"后训练"阶段:SFT之后,强化学习、失败诊断和自反思成为重点

7月中旬更新的综述 Post-Training in End-to-End Autonomous Driving: A Unified Perspective,系统梳理端到端自动驾驶模型预训练之后的优化方法,重点包括监督微调、偏好优化、强化学习、推理增强和自反思。

https://arxiv.org/html/2607.08072v1?utm_source=chatgpt.com

其反映出的趋势是:自动驾驶VLA的性能提升不再只依赖扩大数据和模型,而是更加关注如何利用失败场景进行后训练。例如,一些路线把"碰撞、规划失败或推理错误"拆分为:

  • 感知失败;
  • 场景理解失败;
  • 推理失败;
  • 规划失败;
  • 控制执行失败;

再针对不同错误构造奖励或纠错数据。

与世界模型的结合

近期VLA世界模型研究已展示不同实现路线:

  • WCog-VLA利用3D空间认知、交通参与者token、Game-CoT和生成式多主体轨迹模型,在NAVSIM报告PDMS 92.9。
  • ExploreVLA利用未来RGB和深度生成开展密集世界建模,并通过预测不确定性驱动安全探索,报告PDMS 93.7、EPDMS 88.8。
  • DriveWorld-VLA在潜空间统一未来演化和轨迹规划,报告NAVSIMv1 PDMS 91.3、NAVSIMv2 EPDMS 86.8,以及nuScenes三秒平均碰撞率0.16。

对检测机器人的启发

智能巡检车也应建立"失败分类---后训练"闭环:

  • 病害未识别;
  • 图谱质量不合格;
  • 测线漏扫;
  • 机械臂姿态错误;
  • 天线耦合不稳定;
  • 障碍物避让导致覆盖不足;
  • 补测没有降低不确定性。

可根据失败原因自动构造训练数据和奖励,使系统不仅模仿已有检测路线,还能逐步学会何时降速、补扫、改变传感器或请求人工接管。

  • ECNDT 2026可解释和标准感知超声AI框架:适合研究检测解释、标准校核和报告一体化。
  • GPU可编程超声层析平台:适合软件定义NDT装备和设备端实时成像。
  • IdeaTrail:适合构建科研智能体过程监督数据集。
  • Schema-Bound Instrument Control:适合实验设备、仿真软件和检测装备的安全工具调用。
  • 自动驾驶后训练综述:适合系统跟踪SFT、RL、偏好优化、失败反馈和自反思。
  • PixelPilot:采用解耦的图像空间规划与几何提升方法,探索更易扩展的自动驾驶VLA路线
相关推荐
ws2019078 小时前
产业链协同创新,2026广州汽车零部件展赋能智造未来
人工智能·科技·汽车
HIT_Weston8 小时前
174、【Agent】【OpenCode】TuiThreadCmd(类型补丁)
人工智能·agent·opencode
星火10248 小时前
【LangChain4j系列06】ChatMemory 对话记忆管理
人工智能·后端
数据百晓通8 小时前
AI 重构治理逻辑:2026 数据治理厂商的能力进化与分水岭
人工智能·重构
跨境小彭8 小时前
Temu运营优化方案:活动库存自动化管控,解决断流、超卖与权重下跌问题
大数据·运维·人工智能·自动化·跨境电商·temu·temu电商运营
烟雨江南7859 小时前
医院门诊医患沟通如何实时转写?——灵声智库流式 ASR、医学术语与双角色记录实践
人工智能·语音识别·agent
风途科技~9 小时前
峰值日照时数精准测,这款光伏电站环境监测仪器助力电站发电量评估
大数据·人工智能
watersink9 小时前
机器学习随机森林
人工智能·随机森林·机器学习
AI多Agent协作实战派9 小时前
AI多Agent协作系统实战(三十九):AI修对了Bug,却越了权——自动化团队的第一条铁律
人工智能·自动化·bug
DS随心转小程序9 小时前
AI 导出鸭重构转化链路,全面优化腾讯元宝输出 word 文档办公效率
人工智能·重构·aigc·word·豆包·deepseek·ai导出鸭