0722 LLM及其科研进展

大模型不能直接自由生成设备控制命令

7月19日前后公开的研究 Schema-Bound LLM Control of Scientific Instrumentation,针对LLM控制科研仪器时容易生成非法参数、遗漏安全条件或调用不存在命令的问题,提出使用严格Schema约束模型输出。

https://arxiv.org/html/2607.17012v1?utm_source=chatgpt.com

其核心思想是将自然语言命令先转换为结构化、可验证的控制对象:

自然语言任务→Schema约束参数→合法性和安全检查→仪器执行

例如,模型不能直接输出"把采样频率调高一些",而必须生成类似:

复制代码
设备:GPR-01
采样间隔:0.1 ns
测线间距:0.02 m
时间窗:30 ns
增益方案:用户已批准方案A

系统再检查参数是否处于设备范围内、是否与网格和测距配置冲突、是否需要人工确认。

对无损检测科研智能体的意义

连接GPR、超声、红外、加载台和环境箱时,建议采用三级控制:

  1. 大模型负责理解任务
  2. 确定性程序负责参数验证和命令生成
  3. 设备控制器负责执行安全联锁

IdeaTrail:科研智能体训练从"最终答案"转向"完整研究过程轨迹"

7月11日发布的 IdeaTrail: Full-Process Agent Trajectories for Scientific Ideation,提供科研智能体过程监督数据和合成方法。它不只记录最终研究建议,而是保存从问题理解、证据检索、想法形成到逐步收敛的多轮轨迹。

解决的问题

现有科研大模型训练样本通常是:

研究问题→最终答案

模型看不到中间如何:

  • 搜集证据;
  • 排除错误方向;
  • 比较多个方案;
  • 修改假设;
  • 识别不确定性。

IdeaTrail采用从真实科学成果反向构建、再正向生成研究过程的方法,使训练轨迹尽量与真实科研产物保持一致,同时模拟研究过程中的不确定性、证据使用和逐步收敛

自动驾驶VLA进入系统化"后训练"阶段:SFT之后,强化学习、失败诊断和自反思成为重点

7月中旬更新的综述 Post-Training in End-to-End Autonomous Driving: A Unified Perspective,系统梳理端到端自动驾驶模型预训练之后的优化方法,重点包括监督微调、偏好优化、强化学习、推理增强和自反思。

https://arxiv.org/html/2607.08072v1?utm_source=chatgpt.com

其反映出的趋势是:自动驾驶VLA的性能提升不再只依赖扩大数据和模型,而是更加关注如何利用失败场景进行后训练。例如,一些路线把"碰撞、规划失败或推理错误"拆分为:

  • 感知失败;
  • 场景理解失败;
  • 推理失败;
  • 规划失败;
  • 控制执行失败;

再针对不同错误构造奖励或纠错数据。

与世界模型的结合

近期VLA世界模型研究已展示不同实现路线:

  • WCog-VLA利用3D空间认知、交通参与者token、Game-CoT和生成式多主体轨迹模型,在NAVSIM报告PDMS 92.9。
  • ExploreVLA利用未来RGB和深度生成开展密集世界建模,并通过预测不确定性驱动安全探索,报告PDMS 93.7、EPDMS 88.8。
  • DriveWorld-VLA在潜空间统一未来演化和轨迹规划,报告NAVSIMv1 PDMS 91.3、NAVSIMv2 EPDMS 86.8,以及nuScenes三秒平均碰撞率0.16。

对检测机器人的启发

智能巡检车也应建立"失败分类---后训练"闭环:

  • 病害未识别;
  • 图谱质量不合格;
  • 测线漏扫;
  • 机械臂姿态错误;
  • 天线耦合不稳定;
  • 障碍物避让导致覆盖不足;
  • 补测没有降低不确定性。

可根据失败原因自动构造训练数据和奖励,使系统不仅模仿已有检测路线,还能逐步学会何时降速、补扫、改变传感器或请求人工接管。

  • ECNDT 2026可解释和标准感知超声AI框架:适合研究检测解释、标准校核和报告一体化。
  • GPU可编程超声层析平台:适合软件定义NDT装备和设备端实时成像。
  • IdeaTrail:适合构建科研智能体过程监督数据集。
  • Schema-Bound Instrument Control:适合实验设备、仿真软件和检测装备的安全工具调用。
  • 自动驾驶后训练综述:适合系统跟踪SFT、RL、偏好优化、失败反馈和自反思。
  • PixelPilot:采用解耦的图像空间规划与几何提升方法,探索更易扩展的自动驾驶VLA路线
相关推荐
饼饼学习空间智能1 小时前
2026数字孪生国产化进入“交付验证期”:五类头部企业能力与项目选型分析
人工智能
海兰2 小时前
【高速缓存】RedisVL为文本生成嵌入向量实践指南
人工智能·python·机器学习
user-猴子2 小时前
让网页“活”过来 —— 用AI打造会自主学习的动态知识图谱
人工智能·学习·知识图谱
苦瓜小生2 小时前
AI名词大扫盲!最全的面试ai名词集合
人工智能·面试
KaMeidebaby2 小时前
卡梅德生物技术快报|bli亲和力检测gst:告别批量跑胶:BLI实时酶切监测技术加速GST融合蛋白下游流程优化
前端·网络·数据库·人工智能·算法
晚笙coding2 小时前
KnowFlow Agent Day10:实现文档切片与数据保存
人工智能
Litluecat2 小时前
2026年7月21日科技热点新闻
人工智能·科技·搜索引擎·新闻·每日
千维百策6662 小时前
运用 SRE 原则降低生产事故影响:CRE 实战经验与可靠性优化方法
网络·数据库·人工智能
千天夜2 小时前
让大模型“先想再答”:Chain-of-Thought Prompting 论文精读——CoT 为什么能激发多步推理?
人工智能·深度学习·llm·gpt-3·llama