把城市压缩成 2067 个盒子:CosFly 无人机跟踪数据管线论文解剖

TL;DR :CosFly 用"把 3D 世界抽象成 2,067 个障碍物盒子 → 在连续空间做 9 目标梯度优化 → 反投影渲染多模态数据"的管线,构建了面向无人机动态目标跟踪的大规模多模态数据集。它既不是这个任务的第一个数据集(城市 UAV 跟踪的"首个"已被早六周的 UAV-Track VLA 占去,具身视觉跟踪任务本身更早一年就有 TrackVLA 做了真机验证),它的差异化也不靠"早",而靠三件具体的事:七通道对齐标注(深度/分割/位姿/双语)、由显式多约束优化(MuCO)生成的专家轨迹、覆盖 7 个 VLM 的基准协议。工程解剖罕见地诚实,MuCO 优化器可迁移到一切"跟随"类任务。但三篇论文宣称的 12,000 条轨迹只公开了 250 条(约 2%),数据生成代码因公司政策不开源,GitHub 仓库目前只有 README------而先到六周的竞品已放出数据样本与演示视频(样本具体规模未公开说明),早一年的邻域工作已经完成真机验证。方向 8.0 分,开放度 2.5 分。


1. 一个并不空旷的空位

先把问题定义讲清楚。过去三年,无人机视觉-语言导航数据集爆发式增长:OpenFly(100K 轨迹)、AirNav(143K)、CityNav(32.6K)、AerialVLN(8.4K)、IndoorUAV(16K+)。但它们全部回答同一个问题:如何从 A 点飞到静态的 B 点 。与此同时,现实世界的无人机跟踪数据集(UAV123、VisDrone、UAVDT、WebUAV-3M)只提供 RGB 视频加边界框------没有深度、没有语义分割、没有语言指令、没有飞行动作。夹在中间的空白是:连续跟随一个移动目标,同时满足可见性、避障、运动学约束------搜救、自动跟拍、野生动物监测真正需要的那个任务。导航的成功定义是"到达",跟踪是"持续":目标本身就是动态约束源,每个时间步都要重新解一次可见性、视角、碰撞的联立问题。

但这个空位并不空旷,三个时间戳足以说明:

  • TrackVLA(arXiv:2505.23189,2025-05,PKU/BAAI/Galbot):提出具身视觉跟踪(EVT)任务,170 万样本(85.5 万跟踪 + 85.5 万识别),自建 EVT-Bench,并且完成了真机验证------四足平台(Unitree GO2)城市/室内跟踪,难档成功率 70%,超过商用跟踪无人机 DJI Flip 的 50%。但它的数据生态是地面智能体与室内场景(Habitat 3.0),与"城市高空飞行"是两个相邻域;
  • UAV-Track VLA(arXiv:2604.02241,2026-04-02):直接做了 CARLA 城市 UAV 跟踪数据集------892,756 帧(约 20 万人工遥操作专家演示 + 69 万 APF 自动采集)、176 个跟踪任务、85 类目标,自称"首个面向城市环境的具身 UAV 跟踪视觉-语言数据集",GitHub 仓库已放出数据样本与演示视频(样本具体规模未公开说明,代码开放程度亦未逐一核实);
  • CosFly-Track(2026-05-20):第三个到场。

那么 CosFly 还剩下什么?差异化是真实的,但必须用限定词说清楚:

  • 轨迹生成哲学:UAV-Track 的专家数据来自人工遥操作 + 人工势场(APF)------一种不考虑可见性、视角美学、多约束联立的朴素控制器;CosFly 用 MuCO 做显式的九目标约束优化。数据集的"天花板"由生成器的目标函数定义,这是 CosFly 把水位线抬得最高的地方;
  • 标注通道:UAV-Track 是前视 RGB(800×600)+ 速度状态 + 语言指令;CosFly 是 RGB + 度量深度 + 语义分割 + 六自由度 位姿 + 目标状态 + 中英双语指令的七通道对齐;
  • 基准协议:CosFly 提供 7 个 VLM 的系统微调基准和 16 城镇的已见/未见划分;UAV-Track 是单一 π0.5 架构家族的模型对比。

还有一处值得记录的文字张力:CosFly-Track 论文声称"没有任何现有数据集是为视觉跟踪设计的",而它自己的技术报告在相关工作中引用了 UAV-Track 67,并称其"面向城市环境中动态车辆与行人的具身视觉跟踪"。这不是疏忽,更像有意的边界划定------CosFly 实际主张的是"没有由多约束连续优化生成、带七通道对齐标注的跟踪数据",这一点在事实上成立;但字面上的"没有任何现有数据集"这一表述越过了它自己承认的边界。2026 年互争"首个"是常规操作,只是这次发生在自家引用的文献上,格外刺眼。

所以,CosFly 必须靠"深"赢,而"深"需要被定义,本文给它三个宾语:专家轨迹由显式、可复现的多约束目标函数生成 (数据集论文附录 A 完整到任何人可以照着重写);标注是七通道对齐 而非单目 RGB 加状态量;评测协议跨 7 个 VLM 与 16 城镇。下文逐层解剖,同时逐层记账。

2. 第一层抽象:65,614 → 2,067 个盒子

管线的第一步是哲学性的:把 CARLA 的 Town10HD_Opt 城市导出成 3D 边界盒,然后狠狠地简化。

原始导出 65,614 个轴对齐盒子,其中植被占 62,581 个(95.38%)------城市几何复杂度的主要来源不是摩天楼,是树。简化是一套精心设计的规则集:

  • 分类合并:按语义类别用 AABB-gap 邻接规则聚类(植被阈值 2 m、建筑 5 m),每个簇替换为外接盒。阈值故意取得保守(偏大),保证规划安全;
  • 裁树手术:每棵树在 2.0 m 高度切成"树干+树冠"两个子盒,树冠再向上抬升 0.5 m------因为 CARLA 的树盒是从地面贯穿到树顶的单一立方体,不切开就会错误地把"树下行走"判为不可行;
  • 地下盒清除:用顶面判据(z_center + e_z < 0才删),保留半埋结构;
  • 嵌套剪枝:只在同类盒之间做,跨类包含(交通灯在建筑里)不动,避免静默丢语义。

结果:65,614 → 2,067 个盒子(31.7× 压缩)。这个数字出现在每张总览图的第 2 步里,像是炫耀,其实是自白------从第一步起,抽象就开始欠债。论文自己在 §6.1 承认:裁树手术制造出的树干-树冠缝隙,按其构造方式就不代表真实物理开口。无人机在盒世界中学到的"可以从树下过",在真实世界未必成立。这笔债叫仿真到现实迁移。论文的最后一节(局限性讨论)就是结账的地方------而作者给出的答案是:还没还,真实数据仍在采集中。

3. 第二层抽象:MuCO------用 9 个代价函数定义"跟拍美学"

这是整套工作中最硬核、也最值得独立借鉴的部分。数据集论文把全部 9 项代价函数的完整定义放在附录 A,自称足以支撑独立复现;技术报告的附录 H 则另给了一份工程实现级的算法规格。

目标函数 :C(W) = Σᵢ Σₖ₌₁⁹ λₖ · cₖ(wᵢ, contextᵢ)

九项代价权重

三个最有信息量的代价项:

  • 可见性 c_vis = (1-v)²,v 是打在目标身体上 5--10 个采样点的未遮挡射线比例。射线-障碍物求询用 BVH 从 O(n) 加速到 O(log n),配合逐路径障碍物过滤(2,000 → 约 200 个),单条轨迹优化从 ~12 s 降到 0.1--0.5 s(24--120×);
  • 视点质量 c_view = f(cos⟨-v_look, v_walk⟩) · dᵢ------全篇最"懂任务"的设计:v_walk 取 ±15 帧窗口的净位移方向,直接性因子 dᵢ 在目标转弯时自动降低约束强度。直走时要严格跟在正后方,转弯时放松------好的轨迹优化器应该理解跟拍的语义,而不只是几何;
  • 加加速度 三阶差分惩罚,直接保证运动学可执行性,免去后处理平滑。

求解器是刻意的"朴素暴力":不用自动微分,而是坐标式有限差分(ε=0.5 m------大到足以跨过小障碍获取有效可见性梯度)+ 自适应学习率 + 单步 0.5 m 位移裁剪 + Rayon 并行,200 个航点每次迭代 2--5 ms。对"生产 6,000+ 条轨迹"这个实际目标,它诚实、可调试、够用。

安全由软/硬四层架构保证 :软安全代价提供梯度引导 → 几何投影把陷入障碍的航点推出去(穿透 >5 m 沿 SDF 梯度大步推出;垂直抬升 ≤3 m 能解决就抬升;否则在 ±35° 扇形里评估四种策略选代价增量最小者)→ 速度修复再分配投影尖峰 → 高度平滑消振荡。分层的原因是防止安全项梯度过强把优化器困死------用工程结构代替调参艺术的典型决策。优化之后还有 7 步后处理流水线(遮挡段拉直、绕行消除、振荡消除、多轮安全投影......),坦白承认:优化器本身不是产品,补丁才是。

与 A* 的对决:一个需要打折扣的 7.3%

MuCO 与 A* 对比

CosFly 实现了离散基线中的理论上限------四维时空体素图上的可见性感知 A*(单条轨迹扩展约 140 万节点)。结果:A* 平均可见性高 7.3 个百分点,但慢 22×、路径长 13%(示例轨迹 315 m vs 200 m)、且需要后处理平滑才能飞。

引用这组数字时必须同时引用它的前提:这个 7.3% 的差距是在一个生产场景下没人会用的基线上测出来的 ------按论文自己的账,A* 生成 6,000 条轨迹要约 9 个 GPU·小时,MuCO 只要 25 分钟。所以这组对比的准确读法不是"谁更好",而是"在可行性约束下,你愿意为更高的可见性支付多少":答案是没有系统会为了 16/20 条本就 >0.90 的可见度去付 22× 的成本。7.3% 仍然携带信息------离散搜索确实能找到可见性更高的路线,这是方法谱系边界上的真实差距------但它对"MuCO 是否够用"这个问题的权重,远小于数字本身暗示的程度。论文把 A* 定位为离线参照、MuCO 定位为生产器,这个分工是清醒的;引用差距数字的人也应该保持同样的清醒。

这里需要补一个数字冲突问题,因为它横跨两篇论文:"22 倍"(5.5 秒对 247 毫秒)出自数据集论文第 4.3 节与图 2(Path 0 案例为 10,075 毫秒对 311 毫秒);而技术报告附录 H 用 20 场景复现实测给出了另一组数字------优化器纯计算 MuCO 平均 218 毫秒、TA*+Smooth 平均 893 毫秒(约 4 倍),端到端计入编排开销后单条路径几乎打平(958 对 906 毫秒),四方综合评分也是 TA*+Smooth(0.782)高于 MuCO(0.699)。这不是计时口径能解释的:同一条 Path 0 上,数据集论文的 A* 要扩展约 141 万个节点、耗时 10,075 毫秒,而技术报告重写的 TA*+Smooth 只要 906 毫秒------参照基线本身差了约 11 倍。换句话说,"22 倍"依赖一个较慢的参照实现,技术报告自己的复现没能确认这个招牌数字;两组数字不必然逻辑矛盾(比较的实现不同),但对读者的实际含义是:MuCO 速度优势的真实量级,取决于你跟哪一个 A* 实现比。另一个跨论文的小出入:技术报告 H.7.2 的 MuCO 权重(2/4/3/2/2/1/2,另加固定高度正则)与数据集论文附录 B 表 7 的权重(1/0.5/0.3/2/3/1/0.5/1/0.1)不仅数值不同、结构也不同(7 项加权加固定正则 对 9 项全加权),两篇论文连参数表都没对齐,照表复现时以哪份为准需要向作者确认。

谱系定位:MuCO 是 CHOMP(2009)→ TrajOpt → GPMP 这一连续优化谱系的工程化后裔,算法新意有限。真正的贡献不在求解器,而在为"数据生产"设计的跟踪专用目标函数和生产经济学。

4. 第三层抽象:双轨迹------把"错误"也做成数据

双轨迹扰动设计

每条行人路径生成两条无人机轨迹:MuCO 专家轨迹 + 扰动轨迹。扰动由两个独立伯努利事件控制(位置扰动 P=0.6、半径 2--3 m;朝向扰动 P=0.6、最大 5°),天然组合出四种状态:16% 无扰动、24% 仅位置、24% 仅朝向、36% 双重扰动。滑窗采样(窗长 10、步长 3)用前 5 帧扰动观测 做输入、完整 10 帧专家轨迹做监督------同一数据结构同时支持去噪、DAgger 式纠偏、对比学习、未来预测四种训练范式。

消融给出了支撑设计的最佳证据:只用专家轨迹训练,偏航 MAE 反而恶化到 6.54°(对比 3.85°)------只见过完美数据的模型学不会纠偏。这本质上是 DAgger 经典教训在 2026 年的重演,但"把扰动写进数据结构"比"训完再 DAgger"更干净。

但证据链上缺了一环:3.85° 这个"纠偏后"的基线本身是怎么来的? 如果 MuCO 生成的专家轨迹带有系统性偏差(第 2 节的 裁树手术造出的假缝隙就是候选),扰动数据教给模型的只是"在专家分布内部如何回来",而不是"真实世界里的专家应该长什么样"。扰动训练的鲁棒性收益因此要乘上一个贴现率------它等于策略从 CARLA 分布外推时的失败率,而该系数论文没测。

这个系数并非完全无锚。邻域里已有一笔公开的结算:TrackVLA 在仿真基准 Gym-UnrealCV 上单目标零样本成功率 100%,真机测试(四足平台,每档 10 次试验)中档 90%、难档 70%,对比商用无人机 DJI Flip 的 70% / 50%------粗略的仿真到现实折扣在 10--30 个百分点量级。这个锚要打三重折扣:平台是四足而非飞行、场景是近地而非城市高空、每档样本仅 10 次。但它至少说明一件事:CARLA 内量出的鲁棒性收益,兑现到现实时个位数到几十个百分点量级的折损是常态,而非意外。CosFly 的扰动收益将来大概率也在这个区间内贴现;而且 UAV-Track 的 APF 扰动与 CosFly 的扰动双轨迹思想同源------"扰动+恢复"已是该领域公共知识,CosFly 在这上面的相对优势比论文呈现的小。

字幕生成(第 7 步)用师生蒸馏(Qwen3.5-397B → 2B)产中英双语指令。因果链(CoC)管道用 锚定策略------把正确 GT 飞行动作注入提示词,保证 100% 决策一致性:推理链是给正确答案写的事后合理化,不是模型自己推出来的。这类数据对提升遮挡场景的表示也许有效,但别把它当成"无人机会推理"的证据。

另一个反直觉的决策值得单独表扬:质检环节主动保留 <5% 的不完美样本(目标-车辆重叠、背景行人掉帧),并用实验证明其对性能影响可忽略。数据世界观很清醒:"干净"不是第一美德,"分布真实"才是。

5. 基准实验:诚实的数字,狡猾的比较

零样本与微调对比

七个 VLM(Qwen3.5-0.8B/2B/9B、Qwen3-VL-2B/8B、GLM-4.6V-Flash、Gemma-4-E4B)的微调 宣传数字很炸:SFT 后 SR@1m 从 25--33% 跳到 78.3--95.6%(+53~69 个百分点)。拆开看:

先说诚实的部分。 零样本的全部 7 个模型输出与"原地不动"基线在小数点后 4 位一致------六自由度 数值回归对当前 VLM 是零样本不可解任务 ,任务特定的 SFT 不可替代。同族规模实验揭示了真问题:0.8B→9B,SR@1m 只 +0.5 个百分点,但 RotAcc@1° +7.0 个百分点、MAE -18.3%------跟踪的难度在精细姿态,不在粗位置 。消融同样坦率:去掉位姿历史 FDE 恶化 3.1×;位姿+框都在时,RGB 的边际贡献几乎为零(1.264 vs 1.249 m),论文自己警告"这暗示当前基准的结构化文本先验已足够做路径回归"------这个基准对视觉还不够难,视觉尚未被迫出场。多图训练把灾难性失败(FDE>10 m)降低了 55.6%。

再说狡猾的部分。 "+53~69 个百分点"的比较对象是零样本 VLM------一个本来就不该会六自由度回归的对手,这是稻草人。真正该问的是:比起在别家跟踪数据上微调,CosFly-Track 的边际收益是多少?两家数据集的动作空间、观测通道、评测协议各不相同,直接横评很难------但这恰恰说明"+53~69 个百分点"作为卖点,比较参照系选得有多舒服。

还有一层账:0.8B 与 2B 在 25%--100% 数据上收敛到几乎同一点(ADE≈2.14),作者正确读出"瓶颈是数据分布而非容量"。但分布瓶颈的下一步追问是:这个上限本身值多少钱? 一个在 2,067 个盒子的 CARLA 里 ADE≈2.14 的模型,放到真实城市里上限是多少?第 4 节的那笔邻域结算(仿真到现实的折扣,约 10--30 个百分点)就是目前唯一能用的汇率读数,而 CosFly 全系列的真机证据为零------它的 ADE、它的 SR、它"零样本不可解"的判定,全部以 CARLA 物理为记账本位。

下游迁移是加分项:Depth Anything V2 AbsRel 0.77→0.045、SAM2.1 mIoU 0.74→0.86、Grounding DINO AP50 85.4→94.2,且小模型≈大模型------覆盖度而非容量是瓶颈。从已见地图到未见地图的 FDE 劣化稳定保持在 50% 上下(+0.43--0.46 m),且与模态选择无关------差距来自轨迹分布漂移。请记住这个数字,它是下一节的伏笔。

6. 影子第四篇:CosFly-VLA 与它的泛化警报

官方管线图(数据集论文图 1)

*▲ 数据集论文官方图 1:场景处理 → 行人路径 → MuCO 优化 → 渲染输出。整个数据宇宙的物理定律由游戏引擎定义。*

2026 年 7 月的 CosFly-VLA 把数据用到了极致:Qwen3.5+LoRA 共享骨干,元查询路由把表示分流到三个解码头------流匹配动作专家(8 步四自由度航点)、目标框 MLP、可见性 MLP;训练四阶段递进(空间 CPT 50 万样本 → 1.74M 样本三阶段课程 SFT → 1.9 万条 CoT → 策略自身交互数据驱动的闭环强化学习)。

数字层面:开环 ADE 比 OpenVLA 低 34%;闭环成功率在已见场景 57%→74%(+17 个百分点),在未见场景 80%→82%(仅 +2 个百分点) 。这个剪刀差是全系列最重要的一个数字:在仿真器内部换个地图,收益就缩水近九成;而仿真到现实的迁移是比换地图大得多的跳跃------在这条路上,TrackVLA 一年前就已经出发,CosFly 还在原地。另一个容易漏掉的细节:闭环评测用的是共享 GT 历史框/可见性缓冲------策略自己的状态估计误差还没进入闭环。论文对此倒是坦白,列进了局限性讨论。

7. 账本:它欠了什么------把同行放在同一行里算

维度 TrackVLA / EVT-Bench(2025-05) UAV-Track VLA(2026-04) CosFly-Track(2026-05,公开版)
域 地面智能体为主,室内 Habitat 3.0,真机为四足平台 城市空中,CARLA 0.9.14 城市空中,CARLA
规模 170 万样本(85.5 万跟踪 + 85.5 万识别) 892,756 帧(20 万人工演示 + 69 万 APF) 宣称 2.4M 时间步;公开 250 条轨迹 / 约 10 万帧
模态通道 RGB + 语言(识别/规划双流) RGB + 速度状态 + 语言 RGB + 深度 + 分割 + 六自由度 位姿 + 双语(七通道)
轨迹生成 未公开细节 人工遥操作 + APF(含扰动恢复) MuCO 九目标约束优化(显式代价函数,附录可复现)
真机验证 有:SR 100/90/70%(易/中/难档,各 10 次),超 DJI Flip 无(列为 未来工作) 无(真实数据采集中)
开放动作 论文承诺公开 TrackVLA 与 EVT-Bench GitHub 已放出数据样本与演示视频(样本规模与代码开放度未完全核实) 数据子集在 HuggingFace;生成管线代码"因公司政策不开源";GitHub 仓库仅有一个 README
基准 EVT-Bench + Gym-UnrealCV 零样本 模型家族内对比(π0.5 系) 7 个 VLM 微调基准 + 已见/未见场景协议

这张表让结论变得立体:CosFly 在"轨迹生成质量"和"标注通道丰富度"两项上确实领先,但在"公开规模"和"开放动作"两项上落后于先到六周的直接竞品,真机验证这一项则落后于早一年的邻域工作 。"数据基建+任务定义"的差异化里,"数据基建"这一半被部分抵消------对手的数据更多、更可得,邻域已经有人把记分牌挪到了现实。CosFly 手里剩下的牌,本质上是一张方法论的牌:如果你的研究需要"由显式多约束优化定义的专家分布"和深度/分割/位姿通道,它是目前唯一选项;如果你只想训一个会跟人的 VLA,UAV-Track 的起点更低。

其余旧账:零样本稻草人比较(第 5 节);VLA 论文无多种子置信区间(数据集论文用 3 种子报了 低于 0.5 个百分点的标准差,VLA 论文没有);行人只有曲率变速+随机停,无社会力、无人群、无对抗运动;树冠缝隙是几何虚构。

8. 评分卡与跟踪清单

评分卡

维度 分数 理由
方向前沿性 8.0 任务方向仍热,但卡位不再独占:UAV-Track 早六周、TrackVLA 早一年且已过真机
工程完成度 8.0 MuCO + 四层安全架构 + 双轨迹课程 + 全链路质检,细节密度极高
方法新颖性 6.5 CHOMP 谱系的工程化;扰动设计因竞品思想同源不再单独加分;新意集中在目标函数
开放度 2.5 公开数据约为宣称的 2%,生成代码不开源,仓库 README-only,落后于已放出样本的竞品
当前可用性 3.5 数据子集与评测协议可用,但规模小于竞品,且无任何真机参照可校准预期
长期跟踪价值 7.0 押注面收窄为"方法论 + 通道丰富度";若扩容与放码兑现可回升,真机验证是最大变量

现在就该用的人:需要深度/分割/位姿通道或多约束优化专家分布的研究者------CosFly 仍是唯一选项;做跟随类规划(跟拍车、AGV 跟随)的------按数据集论文附录 A(技术报告附录 H)重写 MuCO,它的目标函数与你的任务只隔一层代价项。

值得等的事件(建议按季度复查):① 公开数据是否扩到承诺规模(与 UAV-Track 的 89 万帧直接可比);② GitHub 是否放出代码------竞品的样本与视频已经把门槛抬高;③ 是否出现任何真机验证------TrackVLA 的真机数据就摆在那里,CosFly 的沉默每季度都在变贵;④ VLA 是否补多种子与预测状态闭环。

9. 结语:矩阵悖论

论文标题借了《黑客帝国》的隐喻:"我们不改变现实,只改变矩阵。"

当数据生产的边际成本被压到"25 分钟生成 6,000 条轨迹",瓶颈就从"数据量"转移到"抽象保真度 ":无人机在 2,067 个盒子的世界里学到的是盒子的物理,不是世界的物理。CosFly 的每一个抽象层都在记一笔账------税在每次抽象发生时入账(树冠假缝隙、曲率变速的行人、伯努利扰动的形状),在真机验证那天结算。这本账有两栏:一栏是计量,税的计量单位是策略在分布外状态上的失败率 ------CosFly 自己的语言就是"灾难性失败比例",多图训练把它降低 55.6%,正是对冲这笔税的直接证据;另一栏是汇率,贴现率由验证环境与现实在观测(光照、纹理、传感器)和动力学(行人行为、风扰)上的差异决定。第 4 节那笔 10--30 个百分点的邻域结算,是目前公开的唯一汇率读数。CosFly 的账还挂在账上。

矩阵悖论还有第二层:矩阵不只欺骗无人机,也欺骗矩阵里的人类研究者------在 CARLA 里 ADE 2.14 的模型、闭环 SR 74% 的策略、零样本不可解任务的判定,全部以 CARLA 的物理为记账本位。当所有竞争者都在同一矩阵里竞赛,胜出者可能只是最懂矩阵规则的那一个,而不是最懂世界的那个。TrackVLA 把对比做到了商用无人机上,就是在把记分牌往现实挪;CosFly 三篇论文连一次真机试飞都没有。

但公允地说,这套工作做到了几件比数据更重要的事:它把"无人机跟踪"写成了一个可引用、可证伪、有专属约束集合的问题;它用图 2 主动展示劣势数字;它在局限性讨论里把"代码不开源"白纸黑字写出来;它的数据集论文附录 A 详细到足以让任何人重建 MuCO。在 2026 年平均水平的对照下,这种诚实本身就是贡献。

一句话总结:值得精读、值得跟踪、暂不值得押注------它手里的牌是"最丰富的通道 + 最显式的优化",牌还硬,但对手已经下场、有人过了真机,窗口期不是"不会太长",而是正在关闭。


*图表说明:官方管线图来自数据集论文图 1(arXiv:2605.17776);其余图表由本文基于数据集论文公开数据(表 2、表 5、表 7、图 2 及附录 A/B/C)独立绘制。评分卡为主观评价。*

论文:

1)CosFly 技术报告(https://arxiv.org/abs/2605.19120)

2)CosFly-Track 数据集论文(https://arxiv.org/abs/2605.17776)

3)CosFly-VLA 论文(https://arxiv.org/abs/2607.15004)

机 构 :Autel Robotics(道通智能)× 南京大学 × 北京大学 × 南科大 × 港大

相关推荐
ofoxcoding1 小时前
Jev 模型评测深度解析:核心得分、能力局限与最佳适用任务场景
人工智能·算法·机器学习·ai
Light Gao1 小时前
LSTM 与 GRU 详解:从门控机制到架构图与数值计算
人工智能·gru·lstm
问商十三载1 小时前
AI引擎生成式优化服务商怎么选?技术核验清单(附脚本)
数据库·人工智能·机器学习
EatFan1 小时前
2026 后端架构进入 AI 原生阶段:事件驱动 + 虚拟线程 + Agent 内嵌三驾马车怎么落地
人工智能·架构·agent·虚拟线程·事件驱动·ai原生·后端架构
奋进的LY1 小时前
spacy的安装和使用教程
人工智能·python·深度学习·github
小宋10211 小时前
Diffusion LLM 为什么能并行生成:从逐 Token 解码到多位置去噪实战
人工智能
znx9391 小时前
机器学习赋能量化交易:解锁新时代投资的核心竞争优势
人工智能·python·机器学习·期魔方
atwednesday1 小时前
理解 Transformer
人工智能
Timmy1 小时前
前端转全栈笔记:讲框架之前,先把 TypeScript 这关过了
前端·人工智能·node.js