ThinkingVLA: Interleaved Vision and Language Reasoning for Robotic Manipulation
ThinkingVLA:用于机器人操作的交叉视觉与语言推理
机构 * Fudan University(复旦大学)
AI总结 提出ThinkingVLA,通过统一的多Transformer架构实现前向与逆向推理交织,显著提升长时域操作任务性能。
高校专区
ThinkingVLA:用于机器人操作的交叉视觉与语言推理
机构 * Fudan University(复旦大学)
AI总结 提出ThinkingVLA,通过统一的多Transformer架构实现前向与逆向推理交织,显著提升长时域操作任务性能。
MathVis-Fine:通过渐进式依赖引导训练将视觉监督与必要性对齐的多模态数学推理
机构 * School of ECE, Peking University(北京大学电子与计算机工程学院) ; College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) ; School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) ; Tencent Youtu Lab(腾讯优图实验室)
AI总结 提出MathVis-Fine框架,通过构建细粒度视觉标注数据集和两阶段渐进式训练,根据样本的视觉依赖程度平衡答案正确性和视觉基础奖励,提升多模态数学推理的监督精度。
ASTEROID: 用于分子动力学多步时间序列预测的时空信息变换器
机构 * Department of Medicinal Chemistry, School of Pharmaceutical Sciences, Fudan University(药学院药物化学系,复旦大学) ; School of Mathematical Sciences and School of AI, Shanghai Jiao Tong University(数学科学学院和人工智能学院,上海交通大学)
AI总结 提出ASTEROID框架,通过将分子动力学轨迹重构为高维时空序列并集成时空信息变换方程到Transformer中,实现多步原子坐标的直接预测,在多个量子力学分子数据集上显著提升预测精度并降低计算成本。
Comments 32 pages,10 figures
WeaveLA: 面向重复机器人操作的基于事件驱动的跨子任务潜在记忆编织
机构 * Fudan University(复旦大学) ; School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) ; Shanghai Innovation Institute(上海创新研究院) ; Shenzhen Loop Area Institute(深圳河套学院)
AI总结 针对短窗口VLA策略缺乏跨子任务信息传递的问题,提出WeaveLA,通过事件触发将完成子任务压缩为潜在令牌并注入下一子任务的动作生成路径,在保持基础策略短窗口接口的同时实现轻量级跨子任务通道,在困难重复任务上成功率从0%提升至47.8%。
AgentCyberRange:在真实网络靶场中基准测试前沿AI系统
机构 * Fudan University(复旦大学)
AI总结 提出首个开源多靶场基础设施AgentCyberRange,集成110个漏洞和156个内部主机,评估前沿AI系统在真实网络攻击中的能力,发现GPT-5.5+Codex在web利用和后利用任务中表现最佳。