arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

2026-07-03 至 2026-07-03 共收录 14
2607.02503 2026-07-03 cs.RO 新提交

VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation

VT-WAM: 面向密集接触操作的视觉-触觉世界动作模型

Shuai Tian, Yupeng Zheng, Yuhang Zheng, Songen Gu, Yujie Zang, Yuxing Qin, Weize Li, Haoran Li, Wenchao Ding, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) TARS Robotics National University of Singapore(新加坡国立大学) Fudan University(复旦大学)

AI总结 提出VT-WAM,在统一流匹配框架中联合学习视觉预测、触觉变形预测和动作预测,通过非对称混合Transformer注意力和接触门控注意力引导,在六项真实密集接触操作任务中平均成功率71.67%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02497 2026-07-03 cs.CV 新提交

Seek to Segment: Active Perception for Panoramic Referring Segmentation

寻求分割:全景指代分割的主动感知

Song Tang, Shuming Hu, Xincheng Shuai, Henghui Ding, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

AI总结 提出主动全景指代分割任务,通过记忆增强智能体PanoSeeker结合视觉语言模型与空间记忆,实现高效搜索与分割。

Comments ECCV 2026, Project Page: https://henghuiding.com/APRS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02466 2026-07-03 cs.RO cs.AI 新提交

Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs

先学移动再学做事:面向VLA的任务无关预训练

Junhao Shi, Siyin Wang, Xiaopeng Yu, Li Ji, Jingjing Gong, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 提出任务无关预训练(TAP)框架,先通过自监督逆动力学从廉价无标签交互数据学习可迁移运动先验,再用少量专家数据将先验与语言对齐,显著降低VLA模型对专家演示的依赖。

Comments Accepted to ICML 2026, 21 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02091 2026-07-03 cs.CV 新提交

Multimodal Fusion for Fine-Grained Classification of Breast Fibroadenoma and Phyllodes Tumors

乳腺纤维腺瘤与叶状肿瘤细粒度分类的多模态融合

Chuxi Nan, Di Wu, Hongming Guo, Ning Cao, Xiaohui Zhu, Zhaoting Shi, Jiawei Li

机构 * School of Integrated Circuits, Wuxi Vocational College of Science and Technology(集成电路学院,无锡科学技术职业技术学院) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(先进科技学院,西安交通大学利物浦大学) Shanghai Gem Science and Technology Co., Ltd.(上海 gems 科技有限公司) Department of Oncology, Shanghai Medical College, Fudan University(肿瘤科,复旦大学上海医学院) Department of Medical Ultrasound, Fudan University Shanghai Cancer Center(医学超声科,复旦大学上海癌症中心)

AI总结 针对B超下乳腺纤维腺瘤和叶状肿瘤高度重叠导致误诊的问题,构建FAPT-M多模态数据集,提出临床引导的多模态框架,集成视觉、文本和临床特征,通过自适应调制、跨模态Transformer和双路径表示学习,实现细粒度分类,准确率77.64%,AUC 89.74%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01978 2026-07-03 cs.AI cs.CL cs.CV 新提交

Multimodal Knowledge Edit-Scoped Generalization for Online Recursive MLLM Editing

多模态知识编辑范围泛化用于在线递归MLLM编辑

Siyuan Li, Youyuan Zhang, Ruitong Liu, Junxi Wang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Peking University(北京大学) Fudan University(复旦大学)

AI总结 针对在线多模态知识编辑中编辑范围难以控制的问题,提出ScopeEdit方法,通过模态局部吸收分支和证据门控共享泛化分支实现范围分离的在线编辑,在保持可靠性的同时提升跨模态泛化与无关输入隔离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01906 2026-07-03 cs.CV 新提交

SFKD: Spatial--Frequency Joint-Aware Heterogeneous Knowledge Distillation via Multi-Level Wavelet Spectral Interaction

SFKD: 通过多级小波频谱交互的空间-频率联合感知异质知识蒸馏

Cuipeng Wang, Haipeng Wang

机构 * Key Laboratory for Information Science of Electromagnetic Waves, Ministry of Education, Fudan University(复旦大学电磁波信息科学教育部重点实验室) Discipline and Technology Center of Microwave Vision Intelligent Sensing, Fudan University(复旦大学微波视觉智能感知学科与技术中心)

AI总结 提出空间-频率联合感知异质知识蒸馏框架SFKD,利用多级离散小波变换解耦空间信息,结合双流双阶段精化模块和高斯滤波频率损失,实现异质模型间的有效知识迁移。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01800 2026-07-03 cs.LG cs.CL 新提交

Do LLMs Truly Generalize in the Molecular Domain? A Perturbation-Based Analysis

LLMs 在分子领域真的能泛化吗?基于扰动的分析

Jiatong Li, Weida Wang, Changmeng Zheng, Shufei Zhang, Yatao Bian, Xiao-yong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学) Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学)

AI总结 提出分子扰动框架,通过控制图编辑距离生成结构变体,揭示分子LLMs对微小结构变化敏感,局部信任区域狭窄;上下文调优可部分缓解脆弱性。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01727 2026-07-03 cs.CL 新提交

When Does Generating More Help? Disentangling Fixed-Source Synthesis from Source Expansion in Synthetic Data Scaling

何时生成更多有帮助?从源扩展中解耦固定源合成在合成数据缩放中的作用

Xu Guo, Jian Tong, Zhihui Lu, Qipeng Guo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

AI总结 本文通过固定源合成(FSS)与源扩展(SE)的对比实验,发现FSS遵循修正缩放定律,在低预算下可预测高预算性能,且SE在大预算下优于FSS,但FSS内多种合成策略均未超越拒绝采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01663 2026-07-03 cs.CV 新提交

Unified Panoramic-Gaussian Representation for Monocular 4D Scene Synthesis

统一全景-高斯表示用于单目4D场景合成

Yuankun Yang, Yi Wei, Wenyang Zhou, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Central Media Technology Institute, Huawei(华为中央媒体技术研究院)

AI总结 提出PanoGaussian,结合全景轨迹引导与显式动态高斯表示,解决单目视频4D场景合成中视角外区域推断不一致和动态内容建模问题。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31918 2026-07-03 cs.CV 新提交

DriveWeaver: Point-Conditioned Video Inpainting for Controllable Vehicle Insertion in Autonomous Driving Simulation

DriveWeaver: 基于点云条件的视频修复用于自动驾驶仿真中的可控车辆插入

Junzhe Jiang, Zipei Ma, Zijie Pan, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院)

AI总结 提出DriveWeaver框架,通过点云条件视频修复实现自动驾驶仿真中可控车辆插入,解决光照不一致和3D资产依赖问题,支持大规模场景增强。

Comments Accepted at ECCV 2026, Project Page: https://github.com/LogosRoboticsGroup/DriveWeaver

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19984 2026-07-03 cs.LG 新提交

Kolmogorov-Arnold Reservoir Computing

Kolmogorov-Arnold 储层计算

Juntian Huang, Jürgen Kurths, Ying Tang

机构 * Institute of Fundamental and Frontier Sciences, University of Electronic Science and Technology of China(电子科技大学基础与前沿科学研究所) Potsdam Institute for Climate Impact Research(波茨坦气候影响研究所) Department of Physics, Humboldt University Berlin(柏林洪堡大学物理系) Research Institute of Intelligent Complex Systems, Fudan University(复旦大学智能复杂系统研究所) School of Physics, University of Electronic Science and Technology of China(电子科技大学物理学院) Key Laboratory of Quantum Physics and Photonic Quantum Information, Ministry of Education, University of Electronic Science and Technology of China(电子科技大学教育部量子物理与光子量子信息重点实验室) Non-classical Information Science Basic Discipline Research Center of Sichuan Province, University of Electronic Science and Technology of China(电子科技大学四川省非经典信息科学基础学科研究中心)

AI总结 提出Kolmogorov-Arnold储层计算(KARC),用显式基函数展开替代储层,结合KAN的表达能力和储层计算的闭式训练,在偏微分方程等基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03056 2026-07-03 cs.AI 版本更新

SkillDAG: Self-Evolving Typed Skill Graphs for LLM Skill Selection at Scale

SkillDAG:面向大规模LLM技能选择的自演化类型化技能图

Tong Bai, Zhenglin Wan, Pengfei Zhou, Xingrui Yu, Yang You, Ivor W. Tsang

机构 * Fudan University(复旦大学) National University of Singapore(国立新加坡大学) CFAR A*STAR

AI总结 提出SkillDAG,通过类型化有向图建模技能间关系,并作为推理时可调用的结构化检索接口,支持在线演化,在ALFWorld和SkillsBench上显著超越基线。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06001 2026-07-03 cs.RO cs.AI cs.CV 版本更新

Restoring Linguistic Grounding in VLA Models via Train-Free Attention Recalibration

恢复VLA模型中的语言基础:无需训练的注意力重校准方法

Ninghao Zhang, Bin Zhu, Shijie Zhou, Jingjing Chen

机构 * Tsinghua University(清华大学) Singapore Management University(新加坡管理学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

AI总结 针对VLA模型在分布外指令下出现“语言盲视”问题,提出无需训练的注意力重校准方法IGAR,通过调整注意力分布恢复语言指令影响,在LIBERO基准和真实机器人上有效减少错误执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14157 2026-07-03 cs.AI cs.CV 版本更新

Ophiuchus: Incentivizing Tool-augmented "Think with Images" for Joint Medical Segmentation, Understanding and Reasoning

Ophiuchus: 激励工具增强的“图像思考”用于联合医学分割、理解与推理

Yankai Jiang, Yujie Zhang, Peng Zhang, Wenjie Li, Yichen Li, Jintai Chen, Xiaoming Shi, Shihui Zhen

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Information Hub, HKUST (Guangzhou)(信息枢纽,香港科技大学(广州))

AI总结 提出Ophiuchus框架,通过三阶段训练策略(冷启动SFT、自反思微调、工具强化学习)使MLLM动态聚焦细粒度视觉区域,实现精准医学分割与诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏