arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

2026-07-01 至 2026-07-01 共收录 12
2606.31966 2026-07-01 cs.MA cs.AI cs.CL cs.CV 新提交

MECoBench: A Systematic Study of Multimodal Agent Collaboration in Embodied Environments

MECoBench:具身环境中多模态智能体协作的系统研究

Qingyun Liu, Jiwen Zhang, Jingyi Hu, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出MECoBench基准,通过多任务、多结构、多模式的实验,系统研究多模态大模型在具身环境中的协作机制,发现协作能提升任务完成度但需平衡收益与复杂度,通信是关键,且协作增强鲁棒性。

Comments Project website: https://q-i-n-g.github.io/MECoBench-Website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31836 2026-07-01 cs.RO 新提交

RoboTacDex: A Dexterous Visual-Tactile-Action Dataset for Humanoid Manipulation

RoboTacDex:用于人形机器人操作的灵巧视觉-触觉-动作数据集

Xinyi Wang, Donghan Li, Zi'Ang Chen, Chong Yu, Chen Xin, Peng Ye, Yingkai Sun, Tao Chen

机构 * Fudan University(复旦大学) ByteDance Intelligent Creation(字节跳动智能创作) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出RoboTacDex,一个包含6k轨迹、19个任务、23种技能和22个物体的大规模多模态灵巧操作数据集,基于Unitree G1人形机器人构建,提供多视角RGB-D、触觉反馈和语义标注,并评估了三种模仿学习模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31734 2026-07-01 cs.CV 新提交

MemLearner: Learning to Query Context memory for Video World Models

MemLearner: 学习查询上下文记忆用于视频世界模型

Jiwen Yu, Jianxiong Gao, Jianhong Bai, Yiran Qin, Kaiyi Huang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xihui Liu

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Kuaishou Technology(快手科技)

AI总结 提出基于学习的自适应上下文查询方法MemLearner,利用视频生成模型自身进行上下文记忆查询,解决视频世界模型在遮挡和动态场景下的场景一致性问题。

Comments ECCV 2026, Project Page: https://yujiwen.github.io/memlearner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31723 2026-07-01 cs.RO 新提交

UniTacVLA: Unified Tactile Understanding and Prediction in Vision Language Action Models

UniTacVLA:视觉语言动作模型中的统一触觉理解与预测

Xidong Zhang, Yichi Zhang, Jiaxin Shi, Fucai Zhu, Siyu Zhu, Michael Yu Wang, Xiaojun Wu, Weihao Yuan

机构 * Harbin Institute of Technology(哈尔滨工业大学) Great Bay University(大湾区大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Nanjing University(南京大学) Daimon Robotics

AI总结 提出统一触觉学习框架,通过触觉链式推理和由粗到细的未来触觉预测构建状态与动力学感知先验,并设计触觉-动作混合控制器,在接触丰富操作任务中提升成功率、精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31200 2026-07-01 cs.AI 新提交

Agentic RAG-VLM: Affordance-Aware Retrieval-Augmented Generation with Self-Reflective Planning for Robotic Grasping

Agentic RAG-VLM:基于自反规划与可操作性感知的检索增强生成在机器人抓取中的应用

Tao Chen, Lizheng Liu, Jiaxu Wang, Ziyue Jiang, Ruiqi Tian, JiGuang Huo, Zhongxue Gan

机构 * Fudan University(复旦大学) Kean University(肯恩大学)

AI总结 提出Agentic RAG-VLM框架,通过可操作性感知检索、场景图推理和自反规划,在杂乱环境中实现鲁棒抓取,成功率78.3%,比纯VLM基线提升53.3个百分点。

Comments 8 pages,5 figures,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31171 2026-07-01 cs.AI cs.ET 新提交

Cross-Domain Feature Expansion for Tabular Medical Data via Knowledge Graphs Injection

通过知识图谱注入的表格医疗数据跨域特征扩展

Mengying Zhou, Yongjie Yin, Haoyan Xin, Guoping Liu, Yang Chen

机构 * School of Computing and Artificial Intelligence, Shanghai University of Finance and Economics(上海财经大学计算机与人工智能学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学技术学院) Independent Researcher(独立研究者) School of Basic Medical Sciences, Shanghai University of Traditional Chinese Medicine and Pharmacology(上海中医药大学基础医学院)

AI总结 提出MedKGTab框架,利用知识图谱和注意力机制从现有特征推断未收集的生物医学特征,实现跨域特征扩展,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30814 2026-07-01 cs.CL 新提交

When Calibration Rankings Reverse: Accuracy-Controlled Evaluation for Fair Comparison of LLMs

当校准排名反转:面向LLM公平比较的精度控制评估框架

Zhichao Yang, Caiqi Zhang, Ruihan Yang, Chengzu Li, Nigel Collier, Deqing Yang

机构 * Fudan University(复旦大学) University of Cambridge(剑桥大学)

AI总结 针对全局校准指标因模型精度差异导致比较不公平的问题,提出ACE精度控制评估框架,通过实例对齐、分布对齐和候选对齐三种视角实现公平比较,发现原始指标下的优势在控制精度后大幅减弱,排名反转频繁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30705 2026-07-01 cs.LG cs.AI 新提交

Why Do Few-Step Text Latents Fail When Image Latents Work? Non-Commitment at Sharp Categorical Readouts

为什么少步文本潜在变量在图像潜在变量有效时失败?尖锐分类读出中的非承诺性

Zhongyao Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文发现确定性少步生成在连续图像潜在变量上成功,但在连续文本潜在变量上崩溃为不连贯文本,原因是几何因素而非训练或缩放缺陷:平滑的确定性映射无法在尖锐分类读出前解决离散分支选择,失败由解码器尖锐度而非传输精度主导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15917 2026-07-01 cs.CV 版本更新

Making Image Editing Easier via Adaptive Task Reformulation with Agentic Executions

通过具有代理执行的自适应任务重构使图像编辑更易于实现

Bo Zhao, Kairui Guo, Runnan Du, Haiyang Sun, Pengshan Wang, Huan Yang, Kun Gai, Yixin Cao, Wei Ji

机构 * Nanjing University(南京大学) Beijing Institute of Technology(北京理工大学) College of Artificial Intelligence, China University of Petroleum (Beijing)(中国石油大学(北京)人工智能学院) Beijing University of Posts and Telecommunications(北京邮电大学) Fudan University(复旦大学)

AI总结 本文提出通过自适应任务重构框架提升图像编辑性能,通过代理分析和反馈优化任务描述,改进编辑效果,尤其在复杂案例中表现显著。

Comments 9pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09930 2026-07-01 cs.CV cs.IR 版本更新

Fine-grained Motion Retrieval via Joint-Angle Motion Images and Token-Patch Late Interaction

基于关节角度运动图像与令牌-补丁后期交互的细粒度运动检索

Yao Zhang, Zhuchenyang Liu, Yanlan He, Thomas Ploetz, Yu Xiao

机构 * Aalto University(阿尔托大学) Fudan University(复旦大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 提出一种可解释的关节角度运动表示,结合预训练视觉Transformer和令牌级后期交互机制,实现文本与3D运动之间的细粒度对齐,在HumanML3D和KIT-ML上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01356 2026-07-01 cs.LG cs.AI cs.CY 版本更新

Perturbation Effects on Robustness and Individual Fairness

扰动对相似个体间准确性和公平性的影响

Xuran Li, Hao Xue, Peng Wu, Xingjun Ma, Zhen Zhang, Huaming Chen, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Key Laboratory of System Software, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所系统软件重点实验室) Fudan University(复旦大学) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州先进研究所) The University of Sydney(悉尼大学)

AI总结 提出鲁棒个体公平性(RIF)概念,并开发黑盒对抗框架RIFair,通过解耦扰动策略暴露模型在语义保持扰动下同时存在的鲁棒性和公平性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10409 2026-07-01 cs.AR cs.AI 版本更新

Dataset Construction for Training LLM to Learn Analog Circuit Knowledge

用于训练大语言模型学习模拟电路知识的数据集构建

Zihao Chen, Ji Zhuang, Jinyi Shen, Xiaoyue Ke, Xinyi Yang, Mingjie Zhou, Zhuoyao Du, Xu Yan, Zhouyang Wu, Zhenyu Xu, Jiangli Huang, Li Shang, Xuan Zeng, Fan Yang

机构 * Fudan University(复旦大学)

AI总结 本文构建文本数据集并定制训练技术,使大语言模型学习模拟电路知识;通过多智能体框架生成结构化四元组,结合SFT与KL散度正则化提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏