arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

2026-07-01 至 2026-07-01 共收录 8
2606.31966 2026-07-01 cs.MA cs.AI cs.CL cs.CV 新提交

MECoBench: A Systematic Study of Multimodal Agent Collaboration in Embodied Environments

MECoBench:具身环境中多模态智能体协作的系统研究

Qingyun Liu, Jiwen Zhang, Jingyi Hu, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出MECoBench基准,通过多任务、多结构、多模式的实验,系统研究多模态大模型在具身环境中的协作机制,发现协作能提升任务完成度但需平衡收益与复杂度,通信是关键,且协作增强鲁棒性。

Comments Project website: https://q-i-n-g.github.io/MECoBench-Website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31836 2026-07-01 cs.RO 新提交

RoboTacDex: A Dexterous Visual-Tactile-Action Dataset for Humanoid Manipulation

RoboTacDex:用于人形机器人操作的灵巧视觉-触觉-动作数据集

Xinyi Wang, Donghan Li, Zi'Ang Chen, Chong Yu, Chen Xin, Peng Ye, Yingkai Sun, Tao Chen

机构 * Fudan University(复旦大学) ByteDance Intelligent Creation(字节跳动智能创作) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出RoboTacDex,一个包含6k轨迹、19个任务、23种技能和22个物体的大规模多模态灵巧操作数据集,基于Unitree G1人形机器人构建,提供多视角RGB-D、触觉反馈和语义标注,并评估了三种模仿学习模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31734 2026-07-01 cs.CV 新提交

MemLearner: Learning to Query Context memory for Video World Models

MemLearner: 学习查询上下文记忆用于视频世界模型

Jiwen Yu, Jianxiong Gao, Jianhong Bai, Yiran Qin, Kaiyi Huang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xihui Liu

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Kuaishou Technology(快手科技)

AI总结 提出基于学习的自适应上下文查询方法MemLearner,利用视频生成模型自身进行上下文记忆查询,解决视频世界模型在遮挡和动态场景下的场景一致性问题。

Comments ECCV 2026, Project Page: https://yujiwen.github.io/memlearner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31723 2026-07-01 cs.RO 新提交

UniTacVLA: Unified Tactile Understanding and Prediction in Vision Language Action Models

UniTacVLA:视觉语言动作模型中的统一触觉理解与预测

Xidong Zhang, Yichi Zhang, Jiaxin Shi, Fucai Zhu, Siyu Zhu, Michael Yu Wang, Xiaojun Wu, Weihao Yuan

机构 * Harbin Institute of Technology(哈尔滨工业大学) Great Bay University(大湾区大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Nanjing University(南京大学) Daimon Robotics

AI总结 提出统一触觉学习框架,通过触觉链式推理和由粗到细的未来触觉预测构建状态与动力学感知先验,并设计触觉-动作混合控制器,在接触丰富操作任务中提升成功率、精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31200 2026-07-01 cs.AI 新提交

Agentic RAG-VLM: Affordance-Aware Retrieval-Augmented Generation with Self-Reflective Planning for Robotic Grasping

Agentic RAG-VLM:基于自反规划与可操作性感知的检索增强生成在机器人抓取中的应用

Tao Chen, Lizheng Liu, Jiaxu Wang, Ziyue Jiang, Ruiqi Tian, JiGuang Huo, Zhongxue Gan

机构 * Fudan University(复旦大学) Kean University(肯恩大学)

AI总结 提出Agentic RAG-VLM框架,通过可操作性感知检索、场景图推理和自反规划,在杂乱环境中实现鲁棒抓取,成功率78.3%,比纯VLM基线提升53.3个百分点。

Comments 8 pages,5 figures,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31171 2026-07-01 cs.AI cs.ET 新提交

Cross-Domain Feature Expansion for Tabular Medical Data via Knowledge Graphs Injection

通过知识图谱注入的表格医疗数据跨域特征扩展

Mengying Zhou, Yongjie Yin, Haoyan Xin, Guoping Liu, Yang Chen

机构 * School of Computing and Artificial Intelligence, Shanghai University of Finance and Economics(上海财经大学计算机与人工智能学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学技术学院) Independent Researcher(独立研究者) School of Basic Medical Sciences, Shanghai University of Traditional Chinese Medicine and Pharmacology(上海中医药大学基础医学院)

AI总结 提出MedKGTab框架,利用知识图谱和注意力机制从现有特征推断未收集的生物医学特征,实现跨域特征扩展,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30814 2026-07-01 cs.CL 新提交

When Calibration Rankings Reverse: Accuracy-Controlled Evaluation for Fair Comparison of LLMs

当校准排名反转:面向LLM公平比较的精度控制评估框架

Zhichao Yang, Caiqi Zhang, Ruihan Yang, Chengzu Li, Nigel Collier, Deqing Yang

机构 * Fudan University(复旦大学) University of Cambridge(剑桥大学)

AI总结 针对全局校准指标因模型精度差异导致比较不公平的问题,提出ACE精度控制评估框架,通过实例对齐、分布对齐和候选对齐三种视角实现公平比较,发现原始指标下的优势在控制精度后大幅减弱,排名反转频繁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30705 2026-07-01 cs.LG cs.AI 新提交

Why Do Few-Step Text Latents Fail When Image Latents Work? Non-Commitment at Sharp Categorical Readouts

为什么少步文本潜在变量在图像潜在变量有效时失败?尖锐分类读出中的非承诺性

Zhongyao Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文发现确定性少步生成在连续图像潜在变量上成功,但在连续文本潜在变量上崩溃为不连贯文本,原因是几何因素而非训练或缩放缺陷:平滑的确定性映射无法在尖锐分类读出前解决离散分支选择,失败由解码器尖锐度而非传输精度主导。

详情

展开后加载摘要…

URL PDF HTML 收藏