arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

2026-07-14 至 2026-07-14 共收录 12
2607.11427 2026-07-14 cs.RO 新提交

EDAR: Learning Environment-Dependent Action Representations for Robotic Manipulation

EDAR:学习用于机器人操作的环境相关动作表示

Yuecheng Xu, Tong Yang, Jingkai Jia, Chi Zhang, Xuelong Li, Wenqiang Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院智能信息处理上海市重点实验室) TeleAI, China Telecom(中国电信天翼人工智能公司)

AI总结 研究针对机器人操作中动作表示难的问题,提出EDAR方法,将动作令牌与可执行控制结构和预期视觉后果关联,通过实验证明该方法能改善下游策略学习,突出环境相关动作表示的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11042 2026-07-14 cs.SE cs.AI 新提交

BackendForge: Benchmarking Agentic End-to-End Code Generation with Backend Services

BackendForge:使用后端服务对智能端到端代码生成进行基准测试

Yuzhe Guo, Mengzhou Wu, Yuan Cao, Jialei Wei, Dezhi Ran, Wei Yang, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(北京大学计算机科学与技术国家重点实验室;软件学院,北京大学) SCS, Peking University(北京通明湖信息技术应用创新中心) Beijing Tongming Lake Information Technology Application Innovation Center (TLAIC)(复旦大学高级计算系统研究所) Fudan University Institute of Systems for Advanced Computing(上海开放计算系统研究所) Shanghai Institute of Systems for Open Computing

AI总结 研究智能端到端代码生成评估问题,引入BackendForge基准,给定规范和契约让大语言模型生成容器化服务,用测试和代码代理共同进化测试预言机和参考服务,发现当前大语言模型虽能实现部分API行为,但生成完整后端服务仍有困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11027 2026-07-14 cs.RO 新提交

SegDiff: Segmented Trajectory Diffusion for Consistent and Adaptive Robot Manipulation

SegDiff:用于一致且自适应机器人操作的分段轨迹扩散

Haidong Cao, Wenjun Cao, Quanhao Li, Sicheng Xie, Zhiying Du, Jiaqi Leng, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University, China(可信具身人工智能研究院,复旦大学,中国) Shanghai Key Laboratory of Multimodal Embodied AI, China(上海多模态具身人工智能重点实验室,中国)

AI总结 研究针对机器人模仿学习中现有方法的不足,提出SegDiff闭环视觉运动策略,分解示范为运动段并预测连续轨迹,利用扩散模型等提出动态时间集成机制,在多场景中性能优于现有方法,能处理长时间依赖并保持实时适应与控制稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10263 2026-07-14 cs.LG 新提交

Sharper Analysis of Single-Loop Methods for Bilevel Optimization

双层优化单环方法的更精确分析

Yubo Zhou, Jun Shu, Luo Luo, Junmin Liu, Deyu Meng, Guang Dai, Haishan Ye

机构 * School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院) School of Data Science, Fudan University(复旦大学数据科学学院) SGIT AI Lab, State Grid Corporation of China(国家电网公司SGIT人工智能实验室) Center for Intelligent Decision-Making and Machine Learning, School of Management, Xi’an Jiaotong University(西安交通大学管理学院智能决策与机器学习中心)

AI总结 研究双层优化中理论与实际单环实现的差距,利用解耦范数分析框架,改进单环近似隐式微分和迭代微分方法的收敛结果,提升收敛速率并精确匹配渐近误差下界,经实验验证理论发现。

Comments 26 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09773 2026-07-14 cs.AI cs.CL cs.LG 新提交

EvoCUA-1.5: Online Reinforcement Learning for Multi-turn Computer-Use Agents

EvoCUA-1.5:用于多轮计算机使用智能体的在线强化学习

Mianqiu Huang, Taofeng Xue, Chong Peng, Jinrui Ding, Sicheng Fan, Jiale Hong, Yufei Gao, Xiaocheng Zhang, Linsen Guo, Xin Yang, Dengchang Zhao, Yuchen Xie, Peng Pei, Xunliang Xie, Xipeng Qiu

机构 * Meituan(美团) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 研究多轮计算机使用智能体的在线强化学习问题,提出EvoCUA-1.5,通过STEPO、DTAC等方法应对多轮交互挑战,经实验验证其提高了训练稳定性和下游性能,为在线强化学习提供实用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10295 2026-07-14 physics.optics cs.AI 新提交

Program-Synthesis-Driven Autodesign of Universal Unitary Operators

程序合成驱动的通用酉算子自动设计

Yifei Zhang, Dong Chen, Fan Wang, Wenrui Zhang, Yan Chen, Dingding Han, Jianmin Yuan, Xiangjin Kong, Yu-Gang Ma

机构 * Key Laboratory of Nuclear Physics and Ion-beam Application (MOE), Institute of Modern Physics, Fudan University, Shanghai 200433, China(核物理与离子束应用重点实验室(教育部),现代物理研究所,复旦大学,上海200433,中国) Research Center for Theoretical Nuclear Physics, NSFC and Fudan University, Shanghai 200438, China(理论核物理研究中心,国家自然科学基金委员会和复旦大学,上海200438,中国) Huawei Technologies Co., Ltd, Beijing 100095, China(华为技术有限公司,北京100095,中国) Department of Industrial Engineering and Decision Analytics, Hong Kong University of Science and Technology, HongKong, China(工业工程与决策分析系,香港科技大学,香港,中国) Hunan Key Laboratory of Mechanism and Technology of Quantum Information, Changsha 410073, China(湖南量子信息机制与技术重点实验室,长沙410073,中国) School of Information Science and Technology, Fudan University, Shanghai 200433, China(信息科学与技术学院,复旦大学,上海200433,中国) Research Institute of Intelligent Complex Systems, Fudan University, Shanghai 200433, China(智能复杂系统研究所,复旦大学,上海200433,中国) Institute of Atomic and Molecular Physics, Jilin University, Changchun 130012, China(原子与分子物理研究所,吉林大学,长春130012,中国) School of Physics, East China Normal University, Shanghai 200062, China(物理学院,华东师范大学,上海200062,中国)

AI总结 研究利用人工智能驱动的程序合成,通过扩展DreamCoder到复值线性代数,发现光子网络中酉矩阵分解策略,其生成的程序编码与维度无关的不变量及构造规则,还能利用矩阵结构减少干涉仪数量,为酉算子自动设计提供可扩展范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07032 2026-07-14 cs.LG stat.ML 版本更新

Eigenbasis-Independent Learnable Spectral Positional Encodings for Directed Graphs via Hermitian Block Krylov Subspaces

通过厄米特块克里洛夫子空间实现有向图的规范不变可学习谱位置编码

Jiaqing Xie, Yuxin Wang

机构 * Fudan University(复旦大学)

AI总结 研究有向图谱位置编码面临的障碍,提出可学习谱PEs形式\(h_\theta(A_q)\,R\),通过厄米特块克里洛夫子空间计算,证明其规范不变性及相关性质,在有向SBM等实验中展现优势,优于无PE和多项式基线。

Comments 8 pages main, theorem and type fixed

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05716 2026-07-14 cs.CV 版本更新

Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models

场景图思维:增强多模态大语言模型的结构化视觉推理

Zhiwei Yang, Yuanchen Wu, Nan Zhang, Yucong Meng, Ke Yan, Shouhong Ding

机构 * Fudan University(复旦大学)

AI总结 针对多模态大语言模型忽视结构化关系的问题,提出场景图思维(SaGe)范式,通过自动数据引擎转换数据、构建训练数据,采用两阶段图对齐训练范式,在多模态基准测试中取得显著改进,提升细粒度感知和推理能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31651 2026-07-14 cs.AI 版本更新

FARS: A Fully Automated Research System Deployed at Scale

FARS:一个大规模部署的全自动研究系统

Qiong Tang, Tianxiang Sun, Xiangkun Hu, Xiangyang Liu, Yiran Chen, Yunfan Shao, Bobo Li, Changze Lv, Cheng Xu, Chengsong Huang, Chunyang Li, Dizhan Xue, Hao Bai, Haodong Duan, Hengquan Guo, Hongyang He, Hongyi Chen, Hui Shen, Jiahao Yuan, Jiankai Sun, Jikang Cheng, Jinfeng Xu, Jingqi Tong, Jingye Chen, Jinxiu Liu, Jixuan Leng, Junchi Yu, Kaixun Jiang, Kun Xiang, Kunpeng Yao, Lang Feng, Liangqi Yuan, Longsen Gao, Meng Li, Qi Jia, Qiushi Sun, Shengyuan Ding, Shizhan Gong, Siru Zhong, Terry Jingchen Zhang, Tianle Gu, Tianyi Liang, Weijie Liu, Weikai Yang, Weizhi Fei, Xin Wang, Xinpeng Liu, Xuanwen Ding, Yihong Tang, Yuanli Wang, Yukun Jiang, Yuming Yang, Zhengbao He, Zhikai Chen, Zhikun Xu, Zhuang Li, Zihao Huang

机构 * Analemma National University of Singapore(新加坡国立大学) Fudan University(复旦大学) University College Dublin(都柏林大学) Washington University in St. Louis(圣路易斯华盛顿大学) The Hong Kong University of Science and Technology(香港科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ByteDance(字节跳动) ShanghaiTech University(上海科技大学) University of Warwick(华威大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) East China Normal University(华东师范大学) Stanford University(斯坦福大学) Tencent(腾讯) The University of Hong Kong(香港大学) Shanghai Innovation Institute(上海创新研究院) Nex-AGI Team(Nex-AGI团队)

AI总结 提出FARS系统,通过分阶段智能体协作自动生成研究项目,在67个AI/ML主题上产出166篇论文,经282份评审验证其可产出有价值成果,同时暴露实验范围窄、方法局限和诚信问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05737 2026-07-14 cs.CV cs.AI cs.LG cs.RO 版本更新

Let It Be Simple: One-Step Action Generation for Vision-Language-Action Models

让它简单:视觉-语言-动作模型的单步动作生成

Yitong Chen, Shiduo Zhang, Jingjing Gong, Xipeng Qiu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

AI总结 针对视觉-语言-动作(VLA)模型,提出通过偏置训练时间分布至高频噪声状态,实现无需教师模型、蒸馏或辅助目标的单步动作生成,性能可匹配十步解码。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16514 2026-07-14 cs.CV cs.LG 版本更新

BARD: Bridging AutoRegressive and Diffusion Vision-Language Models Via Highly Efficient Progressive Block Merging and Stage-Wise Distillation

BARD:通过高效渐进性块合并和分阶段蒸馏桥接自回归与扩散视觉-语言模型

Baoyou Chen, Hanchen Xia, Peng Tu, Haojun Shi, Liwei Zhang, Yuxuan Yao, Weihao Yuan, Siyu Zhu

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Nanjing University(南京大学)

AI总结 BARD通过高效渐进块合并与分阶段蒸馏将预训练自回归视觉-语言模型转换为解码高效的扩散视觉-语言模型,实现在大块规模下性能恢复与解码效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21095 2026-07-14 cs.CV 版本更新

UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters

UniRec-0.1B:具有1亿参数的统一文本和公式识别

Yongkun Du, Zhineng Chen, Yazhen Xie, Weikang Bai, Hao Feng, Wei Shi, Yuchen Su, Can Huang, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

AI总结 研究旨在实现文本和公式的统一识别,提出含1亿参数的UniRec-0.1B模型。通过构建大规模数据集,应对层次结构变异性和语义纠缠等挑战,引入分层监督训练和语义解耦分词器。实验证明该模型优于同类,且速度大幅提升,有效且高效。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏