arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

共收录 1917
2512.21095 2026-07-14 cs.CV 版本更新

UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters

UniRec-0.1B:具有1亿参数的统一文本和公式识别

Yongkun Du, Zhineng Chen, Yazhen Xie, Weikang Bai, Hao Feng, Wei Shi, Yuchen Su, Can Huang, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

AI总结 研究旨在实现文本和公式的统一识别,提出含1亿参数的UniRec-0.1B模型。通过构建大规模数据集,应对层次结构变异性和语义纠缠等挑战,引入分层监督训练和语义解耦分词器。实验证明该模型优于同类,且速度大幅提升,有效且高效。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09456 2026-07-13 cs.LG 新提交

Active rejection enables reliable generalization of universal machine-learning interatomic potentials

主动拒绝可实现通用机器学习原子间势的可靠泛化

Mingxiang Luo, Xinnan Mao, Lu Wang, Lei Bai, Feng Ding, Yuqiang Li

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Suzhou Laboratory(苏州实验室)

AI总结 研究针对通用机器学习原子间势训练数据集受限问题,提出自适应多教师路由方法,通过校准预训练教师、估计结构-教师对可靠性来生成伪标签,提升模型性能和动力学鲁棒性,有效构建高保真uMLIPs数据系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09225 2026-07-13 cs.CV 新提交

Glob3R: Global Structure-from-Motion with 3D Foundation Models

Glob3R:基于3D基础模型的全局运动恢复结构

Junyuan Deng, Heng Li, Kejie Qiu, Lingteng Qiu, Rui Peng, Weichao Shen, Weihao Yuan, Siyu Zhu, Zilong Dong, Ping Tan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Nanjing University(南京大学) Fudan University(复旦大学)

AI总结 研究针对3D基础模型重建结果不准确及处理长序列或大图像集有缺陷的问题,提出Glob3R方法,通过增强主干、转换扭曲为特征轨迹、引入关联策略及进行全局优化等,实现强大准确重建,提升神经渲染质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01317 2026-07-13 quant-ph cond-mat.dis-nn cs.AI 版本更新

Data-Driven Learnability Transition of Measurement-Induced Entanglement

测量诱导纠缠的数据驱动可学习性转变

Dongheng Qian, Jing Wang

机构 * State Key Laboratory of Surface Physics(表面物理国家重点实验室) Department of Physics, Fudan University, Shanghai 200433, China(复旦大学物理系) Shanghai Research Center for Quantum Sciences, Shanghai 201315, China(上海量子科学研究中心) Institute for Nanoelectronic Devices(纳米电子器件研究所) Quantum Computing, Fudan University, Shanghai 200433, China(量子计算,复旦大学) Hefei National Laboratory, Hefei 230088, China(合肥国家实验室)

AI总结 研究测量诱导纠缠(MIE)的可学习性,将其检测重构为数据驱动学习问题,用测量记录自监督训练神经网络预测MIE不确定性度量,发现随机电路中随深度增加的可学习性转变及与经典模拟崩溃的关系,划定经典可学习性限制。

Comments 7+13 pages, 4+12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08688 2026-07-10 cs.CV 新提交

SAM-MT: Real-Time Interactive Multi-Target Video Segmentation

SAM-MT:实时交互式多目标视频分割

Ruiqi Shen, Chang Liu, Henghui Ding

机构 * Fudan University(复旦大学) Shanghai University of Finance and Economics(上海财经大学)

AI总结 研究针对多目标视频分割中帧率随目标数增加而降低的问题,基于SAM2提出SAM-MT。通过显式查询、解耦掩码注意力等方法,实现延迟与目标数解耦,保持分割性能,达到与单目标基线相当的实时速度。

Comments ECCV 2026, Project Page: https://henghuiding.com/SAM-MT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20899 2026-07-10 cond-mat.mtrl-sci cs.AI 版本更新

Predicting Scale-Up of Metal-Organic Framework Syntheses with Large Language Models

利用大语言模型预测金属有机框架合成的可扩展性

Peter Walther, Hongrui Sheng, Xinxin Liu, Bin Feng, Reid Coyle, Xinhua Yan, Kyle Smith, Harrison Kayal, Shyam Chand Pal, Zhiling Zheng

机构 * Department of Chemistry, Washington University(华盛顿大学化学系) Fudan University(复旦大学) Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) College of Chemistry and Materials Science, Fujian Normal University(福建师范大学化学与材料科学学院) Institute of Materials Science & Engineering, Washington University(华盛顿大学材料科学与工程学院)

AI总结 本文提出ESU-MOF数据集和正例未标记学习策略,通过大语言模型预测MOF合成的可扩展性,准确率达91.4%,助力工业级MOF发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01560 2026-07-10 cs.CV 版本更新

XOV-Action: Towards Generalizable Open-Vocabulary Action Recognition

XOV-Action:迈向可泛化的开放词汇动作识别

Kun-Yu Lin, Henghui Ding, Jia-Run Du, Jiaming Zhou, Yi-Xing Peng, Yu-Ming Tang, Zhilin Zhao, Chen Change Loy, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Institute of Big Data, Fudan University(复旦大学大数据研究院) AI Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能方向) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)

AI总结 研究针对开放词汇动作识别模型泛化性不足的问题,提出XOV-Action模型,通过学习多样化表示和场景无关表示克服两大挑战,还构建XOVABench基准,实验证明该模型能有效提升跨视频领域的动作识别性能。

Comments Accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07708 2026-07-09 cs.CL cs.AI cs.CE cs.LG 新提交

Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning

通过深度原生结构推理实现准确、跨学科和透明的结构-属性理解

Chen Tang, Yizhou Wang, Jianyu Wu, Lintao Wang, Shixiang Tang, Pengze Li, Encheng Su, Jun Yao, Jiabei Xiao, Yuqi Shi, Jielan Li, Hongxia Hao, Zhangyang Gao, Fang Wu, Ben Fei, Xiangyu Yue, Pan Tan, Bozitao Zhong, Jinouwen Zhang, Aoran Wang, Yan Lu, Jiaheng Liu, Xinzhu Ma, Liang Hong, Mingyue Zheng, Phil Torr, Bowen Zhou, Wanli Ouyang, Lei Bai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) University of Sydney(悉尼大学) Nanjing University(南京大学) University of Oxford(牛津大学) The University of Science and Technology of China(中国科学技术大学) Drug Discovery and Design Center, State Key Laboratory of Drug Research, Shanghai Institute of Materia Medica, Chinese Academy of Sciences(药物发现与设计中心、国家药物研究重点实验室、上海中医药材料医学研究所、中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Stanford University(斯坦福大学)

AI总结 研究聚焦利用人工智能解释结构-属性关系的挑战,提出多模态科学基础模型SciReasoner,通过离散化结构信息为可寻址单元进行推理,在多领域基准测试中表现出色,实现准确预测与可解释科学推理的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07401 2026-07-09 cs.CV cs.AI cs.LG 新提交

Heterogeneity-Adaptive Diffusion Schrodinger Bridge for PET-Guided Whole-Body MRI Translation

用于PET引导的全身MRI转换的异质性自适应扩散薛定谔桥

Chengbo Wang, Jiacheng Yu, Linjie Bian, Ming Qi, Xiaosheng Liu, Tongtong Che, Jichang Zhang, Shuyu Li, Shaoli Song, Xiuying Wang

机构 * The University of Sydney(悉尼大学) Fudan University Shanghai Cancer Center(复旦大学附属上海肿瘤医院) Beijing Normal University(北京师范大学)

AI总结 针对PET-MR扫描时间长的问题,提出异质性自适应扩散薛定谔桥(HA-DSB)框架,通过整合视觉语言模型嵌入及PET先验,利用双阶段引导机制,实现全身MRI转换,提升不同区域尤其是病变区域的转换质量。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07103 2026-07-09 cs.LG cs.DB 新提交

A knowledge-augmented dataset of high-risk driving scenarios with LLM annotations for autonomous driving

一个用于自动驾驶的具有大语言模型注释的高风险驾驶场景知识增强数据集

Heye Huang, Jingguang Li, Zhiyuan Zhou, Paul Liang, Mingyu Wu, Kitae Jang, Jianqiang Wang

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Fudan University(复旦大学) Massachusetts Institute of Technology(麻省理工学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 研究自动驾驶中高风险场景数据不足问题,核心方法是构建K-Risk数据集,整合多源轨迹数据并利用大语言模型生成注释,主要贡献是为自动驾驶开发和评估提供标准化基础。

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04653 2026-07-09 cs.CV 新提交

Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising

通过角色感知联合训练和模态解耦去噪增强视频物理一致性

Guangting Zheng, Haojing Chen, Hao Li, Jingtao Zhang, Zhen Yang, Xiaosong Jia, Xue Yang, Shaofeng Zhang, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) University of Electronic Science and Technology of China(电子科技大学) Fudan University(复旦大学) Georgia Institute of Technology(佐治亚理工学院) Shanghai Jiao Tong University(上海交通大学)

AI总结 研究针对视频扩散模型长程物理一致性挑战,提出VPT微调框架。通过角色感知信号清晰建模不同物理角色,采用模态解耦去噪策略及损失权重衰减,引入跨步自动引导,增强物理动力学,提升物理一致性与视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05693 2026-07-09 cs.RO cs.AI 版本更新

HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies

HiMoE-VLA:用于通用视觉-语言-动作策略的分层专家混合模型

Zhiying Du, Bei Liu, Yaobo Liang, Yichao Shen, Haidong Cao, Xiangyu Zheng, Zhiyuan Feng, Zuxuan Wu, Jiaolong Yang, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Xi’an Jiaotong University(西安交通大学) Tsinghua University(清华大学)

AI总结 研究通用视觉-语言-动作策略训练中异构性引发的负迁移问题,提出HiMoE-VLA框架,通过分层专家混合动作模块及两个辅助目标来解决,在多项任务上取得较好结果,还能将负迁移转化为正迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24108 2026-07-09 cs.RO cs.CV 版本更新

Zero-Human Demonstration End-to-end Autonomous Driving with Trajectory Scorer

基于轨迹评分器的零人类示范端到端自动驾驶

Zhenxin Li, Nadine Chang, Wenhao Yao, Xinglong Sun, Zi Wang, Maying Shen, Jingde Chen, Jingyu Song, Kailin Li, Zuxuan Wu, Shiyi Lan, Jose M. Alvarez

机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究所) Fudan University(复旦大学) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) NVIDIA University of Michigan(密歇根大学) East China Normal University(华东师范大学)

AI总结 研究提出ZTRS,一种基于强化学习的端到端自动驾驶规划范式,仅依靠真实世界图像和规则奖励训练,无需人类示范。通过详尽策略优化,能更好推广到长尾驾驶场景,在相关数据集上展现出优于模仿学习方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06516 2026-07-08 cs.CV 新提交

Point as Skeleton: Accumulated Point Cloud Enhanced Autoregressive Generation for Closed-Loop Autonomous Driving Simulation

点作为骨架:累积点云增强自回归生成用于闭环自动驾驶模拟

Songbur Wong, Xiaosong Jia, Junqi You, Bo Zhang, Pei Xu, Renqiu Xia, Yuping Qiu, Shaofeng Zhang, Zelin Zhao, Xuechao Yan, Yuchen Zhou, Yurui Chen, Wen Guo, Hang Xu, Junchi Yan

机构 * Shanghai Jiao Tong University(上海交通大学) Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 针对自动驾驶模拟难题,提出“点作为骨架”框架,通过自回归生成器结合多种条件合成视频,引入Reset-and-Roll支持闭环,用点云骨架稳定误差,实现基于nuPlan的闭环生成接口,实验证明其提升了闭环自回归生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06323 2026-07-08 cs.RO 新提交

LAMP: Latent Motion Prior-Guided Real-World Learning for Dexterous Hand Manipulation

LAMP:用于灵巧手部操作的潜在运动先验引导的现实世界学习

Xinye Yang, Zhiyuan Ma, Hongze Yu, Yuanpei Chen, Yaodong Yang, Xiaojie Chai, Xinlei Chen, Chao Yu

机构 * Fudan University(复旦大学) Tsinghua University(清华大学) Peking University(北京大学) PsiBot

AI总结 研究针对灵巧手部现实世界学习易出错的问题,提出含潜在运动先验模块的三阶段学习框架LAMP,先预训练模块,再训练视觉运动策略并通过在线残差RL改进,在真实机器人任务中取得高成功率,提升了学习效果。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06238 2026-07-08 cs.CV 新提交

PhyMRI-SR: Toward Physics-Aware MRI Image Super-Resolution

PhyMRI-SR:迈向基于物理感知的MRI图像超分辨率

Lihua Wei, Huatong Gao, Jia Gong, Zhiyu Tan, Hao Li, Jun Liu, Zhihua Ren

机构 * School of Biomedical Engineering, ShanghaiTech University(上海科技大学生物医学工程学院) Shanghai Academy of AI for Science(上海人工智能研究院) Fudan University(复旦大学) School of Computing and Communications, Lancaster University(兰卡斯特大学计算与通信学院) School of Biomedical Engineering & State Key Laboratory of Advanced Medical Materials and Devices, ShanghaiTech University(上海科技大学生物医学工程学院与先进医学材料与器械国家重点实验室) Shanghai Clinical Research and Trial Center(上海临床研究与试验中心)

AI总结 研究旨在解决MRI图像超分辨率问题,将其视为物理感知重建问题。核心方法是采用2D高斯点渲染并引入三项创新,包括先验感知高斯表示、物理约束信号建模和元学习框架。主要贡献是在动态分辨率数据集和标准基准上实现领先性能,有临床部署潜力。

Comments Project Page: https://bio-med-i2-lab.github.io/projects/PhyMRI-SR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06120 2026-07-08 cs.CV 新提交

AEGIS: A Mechanism-Guided Defense against Visual Synonym Jailbreaks in Text-to-Image Models

AEGIS:一种针对文本到图像模型中视觉同义词越狱的机制引导防御

Yuanmin Huang, Zhenfei Zhang, Mi Zhang, Geng Hong, Qinqin He, Jialing Tao, Hui Xue, Min Yang

机构 * Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Shanghai Pudong Research Institute of Cryptology(上海浦东密码研究所) Engineering Research Center of Cyber Security Auditing and Monitoring, Ministry of Education(教育部网络安全审计与监测工程研究中心)

AI总结 研究针对文本到图像模型中视觉同义词越狱问题,提出AEGIS防御机制,通过动态追踪不安全语义生成过程,利用稀疏语义注入注意力头,在推理时仅对易受攻击头部应用相似性感知排斥,提升了模型安全与效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05910 2026-07-08 cs.CV cs.AI cs.CL 新提交

PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails

PolicyShiftGuard:基准测试与改进策略自适应图像护栏

Mingyang Song, Luxin Xu, Haoyu Sun, Minzhou Pan, Yu Cheng, Bo Li

机构 * Fudan University(复旦大学) Tongji University(同济大学) Virtue AI(美德人工智能公司) The Chinese University of Hong Kong(香港中文大学) University of Chicago(芝加哥大学) University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 研究策略自适应图像护栏问题,提出PolicyShiftGuard方法,结合随机策略SFT和边界对策略适应进行两阶段训练,在PolicyShiftBench基准测试中显著提升性能,消融实验验证关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05804 2026-07-08 cs.AI cs.CL 新提交

TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training

TurnOPD:使在线策略蒸馏具有转向意识以实现高效的长期智能体训练

Yuhang Zhou, Kai Zheng, Haoling Li, Dengyun Peng, Can Xu, Jingjing Chen

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯文言)

AI总结 研究针对在线策略蒸馏在长期智能体任务应用不足的问题,提出TurnOPD,通过自适应展开深度预算和渐进式转向归一化损失预算两个策略,在多任务实验中实现更高验证准确率,超越普通OPD,推进了准确率-时间前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03863 2026-07-08 cs.CL 新提交

Rethinking Scientific Discovery in the Agentic Era

在智能时代重新思考科学发现

Yining Zheng, Yuxin Wang, Jiahao Lu, Shicheng Fang, Weiyi Wang, Yongzhuo Yang, Bowen Li, Haochen Ma, Chen Hu, Bowen Chen, Yang Wang, Huanhui Chen, Yitong Chen, Jiajun Chen, Zhiyuan Li, Yanlin Li, Zhuo Yang, Qifeng Wu, Jiaying He, Zhijie Jinluo, Xiaohu Xu, Yi Feng, Juncheng Qian, Yizhou Chen, Yang Cheng, Tong Zhu, Tianlei Ying, Hongyu Yu, Hongjun Xiang, Xipeng Qiu

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) East China Normal University(华东师范大学)

AI总结 研究提出智能科学操作系统SCION,以科学智能体为元工具连接科研要素,核心是研究执行计划,集成多种方法支持长期科研工作,经实验验证其在多方面优于现有基线,推动AI成为可溯源、可复用的科研创新协调操作层。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19710 2026-07-08 cs.CV cs.LG cs.RO 版本更新

PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies

面向通用视觉-语言-动作策略的通用姿态预训练

Haitao Lin, Hanyang Yu, Jingshun Huang, He Zhang, Yonggen Ling, Ping Tan, Xiangyang Xue, Yanwei Fu

机构 * Tencent Robotics X(腾讯机器人X) Futian Laboratory(福田实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出Pose-VLA,通过分离预训练和后训练阶段,解决视觉-语言-动作模型中的特征坍塌和训练效率问题,实现通用3D空间先验提取与机器人特定动作空间的高效对齐。

Comments Accepted to Robotics: Science and Systems (RSS) 2026. Project website: https://hetolin.github.io/PoseVLA

Journal ref Robotics: Science and Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02576 2026-07-07 stat.ML cs.LG 新提交

CORA: Per-Slice Coherent Orthogonal Rotation for SVD-based Low-Rank Adaptation

CORA:基于切片的相干正交旋转,用于基于SVD的低秩适配

Pengcheng Wang, Ziran Liu, Wei Wang, Wei Jiang

机构 * Purdue University(普渡大学) Shanghai Institute for Mathematics and Interdisciplinary Sciences / Fudan University(上海数学与交叉科学研究院 / 复旦大学) Futurewei Technologies, Inc.(未来科技有限公司)

AI总结 针对现有基于SVD的PEFT方法未保留预训练奇异基耦合几何的问题,提出逐切片相干正交旋转适配方法CORA,参数量远低于同类方法,在常识推理、代码生成任务上性能更优。

Comments 13 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05174 2026-07-07 cs.AI 新提交

AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments

AgentGym2:在去理想化真实世界环境中评测大语言模型智能体

Zhiheng Xi, Dingwen Yang, Jiaqi Liu, Jixuan Huang, Honglin Guo, Baodai Huang, Tinggang Chen, Qi Zhang, Zhonghang Lu, Chenyu Liu, Jiajun Sun, Jiazheng Zhang, Dingwei Zhu, Xin Guo, Junzhe Wang, Zhihao Zhang, Yuming Yang, Junjie Ye, Minghe Gao, Dongrui Liu, Jiaming Ji, Guohao Li, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghaijiaotong University(上海交通大学) Peking University(北京大学)

AI总结 针对现有LLM智能体基准过于理想化的问题,提出去理想化评测框架AgentGym2,可全面测查智能体实操能力,实验显示当前SOTA模型仍存在明显性能缺口。

Comments Accepted as a main conference paper at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04718 2026-07-07 cs.AI 新提交

FORGE: Research-Trajectory Hijacking Attacks on Deep Research Agents

FORGE:对深度研究智能体的研究轨迹劫持攻击

Yue Pan, Ziheng Zhang, Junxiang Lei, Changhao Jia, Qingyi Si, Hongcheng Guo

机构 * Fudan University(复旦大学) Huazhong University of Science and Technology(华中科技大学) Explore Academy, JD(京东探索研究院)

AI总结 研究针对深度研究智能体,利用其工作流程中的规划层中毒面,提出FORGE两级攻击劫持子任务规划,还引入PRISM指标和Root Query Anchoring防御,展示攻击效果及防御作用。

Comments 20 pages,8 figures,Code available at https://github.com/yvepan/FORGE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04144 2026-07-07 cs.RO 新提交

Semantic-Guided Progressive Object Removal with Gaussian Splatting

基于高斯点云的语义引导渐进式物体移除

Xianliang Huang, Chen Xiao, Yuanxiang Ni, Guanming Liu, Mingkai Liu, Dikai Fan, Xiao Liu, Hao Zhang

机构 * PICO, ByteDance Inc.(字节跳动公司PICO) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Fudan University(复旦大学)

AI总结 提出结合语义引导块匹配与区域渐进式细化的框架用于3D物体移除。利用DINOv2编码语义指导,通过RPR策略分区域优化,基于高斯点云实现高效重建,在物体移除上性能优于现有高斯方法。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03792 2026-07-07 cs.RO cs.CV 新提交

From Region Arrival to Instance-Level Grounding in Vision-and-Language Navigation

从视觉语言导航中的区域到达到实例级定位

Xiangyu Shi, Ruoxi Yang, Wei Tao, Jiwen Zhang, Yanyuan Qiao, Qi Wu

机构 * Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) Ruyi Dynamics(如意动力) Fudan University(复旦大学) Swiss Federal Institute of Technology Lausanne (EPFL)(瑞士洛桑联邦理工学院)

AI总结 研究视觉语言导航中当前评估协议局限,提出‘最后3米定位差距’及指标,构建REALM模块和REVERIE - AIM数据集,可减少过早终止,提升定位精度和视觉定位成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03693 2026-07-07 cs.RO 新提交

CoRE-VLA: Towards Scalable and Robust Vision-Language-Action Modeling via Conditional Routing of Experts

CoRE-VLA:通过专家的条件路由实现可扩展且稳健的视觉-语言-动作建模

Haozhe Zhang, Sixian Li, Yifei Zhang, Zezheng Huai, Hao Chen, Chunhua Shen, Jingjing Gong, Xipeng Qiu

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Nanjing University(南京大学) Jilin University(吉林大学)

AI总结 研究视觉-语言-动作模型在实际部署中的挑战,提出CoRE-VLA框架,通过上下文条件稀疏计算生成动作,利用传感器可用性和任务意图进行专家路由,实验证明其在多任务等方面表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03524 2026-07-07 cs.CV 新提交

Perceptual Flow Matching for Few-Step Generative Modeling

用于少步生成建模的感知流匹配

Chuyang Zhao, Yifei Song, Hongfa Wang, Jianlong Yuan, Yuan Zhang, Siming Fu, Zhineng Chen, Huilin Deng, Haoyang Huang, Nan Duan

机构 * Joy Future Academy(京东探索研究院) Fudan University(复旦大学) Tsinghua University(清华大学) USTC(中国科学技术大学)

AI总结 提出感知流匹配框架,在感知特征空间监督流匹配,改进少步生成能力,减少采样步骤,无需教师模型和辅助分数网络,实验表明其能产生高质量结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03449 2026-07-07 cs.RO cs.AI 新提交

HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control

HiMe:用于长距离视觉-语言-动作控制的分层具身记忆

Li Ji, Siyin Wang, Pengfang Qian, Xiaopeng Yu, Yihai Tian, Zhaoye Fei, Jingjing Gong, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) East China Normal University(华东师范大学)

AI总结 针对视觉-语言-动作模型处理非马尔可夫任务的不足,提出HiMe分层具身记忆框架,解耦智能为高频执行器等,引入动态知识系统,平衡实时执行与思考规划冲突,提升长距离任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03180 2026-07-07 cs.CV 新提交

FairFlow: Demystifying and Mitigating Stereotype Bias in Text-to-Image Diffusion Transformers

FairFlow:揭开文本到图像扩散变换器中刻板印象偏差的面纱并减轻其影响

Chen Chen, Yuanmin Huang, Zhenfei Zhang, Mi Zhang, Xiaohan Zhang, Yun Xiong, Xiaoyu You, Min Yang

机构 * Fudan University(复旦大学) East China University of Science and Technology(华东理工大学)

AI总结 研究文本到图像扩散变换器中刻板印象偏差问题,通过机理分析找到偏差根源,提出FairFlow框架,能有效中和刻板印象偏差,实现公平与保真平衡,且推理开销小、对复杂提示鲁棒。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏