arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

2026-06-30 至 2026-06-30 共收录 21
2606.30421 2026-06-30 cs.CV

OWMDrive: Causality-Aware End-to-End Autonomous Driving via 4D Occupancy World Model

OWMDrive: 基于4D占用世界模型的因果感知端到端自动驾驶

Junjie Cheng, Ruiqi Song, Ye Wu, Nanxing Zeng, Ximiao Li, Yunfeng Ai

机构 * The School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Waytous Inc.(Waytous公司) The State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) The College of Surveying and Geo-Informatics, Tongji University(同济大学测绘与地理信息学院)

AI总结 提出OWMDrive框架,利用4D占用世界模型预测多步3D占用,作为条件先验引导扩散规划器生成强化轨迹,显式建模时空因果依赖,提升复杂场景下的规划鲁棒性和安全性。

Comments International Conference on Intelligent Robots and Systems (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30408 2026-06-30 cs.CV

SA-Homo: Scale Adaptive Homography Estimation for Scale Variation Scenarios

SA-Homo:面向尺度变化场景的自适应单应性估计

Shangxuan Xie, Haifeng Wu, Yuhang Wang, Huarong Jia, Wen Li

机构 * University of Electronic Science and Technology of China(电子科技大学) University of Chinese Academy of Sciences(中国科学院大学) Beijing Institute of Technology(北京理工大学)

AI总结 提出SA-Homo框架,通过分层尺度对齐策略(全局SDBM模块与局部IHERM模块)解决大尺度差异下的单应性估计问题,在8倍尺度差异下仍保持高精度,并贡献了HMSA数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30360 2026-06-30 cs.LG cs.CV

On the Vulnerability of Parameter-Level Defenses to Model Merging

参数级防御对模型合并的脆弱性

Kuangpu Guo, Qingyan Zheng, Jian Liang, Yongcan Yu, Zilei Wang, Ran He, Tieniu Tan

机构 * University of Science and Technology of China(中国科学技术大学) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所国家工程实验室及机器智能研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本文揭示参数级防御因保护任务向量幅度小而失效,提出锚点引导攻击(AGA)通过预训练模型恢复变换矩阵,并设计锚点排斥微调(ARF)作为防御。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30189 2026-06-30 cs.CL

DAIN: Dynamic Agent-Based Interaction Network for Efficient and Collaborative Multimodal Reasoning

DAIN: 基于动态智能体交互网络的高效协同多模态推理

Xinxin Chen, Yuchen Li, Zihan Wang, Haoyu Zhang, Ruixin Liu, Mingyuan Zhao

机构 * University of Chinese Academy of Sciences(中国科学院大学)

AI总结 提出动态智能体交互网络(DAIN),通过上下文感知元控制器动态调度专业交互智能体并压缩通信,实现高效协同多模态推理,在五个基准上取得最优性能。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30027 2026-06-30 cs.CV

Cross-Modal Iteration Distillation for Robust IHD Screening: The IDNet Framework and A New Benchmark

跨模态迭代蒸馏用于稳健的IHD筛查:IDNet框架与一个新基准

Yongchang Gao, Junjie Pang, Shuaiyu Yang, Yusheng Yang, Xichao Jia, Shaojie Li, Hongfei Zhang, Jia Mu

机构 * University of Chinese Academy of Sciences(中国科学院大学) MGI Tech Co., Ltd.(MGI科技有限公司) Shenzhen University(深圳大学)

AI总结 提出IDNet框架,通过跨模态蒸馏聚合器(CDA)融合左右眼眼底图像和稀疏临床变量,并构建UK Biobank基准,在IHD筛查中优于多种基线方法。

Comments Accepted to the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30012 2026-06-30 cs.CV

SkelEM: Training-Signal Decoupling of Skeleton and Diffusion for Self-supervised Axial Super-Resolution in Volume Microscopy

SkelEM:用于体积显微镜中自监督轴向超分辨率的骨架与扩散训练信号解耦

Bohao Chen, Yanchao Zhang, Yanan Lv, Chenxun Deng, Hua Han, Xi Chen

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, China(中国科学院大学先进交叉学科学院) State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology, Institute of Automation, Chinese Academy of Sciences, China(中国科学院脑认知与脑启发智能技术国家重点实验室) School of Future Technology, University of Chinese Academy of Sciences, China(中国科学院大学未来技术学院) School of Artificial Intelligence, University of Chinese Academy of Sciences, China(中国科学院大学人工智能学院)

AI总结 提出SkelEM框架,通过解耦低频拓扑与高频细节的训练信号,结合确定性骨架与扩散精炼器,实现体积显微镜自监督轴向超分辨率,仅需≤5步即可恢复高保真细节,并在新基准BRAVE-ASR上取得最优平衡。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29847 2026-06-30 cs.CV

See Only When Needed: Context-Aware Attention Intervention for Mitigating Hallucinations in LVLMs

仅在需要时看:用于缓解LVLM中幻觉的上下文感知注意力干预

Yuqing Lei, Wenbo Lyu, Yingjun Du, Xiantong Zhen, Cees G. M. Snoek, Ling Shao

机构 * University of Chinese Academy of Sciences(中国科学院大学) University of Amsterdam(阿姆斯特丹大学) United Imaging Healthcare Co., Ltd.(联合影像医疗科技股份有限公司)

AI总结 提出训练自由的上下文感知注意力干预(CAI),通过两轴选择性(看哪里和何时干预)在解码时针对性增强视觉 grounding,有效缓解物体幻觉并保持语言流畅性。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29834 2026-06-30 cs.RO

STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning

STEAM: 面向真实世界机器人学习的自监督时间集成优势建模

Zhihao Liu, Qiuyi Gu, Yitao Wang, Dongming Qiao, Yixian Zhang, Shuaihang Chen, Liangzhi Shi, Tianxing Zhou, Zefang Huang, Kang Chen, Zhen Guo, Quanlu Zhang, Jincheng Yu, Xiaodan Liang, Guoliang Fan, Yu Wang, Feng Gao, Xinlei Chen, Chao Yu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Striding AI School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy(中关村学院) Pengcheng Laboratory(鹏城实验室) Harbin Institute of Technology(哈尔滨工业大学) Beijing Institute of Technology(北京理工大学) Zhejiang University(浙江大学) Peking University(北京大学) Infinigence AI

AI总结 提出自监督时间集成优势建模(STEAM),利用专家轨迹中帧对的时间偏移作为自监督信号,学习帧级优势以区分进展与失败,结合CFGRL在多种真实任务中提升策略成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29824 2026-06-30 cs.CL cs.AI

Neural Procedural Memory: Empowering LLM Agents with Implicit Activation Steering

神经程序记忆:通过隐式激活引导赋予LLM智能体能力

Chengfeng Zhao, Yuqiao Tan, Shizhu He, Yequan Wang, Jun Zhao, Kang Liu

机构 * Institute of Automation, CAS(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 提出神经程序记忆(NPM),一种无训练框架,通过隐式激活引导而非显式指令表示智能体记忆,从历史对比经验中提取程序技能为激活空间中的引导向量,直接激活任务相关神经机制以指导执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29714 2026-06-30 cs.CV

UniVAD v2: Unified Visual Anomaly Detection via Support-Conditioned Boundary Construction

UniVAD v2: 基于支持条件边界构建的统一视觉异常检测

Zhaopeng Gu, Bingke Zhu, Zhaowen Li, Guibo Zhu, Yingying Chen, Ming Tang, Peng Su, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Yinwang Intelligent Technology Co. Ltd.(银河智能科技有限公司) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Wuhan AI Research(武汉人工智能研究所) Peng Cheng Laboratory(鹏城实验室) Guangdong Provincial Key Laboratory of Intellectual Property & Big Data(广东省知识产权与大数据重点实验室)

AI总结 提出UniVAD v2框架,通过最优传输关系建模、自适应协调机制和少样本异常参考模块,在统一视觉异常检测中实现跨类别、跨域泛化,提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29700 2026-06-30 cs.AI

Toward Secure and Reliable PDDL Formalization of Large Language Models with Planner-in-the-Loop Feedback

面向具有规划器反馈的大型语言模型的安全可靠PDDL形式化

Jiamei Jiang, Jiajing Zhang, Feifei Mo, Linjing Li, Daniel Zeng

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Industry-education Integration, University of Chinese Academy of Sciences(中国科学院大学产教融合学院)

AI总结 提出NL-PDDL-Bench基准和规划器在环框架,通过验证器诊断和偏好优化提升LLM生成PDDL规范的可执行性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29314 2026-06-30 cs.CV

D$^{2}$R$^{2}$OSR: Degradation-Disentangled Representation for Real-World Omnidirectional Image Super-Resolution

D$^{2}$R$^{2}$OSR: 面向真实世界全向图像超分辨率的退化解耦表示

Hongyu An, Xinfeng Zhang, Xu Fan, Shijie Zhao, Li Zhang, Ruiqin Xiong

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) ByteDance Inc.(字节跳动公司) School of Computer Science, Peking University(北京大学计算机学院)

AI总结 提出D$^{2}$R$^{2}$OSR框架,通过显式建模鱼眼成像和ERP投影的退化,结合视角投影表示和退化特定模块,实现真实世界全向图像超分辨率,达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28971 2026-06-30 cs.CV

Self-Evolving Agentic Image Restoration via Deliberate Planning and Intuitive Execution

自进化智能体图像恢复:通过深思熟虑的规划与直觉执行

Shuang Cui, Fan Ji, Guanglong Sun, Yufei Guo, Xiongxin Tang, Jiangmeng Li, Fanjiang Xu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Life Sciences, Tsinghua University(清华大学生命科学学院) Intelligent Science & Technology Academy of CASIC(中国科学院 CASIC 智能科学与技术学院)

AI总结 提出SEAR框架,将图像恢复建模为序列决策问题,采用直觉执行器与深思熟虑规划器,结合剪枝感知蒙特卡洛树搜索和自进化情景记忆,解决贪婪搜索和信息利用不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28879 2026-06-30 cs.LG cs.SY eess.SY

Analysis of Adam Algorithms for Stochastic Dynamic Systems

随机动态系统的Adam算法分析

Xin Zheng, Yifei Jin, Lei Guo

机构 * State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学研究院,中国科学院) School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院)

AI总结 针对时变非平稳系统,提出Adam算法的通用理论,通过新随机Lyapunov函数和矩阵乘积分析,推导参数跟踪与预测误差界,指导超参数选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28716 2026-06-30 cs.AI

TrajRS: Towards Certified Robustness in Pedestrian Trajectory Prediction

TrajRS:面向行人轨迹预测的可认证鲁棒性

Liang Zhang, Gaojie Jin, Yao Shi, Quanzhi Li, Cheng-Chao Huang, David N. Jansen, Lijun Zhang

机构 * Key Laboratory of System Software (Chinese Academy of Sciences) and State Key Laboratory of Computer Science, Institute of Software, Chinese Academy of Sciences, China(中国科学院系统软件重点实验室(中国科学院)和计算机科学国家重点实验室,软件研究所,中国) University of Chinese Academy of Sciences, China(中国科学院大学,中国) Nanjing Institute of Software Technology, Chinese Academy of Sciences, China(中国科学院南京软件技术研究所,中国) Hangzhou Institute for Advanced Study, UCAS, China(浙江大学杭州高等研究院,中国)

AI总结 针对轨迹预测模型易受对抗攻击的问题,提出TrajRS框架,将随机平滑扩展到轨迹预测领域,为平滑后的预测器提供认证鲁棒半径,并针对最优预测和所有可能预测两种鲁棒性定义进行优化。

Comments Accepted by 2026 IEEE International Conference on Acoustics, Speech and Signal Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28696 2026-06-30 cs.AI

COMPASS: Grounding Composition-Intent Guidance in Unified Multimodal Models

COMPASS:在统一多模态模型中锚定构图意图引导

Ziqi Zhou, Weize Quan, Mining Tan, Zhihan Chen, Dandan Zheng, Jingdong Chen, Jun Zhou, Weiming Dong, Dong-Ming Yan

机构 * University of Edinburgh(爱丁堡大学) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS)(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Ant Group(蚂蚁集团)

AI总结 提出统一框架COMPASS,通过共享专家令牌τ_c实现构图感知与生成的双向锚定,结合MoE骨干和Comp-11数据集,显著提升细粒度构图理解与可控生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28431 2026-06-30 eess.IV cs.CV cs.LG physics.optics

A Zero-Shot Deep Image Prior Framework for Denoising and Deconvolution in Fluorescence Microscopy

荧光显微镜去噪与去卷积的零样本深度图像先验框架

Xiangyu Qian, Jing Liu, Yunqing Tang, Luru Dai, Qiushi Li

机构 * Wenzhou Key Laboratory of Biomedical Imaging(温州生物医学成像重点实验室) Zhejiang Key Laboratory of Soft Matter Biomedical Materials(浙江软物质生物医学材料重点实验室) Wenzhou Institute, University of Chinese Academy of Sciences(中国科学院大学温州研究院) Postgraduate Training Base Alliance of Wenzhou Medical University(温州医学院研究生联合培养基地联盟)

AI总结 提出SDIP零样本深度图像先验框架,通过顺序自编码正则化去噪和RLG-DIP模块去卷积,无需外部训练数据,在BioSR数据集上提升信噪比和分辨率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25044 2026-06-30 cs.RO

X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models

X-DiffVLA:面向视觉-语言-动作模型的跨具身扩散动作头

Boyu Li, Chaoyi Xu, Haoqi Yuan, Xinrun Xu, Börje F. Karlsson, Haoran Li, Zongqing Lu, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(SKL-MAIS,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) BeingBeyond School of Computer Science, Peking University(北京大学计算机学院)

AI总结 针对跨具身数据学习通用策略的挑战,提出X-DiffVLA模型,通过扩散模型和具身强制技术实现异构末端执行器间的知识迁移,在RoboCasa和Isaac Gym上分别提升15.3%和12.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28123 2026-06-30 cs.CV cs.AI cs.CL

Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL

超越SFT到RL:通过黑盒在线策略蒸馏进行预对齐以多模态RL

Sudong Wang, Weiquan Huang, Xiaomin Yu, Zuhao Yang, Hehai Lin, Keming Wu, Chaojun Xiao, Chen Chen, Wenxuan Wang, Beier Zhu, Yunjian Zhang, Chengwei Qin

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出PRISM框架,通过在SFT和RLVR之间插入显式分布对齐阶段,解决多模态RL中的分布漂移问题,利用基于策略蒸馏的对抗游戏提升对齐效果,实验显示在多个RL算法和基准上性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12598 2026-06-30 cs.CV

Neural Gate: Mitigating Privacy Risks in LVLMs via Neuron-Level Gradient Gating

神经门:通过神经层面梯度门缓解LVLMs的隐私风险

Xiangkui Cao, Jie Zhang, Meina Kan, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出Neural Gate方法,通过神经层面模型编辑提升LVLMs对隐私问题的拒绝率,增强隐私保护同时保持模型原有功能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05184 2026-06-30 eess.IV cs.CV

MSA-UNet3+: Multi-Scale Attention UNet3+ with New Supervised Prototypical Contrastive Loss for Coronary DSA Image Segmentation

MSA-UNet3+: 带新监督原型对比损失的多尺度注意力UNet3+用于冠状动脉DSA图像分割

Rayan Merghani Ahmed, Adnan Iltaf, Mohamed Elmanna, Gang Zhao, Hongliang Li, Yue Du, Bin Li, Shoujun Zhou

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学)

AI总结 本文提出MSA-UNet3+和SPCL,通过结合监督和原型对比学习提升冠状动脉DSA图像分割精度,实验表明其在Dice系数和F1分数上优于现有方法。

Comments 15 pages, 11 figures, 3 tables, Published in Biomedical Signal Processing and Control

Journal ref Biomedical Signal Processing and Control, Volume 123, Article 110539, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏