arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

共收录 1960
2603.04980 2026-03-06 cs.CV

A Simple Baseline for Unifying Understanding, Generation, and Editing via Vanilla Next-token Prediction

一种通过 vanilla next-token 预测统一理解、生成和编辑的简单基线

Jie Zhu, Hanghang Ma, Jia Wang, Yayong Guan, Yanbing Zeng, Lishuai Gao, Junqiang Wu, Jie Hu, Leye Wang

机构 * Key Lab of High Confidence Software Technologies (Peking University), Ministry of Education, China(高可信软件技术重点实验室(北京大学),教育部,中国) School of Computer Science, Peking University, Beijing, China(北京大学计算机学院,北京,中国) School of Computer Science and Technology, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学计算机科学与技术学院,北京,中国)

AI总结 本文提出 Wallaroo,一种通过 vanilla next-token 预测统一多模态理解、生成和编辑的简单基线模型,展示了其在多任务中的竞争力。

Comments Technical report. This work serves as a straightforward autoregressive baseline for unifying understanding, generation, and editing

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04971 2026-03-06 cs.LG cs.AI cs.CL

Mixture of Universal Experts: Scaling Virtual Width via Depth-Width Transformation

通用专家混合:通过深度-宽度转换扩展虚拟宽度

Yilong Chen, Naibin Gu, Junyuan Shang, Zhenyu Zhang, Yuchen Feng, Jiawei Sheng, Tingwen Liu, Shuohuan Wang, Yu Sun, Hua Wu, Haifeng Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Baidu Inc(百度公司)

AI总结 MOUE通过引入虚拟宽度扩展维度,改进了混合专家模型的可扩展性,通过结构化专家共享和负载平衡技术,在不同扩展范围内提升了模型性能。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04448 2026-03-06 cs.AI cs.CL cs.CV cs.LG cs.MA

SkillNet: Create, Evaluate, and Connect AI Skills

SkillNet: 创建、评估和连接AI技能

Yuan Liang, Ruobin Zhong, Haoming Xu, Chen Jiang, Yi Zhong, Runnan Fang, Jia-Chen Gu, Shumin Deng, Yunzhi Yao, Mengru Wang, Shuofei Qiao, Xin Xu, Tongtong Wu, Kun Wang, Yang Liu, Zhen Bi, Jungang Lou, Yuchen Eleanor Jiang, Hangcheng Zhu, Gang Yu, Haiwen Hong, Longtao Huang, Hui Xue, Chenxi Wang, Yijun Wang, Zifei Shan, Xi Chen, Zhaopeng Tu, Feiyu Xiong, Xin Xie, Peng Zhang, Zhengke Gui, Lei Liang, Jun Zhou, Chiyu Wu, Jin Shang, Yu Gong, Junyu Lin, Changliang Xu, Hongjie Deng, Wen Zhang, Keyan Ding, Qiang Zhang, Fei Huang, Ningyu Zhang, Jeff Z. Pan, Guilin Qi, Haofen Wang, Huajun Chen

机构 * Zhejiang University(浙江大学) Tongji University(同济大学) Southeast University(东南大学) Alibaba Group(阿里巴巴集团) Tencent(腾讯) Fudan University(复旦大学) The University of Edinburgh(爱丁堡大学) Monash University(墨尔本大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Huzhou University(湖州大学) Hornor Device Co., Ltd(Hornor设备有限公司) Hangzhou Institute for Advanced Study, UCAS(杭州先进研究所,UCAS)

AI总结 SkillNet通过统一的本体和多维评估机制,大规模创建、评估和连接AI技能,提升代理性能并促进技能的持久掌握。

Comments http://skillnet.openkg.cn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04243 2026-03-06 cs.RO

Viewpoint Matters: Dynamically Optimizing Viewpoints with Masked Autoencoder for Visual Manipulation

视角至关重要:基于掩码自动编码器的动态视角优化用于视觉操控

Pengfei Yi, Yifan Han, Junyan Li, Litao Liu, Wenzhao Lian

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) the School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Rutgers University(罗格斯大学) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 MAE-Select通过动态选择最具信息量的视角,提升单摄像头机器人视觉操控性能,甚至超越多摄像头系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11063 2026-03-06 cs.RO cs.AI cs.CV cs.LG cs.MA

EmboTeam: Grounding LLM Reasoning into Reactive Behavior Trees via PDDL for Embodied Multi-Robot Collaboration

EmboTeam: 通过PDDL将LLM推理接地为反应式行为树以实现具身多机器人协作

Haishan Zeng, Mengna Wang, Peng Li

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

AI总结 EmboTeam通过PDDL将LLM推理转化为反应式行为树,提升多机器人协作任务的成功率和目标回忆率

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21161 2026-03-06 cs.RO

MarketGen: A Scalable Simulation Platform with Auto-Generated Embodied Supermarket Environments

MarketGen: 一个可扩展的仿真平台,具有自动生成的具身超市环境

Xu Hu, Yiyang Feng, Junran Peng, Jiawei He, Liyi Chen, Wei Sui, Chuanchen Luo, Xucheng Yin, Qing Li, Zhaoxiang Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Science and Technology Beijing(北京科技大学) NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) XYZ Embodied AI(XYZ具身AI) Shandong University(山东大学) Linketic D-Robotics

AI总结 MarketGen通过自动生成复杂超市环境,为评估超市代理提供了一个新的基准,加速了复杂商业应用中具身AI的研究。

Comments Project Page: https://xuhu0529.github.io/MarketGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19854 2026-03-06 cs.CV

STAvatar: Soft Binding and Temporal Density Control for Monocular 3D Head Avatars Reconstruction

STAvatar: 基于软绑定与时间密度控制的单目3D头部人偶重建

Jiankuo Zhao, Xiangyu Zhu, Zidu Wang, Zhen Lei

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CAIR, HKISI, Chinese Academy of Sciences(中国科学院计算技术研究所) SCSE, FIE, M.U.S.T(M.U.S.T)

AI总结 STAvatar通过软绑定与时间密度控制方法,实现了单目视频中高保真3D头部人偶的重建,尤其在细粒度细节和遮挡区域的重建上表现优异。

Comments Accepted to CVPR 2026. Project page: https://jiankuozhao.github.io/STAvatar/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18876 2026-03-06 cs.CV cs.AI cs.CL

Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs

抓取任意区域:迈向多模态大语言模型的精确、上下文像素理解

Haochen Wang, Yuhao Wang, Tao Zhang, Yikang Zhou, Yanwei Li, Jiacong Wang, Jiani Zheng, Ye Tian, Jiahao Meng, Zilong Huang, Guangcan Mai, Anran Wang, Yunhai Tong, Zhuochen Wang, Xiangtai Li, Zhaoxiang Zhang

机构 * New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室、多模态人工智能系统国家重点实验室、自动化研究所、中国科学院(CASIA)) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) Wuhan University(武汉大学) ByteDance(字节跳动)

AI总结 GAR通过RoI对齐特征重放技术实现多区域精准理解与复杂推理,提升多模态大语言模型的上下文感知能力。

Comments ICLR 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03352 2026-03-06 math.OC cs.LG stat.ML

Zeroth-Order primal-dual Alternating Projection Gradient Algorithms for Nonconvex Minimax Problems with Coupled linear Constraints

零阶 primal-dual 交替投影梯度算法用于带有耦合线性约束的非凸极小极大问题

Huiling Zhang, Zi Xu, Yuhong Dai

机构 * Department of Mathematics, College of Sciences, Shanghai University(上海大学数学系) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Newtouch Center for Mathematics of Shanghai University(上海大学数学中心) State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院数学科学国家重点实验室) School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院)

AI总结 本文提出两种零阶算法,用于解决带有耦合线性约束的非凸极小极大问题,首次在确定性和随机设置下提供了迭代复杂度保证。

Comments arXiv admin note: text overlap with arXiv:2212.04672

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04408 2026-03-06 cs.CL

Probing Memes in LLMs: A Paradigm for the Entangled Evaluation World

在LLM中探测迷因:一种纠缠评估世界的范式

Luzhou Peng, Zhengxin Yang, Honglu Ji, Yikang Yang, Fanda Fan, Wanling Gao, Jiayuan Ge, Yilin Han, Jianfeng Zhan

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) BenchCouncil (International Open Benchmark Council)(Benchmark委员会) University of Chinese Academy of Sciences(中国科学院大学) School of Artificial Intelligence and Data Science, Hebei University of Technology(河北工业大学人工智能与数据科学学院)

AI总结 本文提出探测迷因范式,通过感知矩阵分析模型与数据的交互,揭示LLM能力结构并实现群体层面的评估。

Comments 43 pages, 24 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04073 2026-03-05 cs.RO

Swimming Under Constraints: A Safe Reinforcement Learning Framework for Quadrupedal Bio-Inspired Propulsion

受约束的游泳:一种安全强化学习框架用于四足生物启发推进

Xinyu Cui, Fei Han, Hang Xu, Yongcheng Zeng, Luoyang Sun, Ruizhi Zhang, Jian Zhao, Haifeng Zhang, Weikun Li, Hao Chen, Jun Wang, Dixia Fan

机构 * FSI lab, Westlake University(西交大实验室,西湖大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhejiang University(浙江大学) Zhongguancun Academy(中关村学院) Department of Computer Science, University College London(伦敦大学学院计算机科学系)

AI总结 本文提出了一种安全强化学习框架ACPPO-PID,通过约束优化提升四足生物启发推进的推力效率和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04057 2026-03-05 cs.RO cs.AI

Sim2Sea: Sim-to-Real Policy Transfer for Maritime Vessel Navigation in Congested Waters

Sim2Sea: 用于拥挤水域船舶导航的仿真到现实策略迁移

Xinyu Cui, Xuanfa Jin, Xue Yan, Yongcheng Zeng, Luoyang Sun, Siying Wei, Ruizhi Zhang, Jian Zhao, Haifeng Zhang, Jun Wang

机构 * Institute of Automation, CAS(中国科学院自动化研究所) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Zhongguancun Academy(中关村学院) University College London(伦敦大学学院)

AI总结 Sim2Sea通过GPU加速模拟器、双流时空策略和领域随机化方案,实现了拥挤水域中船舶自主导航的仿真到现实策略迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03839 2026-03-05 cs.CV

All-in-One Image Restoration via Causal-Deconfounding Wavelet-Disentangled Prompt Network

通过因果去混淆小波解耦提示网络实现一站式图像恢复

Bingnan Wang, Bin Qin, Jiangmeng Li, Fanjiang Xu, Fuchun Sun, Hui Xiong

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Science(中国科学院软件研究所) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) National Research Center for Information Science and Technology (BNRist)(国家信息科学与技术研究中心(BNRist)) Artificial Intelligence Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)人工智能方向)

AI总结 本文提出CWP-Net,通过因果去混淆和小波解耦技术解决图像恢复中退化模式偏差和虚假相关性问题,提升恢复效果。

Comments Accepted by IEEE TIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03820 2026-03-05 cs.LG cs.AI

Fairness Begins with State: Purifying Latent Preferences for Hierarchical Reinforcement Learning in Interactive Recommendation

公平始于状态:在交互推荐中通过净化潜在偏好进行分层强化学习

Yun Lu, Xiaoyu Shi, Hong Xie, Xiangyu Zhao, Mingsheng Shang

机构 * Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(中国科学院重庆绿色智能技术研究所) Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆学院) The First Affiliated Hospital, University of Science and Technology of China(中国科学技术大学第一附属医院) City University of Hong Kong(香港城市大学)

AI总结 本文提出DSRM-HRL框架,通过净化潜在偏好解决交互推荐中的公平与准确冲突,实现推荐效用与曝光公平的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03725 2026-03-05 cs.LG cs.AI

Why Do Unlearnable Examples Work: A Novel Perspective of Mutual Information

为何不可学习的例子有效:互信息的新视角

Yifan Zhu, Yibo Miao, Yinpeng Dong, Xiao-Shan Gao

机构 * State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qi Zhi Institute(上海启智研究院)

AI总结 本文提出了一种基于互信息减少的不可学习方法,通过减少类内特征协方差来有效阻碍深度学习模型的泛化能力。

Comments 32 pages, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03657 2026-03-05 cs.CV cs.AI

InEdit-Bench: Benchmarking Intermediate Logical Pathways for Intelligent Image Editing Models

InEdit-Bench:智能图像编辑模型中间逻辑路径的基准测试

Zhiqiang Sheng, Xumeng Han, Zhiwei Zhang, Zenghui Xiong, Yifan Ding, Aoxiang Ping, Xiang Li, Tong Guo, Yao Mao

机构 * State Key Laboratory of Optical Field Manipulation Science and Technology, Institute of Optics and Electronics, Chinese Academy of Sciences(光学场操控科学与技术国家重点实验室,光学电子研究所,中国科学院) National Laboratory on Adaptive Optics(自适应光学国家实验室) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 InEdit-Bench通过评估图像编辑模型在中间逻辑路径推理中的表现,揭示了现有模型在动态推理和多步骤演变建模方面的不足,推动更智能的多模态生成模型发展。

Comments CVPR findings. Project page: https://github.com/SZStrong1/InEdit-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02929 2026-03-05 cs.CV

TRACE: Task-Adaptive Reasoning and Representation Learning for Universal Multimodal Retrieval

TRACE:面向通用多模态检索的任务自适应推理与表征学习

Xiangzhao Hao, Shijie Wang, Tianyu Yang, Tianyue Wang, Haiyun Guo, Jinqiao Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 TRACE通过结合生成推理与判别表征学习,实现通用多模态检索中的任务自适应推理,提升检索准确率与推理效率,同时具备强零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19524 2026-03-05 cs.CV cs.MA

VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning

VideoChat-M1: 通过多智能体强化学习实现视频理解的协作策略规划

Boyu Chen, Zikang Wang, Zhengrong Yue, Kainan Yan, Chenyun Yu, Yi Huang, Zijun Liu, Yafei Wen, Xiaoxin Chen, Yang Liu, Peng Li, Yali Wang

机构 * Shenzhen Key Lab of Computer Vision and Pattern Recognition(深圳计算机视觉与模式识别重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) VIVO AI Lab(VIVO人工智能实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shenzhen Campus of Sun Yat-sen University(孙逸仙大学深圳校区) Shanghai Jiao Tong University(上海交通大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系,人工智能研究院)

AI总结 VideoChat-M1通过多智能体强化学习实现视频理解的协作策略规划,显著提升复杂视频任务的性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19655 2026-03-05 cs.RO

LaViRA: Language-Vision-Robot Actions Translation for Zero-Shot Vision Language Navigation in Continuous Environments

LaViRA: 语言-视觉-机器人动作翻译用于连续环境中的零样本视觉语言导航

Hongyu Ding, Ziming Xu, Yudong Fang, You Wu, Zixuan Chen, Jieqi Shi, Jing Huo, Yifan Zhang, Yang Gao

机构 * School of Computer Science, Nanjing University(南京大学计算机科学学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 LaViRA通过分解动作层次结构,利用多模态大语言模型的优势,实现连续环境中零样本视觉语言导航的高效导航与泛化能力。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17509 2026-03-05 cs.CL

Annotation-Efficient Universal Honesty Alignment

标注高效通用诚实对齐

Shiyu Ni, Keping Bi, Jiafeng Guo, Minghao Tang, Jingtong Wu, Zengxin Han, Xueqi Cheng

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 EliCal通过两阶段框架实现高效标注的通用诚实对齐,仅需少量正确性标注即可达到接近最优的对齐效果。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01603 2026-03-05 cs.CV

Towards Generalizable AI-Generated Image Detection via Image-Adaptive Prompt Learning

通过图像自适应提示学习实现通用的AI生成图像检测

Yiheng Li, Zichang Tan, Guoqing Xu, Zhen Lei, Xu Zhou, Yang Yang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部门) CAIR, HKISI, Chinese Academy of Sciences(中国科学院计算机人工智能研究所) Sangfor Technologies Inc. SCSE, FIE, M.U.S.T(M.U.S.T的SCSE、FIE部门)

AI总结 本文提出图像自适应提示学习方法,通过动态调整提示提升AI生成图像检测的泛化能力,实验显示在两个主流数据集上达到领先性能。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02802 2026-03-04 cs.CV

NOVA: Sparse Control, Dense Synthesis for Pair-Free Video Editing

NOVA:无配对视频编辑的稀疏控制与密集合成

Tianlin Pan, Jiayi Dai, Chenpu Yuan, Zhengyao Lv, Binxin Yang, Hubery Yin, Chen Li, Jing Lyu, Caifeng Shan, Chenyang Si

机构 * Nanjing University(南京大学) University of Chinese Academy of Sciences(中国科学院大学) WeChat, Tencent(微信、腾讯) The University of Hong Kong(香港大学)

AI总结 NOVA提出了一种无配对视频编辑框架,通过稀疏控制与密集合成提升编辑保真度和时间一致性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01515 2026-03-04 cs.CV

FACE: A Face-based Autoregressive Representation for High-Fidelity and Efficient Mesh Generation

FACE:一种基于面部的自回归表示,用于高保真和高效的网格生成

Hanxiao Wang, Yuan-Chen Guo, Ying-Tian Liu, Zi-Xin Zou, Biao Zhang, Weize Quan, Ding Liang, Yan-Pei Cao, Dong-Ming Yan

机构 * CASIA UCAS VAST KAUST

AI总结 FACE提出了一种基于面的自回归表示方法,通过在面级别生成网格,显著提高3D网格生成的效率和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21628 2026-03-04 cs.CL

RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning

RuCL:基于分层评分标准的课程学习用于多模态大语言模型推理

Yukun Chen, Jiaming Li, Longze Chen, Ze Gong, Jingpeng Li, Zhen Qin, Hengyu Chang, Ancheng Xu, Zhihao Yang, Hamid Alinejad-Rokny, Qiang Qu, Bo Zheng, Min Yang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) School of Biomedical Engineering, UNSW Sydney(新南威尔士大学生物医学工程学院)

AI总结 RuCL通过分层评分标准课程学习提升多模态大语言模型的推理能力,实现7.83%的准确率提升。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01592 2026-03-04 cs.CV cs.AI

DMTrack: Spatio-Temporal Multimodal Tracking via Dual-Adapter

DMTrack: 基于双适配器的时空多模态跟踪

Weihong Li, Shaohua Dong, Haonan Lu, Yanhao Zhang, Heng Fan, Libo Zhang

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Department of Computer Science and Engineering, University of North Texas(北卡罗来纳州立大学计算机科学与工程系) OPPO AI Center(OPPO人工智能中心)

AI总结 DMTrack通过双适配器架构实现时空多模态跟踪,利用STMA和PMCA模块提升跨模态融合效果,达到先进性能。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02729 2026-03-04 cs.LG math.OC stat.ML

The power of small initialization in noisy low-tubal-rank tensor recovery

小初始化在噪声低管秩张量恢复中的作用

ZHiyu Liu, Haobo Geng, Xudong Wang, Yandong Tang, Zhi Han, Yao Wang

机构 * State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences, China(机器人与智能系统国家重点实验室,沈阳自动化研究所,中国科学院,中国) University of Chinese Academy of Sciences, China(中国科学院大学,中国) School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院,新加坡) The Center for Intelligent Decision-making and Machine Learning, School of Management, Xi’an Jiaotong University, China(智能决策与机器学习中心,西安交通大学管理学院,中国)

AI总结 本文研究了在噪声环境下利用小初始化改进低管秩张量恢复的性能,证明了小初始化能实现接近最优的恢复误差,同时提供了理论保证和实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02623 2026-03-04 cs.RO cs.LG

Uni-Skill: Building Self-Evolving Skill Repository for Generalizable Robotic Manipulation

Uni-Skill:构建通用机器人操作的自演化技能库

Senwei Xie, Yuntian Zhang, Ruiping Wang, Xilin Chen

机构 * Key Laboratory of AI Safety of CAS(中国科学院人工智能安全重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 Uni-Skill通过自演化技能库提升机器人操作的通用性与适应性,实现高效技能检索与少样本推理。

Comments Accepted to ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06412 2026-03-04 astro-ph.IM cs.AI cs.CL

StarWhisper Telescope: An AI framework for automating end-to-end astronomical observations

StarWhisper望远镜:一种用于自动化端到端天文观测的AI框架

Cunshi Wang, Yu Zhang, Yuyang Li, Xinjie Hu, Yiming Mao, Xunhao Chen, Pengliang Du, Rui Wang, Ying Wu, Hang Yang, Yansong Li, Beichuan Wang, Haiyang Mu, Zheng Wang, Jianfeng Tian, Liang Ge, Yongna Mao, Shengming Li, Xiaomeng Lu, Jinhang Zou, Yang Huang, Ningchen Sun, Jie Zheng, Min He, Yu Bai, Junjie Jin, Hong Wu, Jifeng Liu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of Optical Astronomy National Astronomical Observatories Chinese Academy of Sciences(中国科学院国家天文台光学天文重点实验室) School of Computing Science Simon Fraser University(西蒙弗雷泽大学计算机科学学院) College of Science Tibet University(西藏大学理学院) Institute for Frontiers in Astronomy and Astrophysics Beijing Normal University(北京师范大学前沿天文与天体物理研究院) Liii Network Co(Liii网络公司)

AI总结 StarWhisper望远镜是一种结合大语言模型与模块化工作流的AI框架,用于自动化天文观测,提升观测效率并促进业余与专业天文学家的协作。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02024 2026-03-03 cs.CL cs.AI cs.CV

MMR-Life: Piecing Together Real-life Scenes for Multimodal Multi-image Reasoning

MMR-Life: 组合真实场景以进行多模态多图像推理

Jiachun Li, Shaoping Huang, Zhuoran Jin, Chenlong Zhang, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉学科学院)

AI总结 MMR-Life是一个评估多模态多图像推理能力的综合基准,通过现实场景中的多图像信息整合和多种推理类型测试,揭示了现有模型在复杂推理任务中的挑战和性能差异。

Comments Accepted by ICLR 2026, 78 pages, 60 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01947 2026-03-03 cs.CV cs.AI

physfusion: A Transformer-based Dual-Stream Radar and Vision Fusion Framework for Open Water Surface Object Detection

physfusion: 一种基于Transformer的双流雷达与视觉融合框架用于开放水域表面目标检测

Yuting Wan, Liguo Sun, Jiuwu Hao, Zao Zhang, Pin LV

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 PhysFusion通过物理引导雷达编码器和Transformer融合模块,实现开放水域表面目标的高效检测,取得高精度检测结果。

详情

展开后加载摘要…

URL PDF HTML 收藏