arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

共收录 1952
2605.16003 2026-05-18 cs.CV

Echo-Forcing: A Scene Memory Framework for Interactive Long Video Generation

回声驱动:一种用于交互式长视频生成的场景记忆框架

Mingqiang Wu, Weilun Feng, Zhefeng Zhang, Haotong Qin, Yuqi Li, Guoxin Fan, Xiaokun Liu, Zhulin An, Libo Huang, Yongjun Xu, Chuanguang Yang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院人工智能安全国家重点实验室,计算技术研究所,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) China University of Mining & Technology, Beijing(中国矿业大学(北京)) ETH Zürich(苏黎世联邦理工学院) City College of New York, City University of New York(纽约城市学院,纽约城市大学) Xiamen Institute of Data Intelligence, Xiamen, China(厦门数据智能研究院,厦门,中国)

AI总结 本文提出Echo-Forcing框架,通过分层时间记忆、场景回溯帧和差分记忆衰减机制,解决长视频生成中历史KV状态的函数纠缠问题,实现交互式视频生成的流畅过渡与长距离场景回溯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15963 2026-05-18 cs.AI

PAGER: Bridging the Semantic-Execution Gap in Point-Precise Geometric GUI Control

PAGER:弥合点精确几何GUI控制中的语义-执行鸿沟

Jingxuan Wei, Xi Bai, Shan Liu, Caijun Jia, Zheng Sun, Xinglong Xu, Siyuan Li, Linzhuang Sun, Bihui Yu, Conghui He, Cheng Tan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) China University of Petroleum-Beijing(中国石油大学(北京))

AI总结 本文提出PAGER,通过依赖结构规划与像素级执行,解决对点精确几何GUI任务的需求,提升任务成功率至62%以上,填补语义-执行鸿沟。

Comments 27 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15942 2026-05-18 cs.CV cs.AI

Decomposed Vision-Language Alignment for Fine-Grained Open-Vocabulary Segmentation

分解式视觉-语言对齐用于细粒度开放词汇分割

Chenhao Wang, Yingrui Ji, Yu Meng, Yao Zhu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学)

AI总结 本文提出分解式视觉-语言对齐框架,通过将文本提示分解为概念令牌和多个属性令牌,实现细粒度开放词汇分割中对未见属性-类别组合的泛化提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15585 2026-05-18 cs.AI cs.CV

See Before You Code: Learning Visual Priors for Spatially Aware Educational Animation Generation

在编码前看到:学习视觉先验以生成空间感知的教育动画

Yuejia Li, Ke He, Junheng Li, Shutong Chen, Jingkang Xia, Zhiyue Su, Junchi Zhang, Mang Ye

机构 * Wuhan University(武汉大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出OmniManim框架,通过视觉规划和反馈机制提升教育动画生成质量,改进渲染效果和教学效果。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15584 2026-05-18 cs.CV

AGC: Adaptive Geodesic Correction for Adversarial Robustness on Vision-Language Models

AGC:面向视觉-语言模型对抗鲁棒性的自适应测地修正

Zhiwei Li, Jiacheng Xue, Weining Wang, Ajian Liu, Xingyu Gao, Zhenan Sun, Qi Li

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所国家工程研究中心与人工智能院,中国科学院) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出AGC,一种无需训练的防御机制,通过自适应步长修正输入特征,提升视觉-语言模型的对抗鲁棒性,实测在八个细粒度数据集上提升44.4%的鲁棒准确率,同时降低10倍推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15536 2026-05-18 cs.RO cs.AI cs.CV

SkiP: When to Skip and When to Refine for Efficient Robot Manipulation

SkiP: 在何时跳过和何时细化以实现高效的机器人操作

Mingtong Dai, Guanqi Peng, Yongjie Bai, Feng Yan, Chunjie Chen, Lingbo Liu, Liang Lin, Xinyu Wu

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Peng Cheng Laboratory(鹏城实验室) Southern University of Science and Technology(南方科技大学) Sun Yat-sen University(中山大学) UNT University of Chinese Academy of Sciences(中国科学院大学)

AI总结 SkiP通过动态跳过冗余步骤和精细化关键步骤,提升机器人操作效率,无需额外结构或规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15256 2026-05-18 cs.CV

ReactiveGWM: Steering NPC in Reactive Game World Models

ReactiveGWM:引导NPC在反应式游戏世界模型中

Zeqing Wang, Danze Chen, Zhaohu Xing, Zizhao Tong, Yinhan Zhang, Xingyi Yang, Yeying Jin

机构 * Tencent(腾讯) National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 ReactiveGWM通过解耦玩家控制与NPC行为,实现动态交互合成,使NPC策略能跨游戏迁移,无需重新训练即可实现可控的NPC互动。

Comments The code is available at https://inv-wzq.github.io/ReactiveGWM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15243 2026-05-18 cs.LG cs.AI q-bio.BM q-bio.MN q-bio.QM

Reading the Cell, Designing the Cure: Perturbation-Conditioned Molecular Diffusion for Function-Oriented Drug Design

解读细胞,设计治愈:基于扰动条件的分子扩散用于功能导向的药物设计

Ziyu Xu, Zijian Zhang, Liang Wang, Zhiyuan Liu, Qiang Liu, Shu Wu, Liang Wang

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学先进交叉学科学院) NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院) National University of Singapore, Singapore(新加坡国立大学)

AI总结 本文提出基于转录组的药物设计(TBDD)作为生成逆问题,通过多分辨率转录组引导扩散框架,结合转录组扰动功能特征提取器,实现功能导向的药物分子设计,验证了其在结构质量和功能一致性上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.05467 2026-05-18 cs.LG cs.NA math.NA

ChebNet: Efficient and Stable Constructions of Deep Neural Networks with Rectified Power Units via Chebyshev Approximations

ChebNet: 通过切比雪夫近似高效稳定地构建深度神经网络

Shanshan Tang, Bo Li, Haijun Yu

机构 * Software Development Center, Industrial and Commercial Bank of China(中国工商银行软件开发中心) Hisilicon Semiconductor and Component Business Dept.(2012 Labs), Huawei Technologies Co., Ltd(华为技术有限公司半导体及组件业务部) NCMIS & LSEC, Institute of Computational Mathematics and Scientific/Engineering Computing, Academy of Mathematics and Systems Science, Beijing(数学与系统科学研究院) School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院)

AI总结 本文提出ChebNet,利用切比雪夫多项式近似构建稳定高效的深度神经网络,实现与幂级数方法相当的函数逼近性能,并在稳定性上更优。

Comments 6 figures, 3 tables, to appear on Communications in Mathematics and Statistics

Journal ref Communications in Mathematics and Statistics, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14539 2026-05-15 cs.CL

Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards

从失败中学习:具有可验证奖励的纠正导向策略优化

Mengjie Ren, Jie Lou, Boxi Cao, Xueru Wen, Hongyu Lin, Xianpei Han, Le Sun, Xing Yu, Yaojie Lu

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Xiaohongshu Inc(小红书公司)

AI总结 本文提出CIPO方法,通过将失败轨迹转化为纠正监督,提升大语言模型的推理和纠错能力,在11个基准测试中优于基线方法。

Comments Work on progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14486 2026-05-15 cs.CV

Reduce the Artifacts Bias for More Generalizable AI-Generated Image Detection

降低艺术偏差以提高通用性的人工智能生成图像检测

Yiheng Li, Yang Yang, Zichang Tan, Gao Li, Zhen Lei, Wenhao Wang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部门) Sangfor Technologies Inc.(Sangfor技术公司) China Mobile Financial Technology Co., Ltd.(中国移动金融科技有限公司) CAIR, HKSIS, Chinese Academy of Sciences(中国科学院CAIR、HKSIS部门) SCSE, FIE, M.U.S.T, Macau, China(澳门SCSE、FIE、M.U.S.T部门) Vast Intelligence Lab, Sydney, Australia(悉尼澳大利亚Vast Intelligence Lab)

AI总结 本文提出SEF框架,通过分离专家融合减少领域干扰,提升AI生成图像检测的通用性与鲁棒性,实验表明在13个基准上表现优异。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17367 2026-05-15 cs.LG

R2PS: Worst-Case Robust Real-Time Pursuit Strategies under Partial Observability

R2PS: 在部分可观测性下最坏情况鲁棒的实时追捕策略

Runyu Lu, Ruochuan Shi, Yuanheng Zhu, Dongbin Zhao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)

AI总结 本文提出R2PS方法,通过动态规划和强化学习框架,在部分可观测环境下实现鲁棒的实时追捕策略,能泛化到未见图结构并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15198 2026-05-15 cs.LG math-ph math.MP

Frequency-adaptive tensor neural networks for high-dimensional multi-scale problems

频率自适应张量神经网络用于高维多尺度问题

Jizu Huang, Yue Qiu, Rukang You

机构 * SKLMS, Academy of Mathematics and Systems Science, Chinese Academy of Sciences, Beijing, 100190, PR China(数学与系统科学研究院,中国科学院,北京,100190,中国) School of Mathematical Sciences, University of Chinese Academy of Sciences, Beijing 100190, PR China(中国科学院大学数学科学学院,北京,100190,中国) College of Mathematics and Statistics, Chongqing University(重庆大学数学与统计学院)

AI总结 本文提出频率自适应张量神经网络,通过引入随机傅里叶特征和离散傅里叶变换,缓解高维多尺度问题的维度灾难,提升对高频特征的捕捉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05008 2026-05-15 cs.CV

Multimodal Causal-Driven Representation Learning for Generalizable Medical Image Segmentation

多模态因果驱动表示学习用于通用化医学图像分割

Xusheng Liang, Lihua Zhou, Nianxin Li, Miao Xu, Ziyang Song, Dong Yi, Jinlin Wu, Jiawei Ma, Hongbin Liu, Zhen Lei, Jiebo Luo

机构 * City University of Hong Kong(香港城市大学) Shenzhen Loop Area Institute(深圳河套学院) CAIR, HKISI, Chinese Academy of Sciences(中国科学院计算智能研究所) UESTC(电子科技大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本文提出MCDRL框架,结合因果推理与VLM解决医学图像分割的领域泛化问题,通过文本提示识别病变区域并消除领域特定影响,提升分割准确性与泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13778 2026-05-14 cs.RO cs.CV

Realtime-VLA FLASH: Speculative Inference Framework for Diffusion-based VLAs

实时-VLA FLASH:基于扩散模型的视觉-语言-动作模型的推测推理框架

Jiahui Niu, Kefan Gu, Yucheng Zhao, Shengwen Liang, Tiancai Wang, Xing Hu, Ying Wang, Huawei Li

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Nanjing University(南京大学) Dexmal

AI总结 本文提出实时-VLA FLASH框架,通过轻量级草案模型和主模型的Action Expert并行验证,实现低延迟高频率重规划,实验显示在LIBERO上任务性能保持良好,推理延迟降低至19.1ms。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13734 2026-05-14 cs.DC cs.AI cs.NI

KVServe: Service-Aware KV Cache Compression for Communication-Efficient Disaggregated LLM Serving

KVServe: 服务感知的KV缓存压缩用于通信高效的解耦大语言模型服务

Zedong Liu, Xinyang Ma, Dejun Luo, Hairui Zhao, Bing Lu, Wenjing Huang, Yida Gu, Xingchen Liu, Zheng Wei, Jinyang Liu, Dingwen Tao, Guangming Tan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Shanghai Jiao Tong University(上海交通大学)

AI总结 KVServe通过服务感知和自适应的KV通信压缩框架,提升解耦大语言模型服务的效率,减少延迟和加速时间。

Comments Accepted by SIGCOMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13429 2026-05-14 cs.CL

TokAlign++: Advancing Vocabulary Adaptation via Better Token Alignment

TokAlign++: 通过更好的词 token 对齐推进词汇适应

Chong Li, Yingzhuo Deng, Wen Yang, Jiajun Zhang, Chengqing Zong

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, CAS, Beijing, China(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院,北京,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院,北京,中国)

AI总结 TokAlign++通过学习更好的词 token 对齐词典,提升多语言模型的词汇适应性能,实验显示其能提升多语言文本压缩率并保持模型能力,仅需1k步即可恢复基础模型性能。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13296 2026-05-14 cs.AI cs.LG cs.MA

Discrete Diffusion for Complex and Congested Multi-Agent Path Finding with Sparse Social Attention

离散扩散用于复杂且拥堵的多智能体路径寻找与稀疏社交注意

Yuanzhe Wang, Tian Zhi, Zihang Wei, Hongguang Wang, Jiaming Guo, Yang Zhao, Zisheng Liu, Shiyu Quan, Xing Hu, Zidong Du, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所处理器重点实验室) School of Advanced Interdisciplinary Sciences, CAS(中国科学院高等交叉学科学院) University of Chinese Academy of Sciences(中国科学院大学) Institute of Microelectronics, CAS(中国科学院微电子研究所)

AI总结 本文提出DiffLNS框架,结合离散去噪扩散概率模型与LNS2,通过稀疏社交注意学习多智能体轨迹先验,提升多智能体路径寻找的修复效率与成功率。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10187 2026-05-14 cs.CV

SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation

SciVQR:一个多学科多模态基准用于高级科学推理评估

Longteng Guo, Xuanxu Lin, Dongze Hao, Tongtian Yue, Pengkang Huo, Jiatong Ma, Yuchen Liu, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) OPPO AI Center(OPPO AI中心)

AI总结 SciVQR通过54个学科的多模态任务评估科学推理能力,包含专家解答的复杂推理挑战,揭示了多模态大语言模型在复杂推理和跨学科整合方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06475 2026-05-14 cs.LG

Towards Generalizable Reasoning: Group Causal Counterfactual Policy Optimization for LLM Reasoning

迈向通用性推理:面向LLM推理的群体因果反事实策略优化

Jingyao Wang, Peizheng Guo, Wenwen Qiang, Jiahuan Zhou, Huijie Guo, Changwen Zheng, Hui Xiong

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Wangxuan Institute of Computer Technology, Peking University(北京大学王宣计算机技术研究所) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出群体因果反事实策略优化方法,通过反事实奖励提升LLM推理的通用性,强调推理过程的鲁棒性和有效性,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15642 2026-05-14 cs.CV

UNIV: Unified Foundation Model for Infrared and Visible Modalities

UNIV:用于红外和可见模态的统一基础模型

Fangyuan Mao, Shuo Wang, Jilin Mei, Shun Lu, Chen Min, Fuyang Liu, Xiaokun Feng, Meiqi Wu, Yu Hu

机构 * Research Center for Intelligent Computing Systems, CAS ICT(智能计算系统研究所以及中国科学院信息科技研究院) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 UNIV通过跨模态对比学习提升红外与可见光感知的鲁棒性,解决模态偏差问题,实验显示在红外任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05410 2026-05-14 cs.AI cs.CL

ChatSR: Multimodal Large Language Models for Scientific Formula Discovery

ChatSR:用于科学公式发现的多模态大语言模型

Yanjie Li, Lina Yu, Weijun Li, Min Wu, Liping Zhang, Jingyi Liu, Yusong Deng, Mingzhu Wan, Xin Ning

机构 * AnnLab, Institute of Semiconductors, Chinese Academy of Sciences, Beijing, China(安 lab,半导体研究所,中国科学院,北京,中国) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences, Beijing, China(电子、电气与通信工程学院,中国科学院大学,北京,中国) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing 101408, China(先进交叉科学学院,中国科学院大学,北京101408,中国) College of Materials Science and Opto-Electronic Technology, University of Chinese Academy of Sciences, Beijing, 100049, China(材料科学与光电技术学院,中国科学院大学,北京100049,中国) School of Integrated Circuits, University of Chinese Academy of Sciences, Beijing 100049, China(集成电路学院,中国科学院大学,北京100049,中国)

AI总结 ChatSR通过设计专用编码器和模态对齐机制,将科学数据映射到可被大语言模型处理的表示空间,从而生成符合领域先验的数学公式,推动科学发现自动化。

Comments 14 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12514 2026-05-14 cs.SI cs.CV cs.CY cs.DL stat.AP

Structural Diversity Drives Disruptive Scientific Innovation

结构多样性驱动颠覆性科学创新

Yichun Peng, Saike He, Peijie Zhang, Kang Zhao, Yi Yang, Ning Zhang, Qingpeng Zhang, Daniel Dajun Zeng, Hao Peng

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing 100190, China(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院,北京100190,中国) University of Chinese Academy of Sciences, Beijing 101408, China(中国科学院大学,北京101408,中国) Department of Business Analytics, Tippie College of Business, The University of Iowa, Iowa City, IA 52242, United States of America(美国爱荷华大学蒂普皮商学院商业分析系,爱荷华市,IA 52242,美国) The University of Hong Kong, Institute of Data Science & Department of Pharmacology and Pharmacy(香港大学,数据科学研究所及药理学与药学系)

AI总结 研究通过结构多样性指标揭示科学创新的组织结构影响,证明其在预测颠覆性创新中的有效性,并提出跨学科整合机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09965 2026-05-13 cs.CV

Towards Generalist Game Players: An Investigation of Foundation Models in the Game Multiverse

迈向通用游戏玩家:对游戏多元宇宙中基础模型的调查

Kuan Zhang, Dongchen Liu, Qiyue Zhao, Tianyu Xin, Yue Su, Haisheng Wang, Han Yin, Hongbo Ma, Peize Li, Tianjun Gu, Xiangnan Wu, Xinran Zhang, Yongxuan Li, Zirong Chen, Yiming Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) MMLab, The University of Hong Kong(香港大学MMLab) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文探讨了在游戏多元宇宙中训练通用游戏玩家的基础模型,分析了数据集、模型、工具和基准四个支柱,并提出五阶段路线图,旨在实现能够同时创造和演化游戏世界的通用智能体。

Comments 51 pages, 7 figures, github: https://github.com/THUSI-Lab/Awesome-LFMs-Play-Games

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11356 2026-05-13 cs.LG

Fractal Graph Contrastive Learning

分形图对比学习

Nero Z. Li, Xuehao Zhai, Zhichao Shi, Boshen Shi, Xuhui Jiang

机构 * CDT, University of Oxford(牛津大学CDT) IDEA Research, International Digital Economy Academy(IDEA研究院、国际数字经济学院) School of Advanced Interdisciplinary Sciences, UCAS(北京大学交叉学科研究院) State Key Lab of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) China Mobile Research Institute(中国移动研究院) DataArc Tech Ltd.(DataArc科技有限公司)

AI总结 本文提出分形图对比学习框架,通过引入分形维度感知的对比损失和改进的全局增强策略,提升图对比学习的结构一致性与性能。

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10925 2026-05-12 cs.RO

PriorVLA: Prior-Preserving Adaptation for Vision-Language-Action Models

PriorVLA: 为视觉-语言-动作模型保留先验进行适应

Xinyu Guo, Bin Xie, Wei Chai, Xianchi Deng, Tiancai Wang, Zhengxing Wu, Xingyu Chen

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Dexmal University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

AI总结 PriorVLA通过保留预训练先验和学习有效适应方法,在机器人操作任务中实现了比全微调和现有基线更好的性能,特别是在分布外和少样本情况下表现更优。

Comments 32 pages. Project page: https://priorvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10560 2026-05-12 cs.CL

ICT-NLP at SemEval-2026 Task 3: Less Is More -- Multilingual Encoder with Joint Training and Adaptive Ensemble for Dimensional Aspect Sentiment Regression

在SemEval-2026任务3中,ICT-NLP采用‘少即是多’策略:多语言编码器联合训练与自适应集成用于维度方面情感回归

Liyuan Huang, Jiawei He, Wutao Shen, Lin Li, Jin Zhang

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出一个轻量高效的多语言编码器系统,通过联合多语言多领域训练、有界回归转换和自适应集成策略,实现跨语言迁移和数据稀疏性缓解,实验显示在多个任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10341 2026-05-12 cs.AI cs.SE

PaperFit: Vision-in-the-Loop Typesetting Optimization for Scientific Documents

PaperFit:科学文档中的视觉闭环排版优化

Bihui Yu, Xinglong Xu, Junjie Jiang, Jiabei Cheng, Caijun Jia, Siyuan Li, Conghui He, Jingxuan Wei, Cheng Tan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)

AI总结 PaperFit通过视觉闭环优化将可编译的LaTeX文档转化为高质量PDF,解决排版问题并提升文档自动化流程的完整性。

Comments 47 pages, 17 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21901 2026-05-12 cs.CV

CLEAR: Context-Aware Learning with End-to-End Mask-Free Inference for Adaptive Video Subtitle Removal

CLEAR: 基于上下文的端到端无掩码推理的自适应视频字幕移除

Qingdong He, Chaoyi Wang, Peng Tang, Yifan Yang, Xiaobin Hu

机构 * University of Electronic Science and Technology of China(电子科技大学) University of Chinese Academy of Sciences(中国科学院大学) Technical University of Munich(慕尼黑技术大学) Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学)

AI总结 CLEAR通过上下文感知的自适应学习实现端到端无掩码推理,有效区分字幕与背景内容,提升多语言字幕移除性能。

Comments Accepted by ICML 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21892 2026-05-12 cs.CL cs.AI cs.LG

Elastic MoE: Unlocking the Inference-Time Scalability of Mixture-of-Experts

弹性混合专家:解锁混合专家模型的推理时间可扩展性

Naibin Gu, Zhenyu Zhang, Yuchen Feng, Yilong Chen, Peng Fu, Zheng Lin, Shuohuan Wang, Yu Sun, Hua Wu, Weiping Wang, Haifeng Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Baidu Inc.(百度公司)

AI总结 本文提出弹性混合专家(EMoE)框架,通过训练专家协作和路由选择,解决混合专家模型在推理时激活专家数量增加导致性能下降的问题,提升了模型在不同预算下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏