arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

共收录 1952
2505.20001 2026-05-12 cs.CV

NEXT: Multi-Grained Mixture of Experts via Text-Modulation for Multi-Modal Object Re-Identification

NEXT: 通过文本调制的多粒度专家混合实现多模态物体重识别

Shihao Li, Huaibo Huang, Junxian Duan, Aihua Zheng, Jin Tang, Jixin Ma

机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电信息采集与防护技术国家重点实验室) Anhui Provincial Key Laboratory of Multimodal Cognitive Computation(安徽省多模态认知计算重点实验室) School of Artificial Intelligence(人工智能学院) Anhui University(安徽大学) State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) New Laboratory of Pattern Recognition(模式识别新实验室) CASIA(中国科学院自动化所) University of Chinese Academy of Sciences(中国科学院大学) School of Computing and Mathematical Sciences(计算与数学科学学院) University of Greenwich(格林威治大学)

AI总结 本文提出NEXT框架,通过文本调制分离语义和结构分支,融合多粒度专家特征,提升多模态物体重识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10107 2026-05-12 cs.AI cs.AR

Arcane: An Assertion Reduction Framework through Semantic Clustering and MCTS-Guided Rule Exploring

Arcane:通过语义聚类和MCTS引导的规则探索的断言减少框架

Hongqin Lyu, Yonghao Wang, Zhiteng Chao, Tiancheng Wang, Huawei Li

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS, Beijing, China(处理器国家重点实验室,计算技术研究所,中国科学院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

AI总结 本文提出Arcane框架,通过语义聚类和MCTS引导的规则探索,有效减少断言数量,同时保持形式覆盖和突变检测能力,实验表明断言数量减少达76.2%,模拟时间加速2.6至6.1倍。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09934 2026-05-12 cs.CL

TRACER: Verifiable Generative Provenance for Multimodal Tool-Using Agents

TRACER:多模态工具使用代理的可验证生成溯源

Bihui Yu, Caijun Jia, Jing Chi, Xiaohan Liu, Yining Wang, He Bai, Yuchen Liu, Jingxuan Wei, Junnan Zhu

机构 * Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(教育部计算电力网络与信息安全重点实验室,山东计算机科学中心(济南国家超算中心),齐鲁工业大学(山东省科学院))

AI总结 TRACER通过生成带结构溯源记录的答案句子,解决多模态工具使用代理中缺乏的 claim-level 依赖结构问题,提升工具使用可验证性和优化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09544 2026-05-12 cs.AI

TIDE-Bench: Task-Aware and Diagnostic Evaluation of Tool-Integrated Reasoning

TIDE-Bench:面向任务的工具整合推理评估

Yize Li, Junzhi Li, Jason Song, Chuxiong Sun, Rui Wang, Changwen Zheng

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

AI总结 本文提出TIDE-Bench,一个高效全面的工具整合推理评估基准,通过多样任务设置、任务感知评估协议和高质量评价集,揭示工具整合推理中的持续瓶颈。

Comments 10 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09537 2026-05-12 cs.RO

Drift is a Sampling Error: SNR-Aware Power Distributions for Long-Horizon Robotic Planning

漂移是一种采样误差:面向长时间 horizon 的机器人规划的 SNR 意识功率分布

Kewei Chen, Yayu Long, Mingsheng Shang

机构 * Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(中国科学院重庆绿色智能技术研究院) Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆学院)

AI总结 本文提出 CAPS 框架,通过功率分布增强全局轨迹概率,结合 SNR 机制实现动态切换,提升长horizon 机器人规划的鲁棒性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09455 2026-05-12 cs.CV

Adaptive 3D Convolution for Remote Sensing Image Fusion

自适应3D卷积用于遥感图像融合

Siran Peng, Xiangyu Zhu, Shang-Qi Deng, Liang-Jian Deng, Zhen Lei

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Mathematical Sciences/Multi-Hazard Early Warning Key Laboratory of Sichuan Province, University of Electronic Science and Technology of China(数学科学学院/四川省多灾种早期预警重点实验室,电子科技大学) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(人工智能与机器人中心,香港科学院,中国科学院)

AI总结 本文提出自适应3D卷积方法,通过生成内容感知的3D卷积核,有效整合空间和光谱信息,提升遥感图像融合的精度与效率。

Comments Accepted by IEEE Transactions on Image Processing (TIP), Early Access, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09281 2026-05-12 cs.LG

TileQ: Efficient Low-Rank Quantization of Mixture-of-Experts with 2D Tiling

TileQ: 一种高效的混合专家低秩量化方法基于二维铺砖

Hongyaoxing Gu, Xinzhe Chen, Lijuan Hu, Fangfang Liu

机构 * Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 TileQ通过二维铺砖结构低秩量化方法,在不进行微调的情况下实现混合专家模型的高效量化,显著降低内存使用和推理延迟,同时保持最先进的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00642 2026-05-12 cs.AI cs.CV

Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding

从自身学习点击位置:面向GUI定位的在线自蒸馏

Yan Zhang, Daiqing Wu, Huawen Shen, Can Ma, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) VCIP & TMCC & DISSec, College of Computer Science, Nankai University(南开大学计算机学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

AI总结 本文提出GUI-SD框架,通过视觉增强上下文和熵引导蒸馏提升GUI定位性能,实验显示其在准确性和训练效率上优于现有方法。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28254 2026-05-12 cs.LG stat.ML

MuonEq: Balancing Before Orthogonalization with Lightweight Equilibration

MuonEq: 在正交化前平衡以实现轻量级均衡

Da Chang, Qiankun Shi, Lvgang Zhang, Yu Li, Ruijie Zhang, Yao Lu, Yongxiang Liu, Ganzhao Yuan

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Shenzhen University of Advanced Technology(深圳大学) Pengcheng Laboratory(鹏城实验室) Sun Yat-sen University(中山大学) Southern University of Science and Technology(南方科技大学) George Washington University(乔治华盛顿大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 MuonEq通过在正交化前平衡动量矩阵,改进了矩阵参数的训练,其核心方法包括RC、R和C三种归一化形式,提升了正交化所见的几何结构,并在LLaMA2预训练中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23273 2026-05-12 cs.CL

UPA: Unsupervised Prompt Agent via Tree-Based Search and Selection

UPA:基于树状搜索与选择的无监督提示代理

Siran Peng, Weisong Zhao, Tianyu Fu, Chenxu Zhao, Tianshuo Zhang, Haoyuan Zhang, Xiangyu Zhu, Minghui Wu, Zhen Lei

机构 * MAIS, CASIA(中国科学院自动化研究所) SAI, UCAS(中国科学技术大学人工智能学院) Mininglamp Technology(Mininglamp技术公司) IIE, CAS(中国科学院信息研究所) SCSE, FIE, M.U.S.T(慕斯科技大学信息工程系)

AI总结 本文提出UPA,一种无需真实奖励信号的无监督提示代理,通过树状结构搜索和基于Bradley-Terry-Luce模型的两阶段框架实现高效提示优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15816 2026-05-12 cs.LG

On the Convergence of Muon and Beyond

关于穆斯和更高级的收敛性

Da Chang, Yongxiang Liu, Ganzhao Yuan

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Shenzhen University of Advanced Technology(深圳大学) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文研究了穆斯算法的理论极限,证明了在无 horizon 学习率调度下,穆斯-MVR2 可以达到最优收敛率,同时在 PL 条件下,穆斯-MVR1 和穆斯-MVR2 分别实现了最佳迭代率和最后迭代率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09053 2026-05-12 cs.CV

LCGNav: Local Candidate-Aware Geometric Enhancement for General Topological Planning in Vision-Language Navigation

LCGNav: 本地候选感知的几何增强以实现连续环境中的通用拓扑规划

Jiankun Peng, Jianyuan Guo, Yiguang Yang, Yue Liu, Jiashuang Yan, Ying Xu

机构 * The Aerospace Information Research Institute, Chinese Academy of Sciences, Beijing(中国科学院航空航天信息研究所,北京) The School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences, Beijing(中国科学院大学电子电气与通信工程学院,北京) The Department of Computer Science, City University of Hong Kong, Hong Kong, SAR, China(香港城市大学计算机科学系,香港特别行政区,中国)

AI总结 LCGNav通过本地几何增强框架解决连续环境视觉语言导航中局部深度信息冗余和候选前沿关注不足的问题,提升拓扑规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09005 2026-05-12 cs.RO cs.AI

Towards Backdoor-Based Ownership Verification for Vision-Language-Action Models

面向视觉-语言-动作模型的后门基于所有权验证

Ming Sun, Rui Wang, Xingrui Yu, Lihua Jing, Hangyu Du, Zhenglin Wan, Xu Pan, Ivor Tsang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) A*STAR Institute of High Performance Computing (A*STAR IHPC)(新加坡A*STAR高性能计算研究所) A*STAR Centre for Frontier AI Research (A*STAR CFAR)(新加坡A*STAR前沿人工智能研究中心) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) College of Design and Engineering, Nanyang Technological University(南洋理工大学设计与工程学院) Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS), Wuhan University(武汉大学测绘遥感信息工程国家重点实验室(LIESMARS))

AI总结 本文提出GuardVLA,首个针对视觉-语言-动作模型的后门基于所有权验证框架,通过在训练中嵌入隐蔽无害的后门水印,实现可靠的模型所有权验证并保持正常任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08885 2026-05-12 cs.LG

Compact SO(3) Equivariant Atomistic Foundation Models via Structural Pruning

基于结构剪枝的紧凑SO(3)等变原子基础模型

Chen Wang, Siyu Hu, Guangming Tan, Weile Jia

机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所状态关键实验室) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出结构剪枝方法,通过保留完整块保持SO(3)等变性,减少计算成本同时保持高精度,验证了在Matbench Discovery leaderboard上优于小模型,并在下游应用中显著降低能量和力误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08878 2026-05-12 cs.CR cs.AI

Why Do Aligned LLMs Remain Jailbreakable: Refusal-Escape Directions, Operator-Level Sources, and Safety-Utility Trade-off

为何对齐的LLM仍可被劫持:拒绝-逃逸方向、操作级来源及安全-效用权衡

Yu Chen, Yuanhao Liu, Qi Cao

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 研究揭示对齐LLM仍易被劫持的原因,通过连续输入变换视角,发现拒绝-逃逸方向(RED)及操作级来源的结构漏洞,揭示安全与效用的权衡关系。

Comments 40 pages, 45 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08840 2026-05-12 cs.CL

ReST-KV: Robust KV Cache Eviction with Layer-wise Output Reconstruction and Spatial-Temporal Smoothing

ReST-KV: 基于分层输出重建与时空平滑的鲁棒KV缓存淘汰

Yongqi An, Chang Lu, Kuan Zhu, Tao Yu, Chaoyang Zhao, Hong Wu, Ming Tang, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(基础模型研究中心,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) University of Electronic Science and Technology of China(电子科技大学) Wuhan AI Research(武汉人工智能研究) Objecteye Inc.(Objecteye公司)

AI总结 本文提出ReST-KV方法,通过分层输出重建和时空平滑优化KV缓存淘汰,提升长序列生成效率,实测在多个基准测试中表现优异,同时显著降低解码延迟。

Comments Accepted at ICLR 2026. Project Page: https://github.com/an-yongqi/rest-kv

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08799 2026-05-12 cs.RO

ElasticFlow: One-Step Physics-Consistent Policy with Elastic Time Horizons for Language-Guided Manipulation

ElasticFlow: 语言引导操作中的弹性时间 horizon 的一步物理一致策略

Kewei Chen, Yayu Long, Shuai Li, Mingsheng Shang

机构 * Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(中国科学院重庆绿色智能技术研究所) Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆校区) Faculty of Information Technology and Electrical Engineering, University of Oulu, Finland(芬兰奥卢大学信息科技与电气工程学院)

AI总结 ElasticFlow通过弹性时间 horizon 机制和直接建模平均速度场,实现高效的一步映射,提升语言引导操作的物理一致性和效率。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08762 2026-05-12 cs.SD cs.LG

Omni-DeepSearch: A Benchmark for Audio-Driven Omni-Modal Deep Search

Omni-DeepSearch:一种基于音频的多模态深度搜索基准

Tao Yu, yiming ding, Shenghua Chai, Minghui Zhang, Zhongtian Luo, Xinming Wang, Xinlong Chen, Zhaolu Kang, Junhao Gong, Yuxuan Zhou, Haopeng Jin, Zhiqing Cui, Jiabing Yang, YiFan Zhang, Hongzhu Yi, Zheqi He, Xi Yang, Yan Huang, Liang Wang

机构 * CASIA UCAS BAAI Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文提出Omni-DeepSearch基准,用于评估基于音频的多模态深度搜索能力,通过多跳推理生成客观答案,结果显示该任务极具挑战性。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08761 2026-05-12 cs.MA cs.LG

Beyond the All-in-One Agent: Benchmarking Role-Specialized Multi-Agent Collaboration in Enterprise Workflows

超越全能代理:企业工作流中角色专业化多代理协作的基准测试

Tao Yu, Hao Wang, Changyu Li, Shenghua Chai, Minghui Zhang, Zhongtian Luo, Yuxuan Zhou, Haopeng Jin, Zhaolu Kang, Jiabing Yang, YiFan Zhang, Xinming Wang, Hongzhu Yi, Zheqi He, Jing-Shu Zheng, Xi Yang, Yan Huang, Liang Wang

机构 * BAAI(北京人工智能研究院) CASIA(中国科学院自动化研究所) UCAS(中国科学技术大学) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文提出EntCollabBench,用于评估企业多代理协作,模拟权限隔离组织,包含工作流和审批两个子集,通过执行轨迹、数据库验证和确定性政策裁决评估代理系统,实验表明当前模型在企业协作中仍存在缺陷。

Comments 45 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08721 2026-05-12 cs.CL

Breaking the Impasse: Dual-Scale Evolutionary Policy Training for Social Language Agents

打破僵局:用于社交语言代理的双尺度进化策略训练

Minzheng Wang, Run Luo, Yanbo Wang, Zichen Liu, Yuqiao Tan, Tao Tan, Xu Nan, Yinhe Zheng, Wenji Mao

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) National University of Singapore(新加坡国立大学) Ritzz-AI

AI总结 本文提出双尺度进化策略训练方法,解决社交语言游戏中因策略空间庞大导致的进化停滞问题,通过动态优化景观干预,恢复梯度信号并促进持续战略探索。

Comments Accepted to the ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08612 2026-05-12 cs.RO

ATAAT: Adaptive Threat-Aware Adversarial Tuning Framework against Backdoor Attacks on Vision-Language-Action Models

ATAAT: 面向视觉-语言-动作模型后门攻击的自适应威胁感知对抗调制框架

Kewei Chen, Yayu Long, Shuai Li, Mingsheng Shang

机构 * Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(重庆绿色智能技术研究院,中国科学院) Chongqing School, University of Chinese Academy of Sciences(重庆学校,中国科学院大学) Faculty of Information Technology and Electrical Engineering, University of Oulu, Finland(奥卢大学信息科技与电气工程学院,芬兰)

AI总结 本文提出ATAAT框架,解决视觉-语言-动作模型中后门攻击的梯度干扰问题,通过威胁-方法自适应映射机制实现高效攻击并保持隐蔽性,实验表明其在高成功率和低污染率下表现优异。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04671 2026-05-12 cs.LG

ITBoost: Information-Theoretic Trust for Robust Boosting

ITBoost: 信息论信任用于鲁棒提升

Ye Su, Longlong Zhao, Diego Garcia-Gil, Jipeng Guo, Gangchun Zhang, Jinxin Chen, Jinsong Chen

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Department of Software Engineering, Andalusian Research Institute in Data Science and Computational Intelligence (DaSCI), University of Granada(软件工程系,安达卢西亚数据科学与计算智能研究所(DaSCI),格拉纳达大学) College of Information Science and Technology, Beijing University of Chemical Technology(信息科学与技术学院,北京化工大学)

AI总结 ITBoost通过信息论方法评估样本可靠性,提升模型在噪声环境下的鲁棒性,同时保持清洁数据上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13415 2026-05-12 cs.IR cs.CL cs.CV

Attention Grounded Enhancement for Visual Document Retrieval

基于注意力的视觉文档检索增强

Wanqing Cui, Wei Huang, Yazhi Guo, Yibo Hu, Meiguang Jin, Junfeng Ma, Keping Bi

机构 * Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出AGREE框架,通过多模态大语言模型的注意力机制引导检索器识别相关文档区域,提升细粒度相关性建模,实验表明在ViDoRe V2基准上显著优于传统方法。

Comments Published as a conference paper at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08158 2026-05-12 cs.CV cs.AI

HY-Himmel Technical Report: Hierarchical Interleaved Multi-stream Motion Encoding for Long Video Understanding

HY-Himmel技术报告:分层交错多流运动编码用于长视频理解

Haopeng Jin, Hongzhu Yi, Wenlong Zhao, Jinwen Luo, Shani Ye, Zhenyu Guan, Shiquan Dong, Tiankun Yang, Tao Yu

机构 * Tencent(腾讯) University of Chinese Academy of Sciences(中国科学院大学) Beijing Forestry University(北京林业大学)

AI总结 HY-Himmel通过分层视频语言框架解决长视频理解中多模态语言模型的三个瓶颈问题,采用轻量级压缩域三流适配器编码密集帧,提升运动感知能力,实验证明其在Video-MME上性能优于32帧基准。

Comments 59 pages, 42 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08138 2026-05-12 cs.LG

DataArc-SynData-Toolkit: A Unified Closed-Loop Framework for Multi-Path, Multimodal, and Multilingual Data Synthesis

DataArc-SynData-Toolkit:多路径、多模态和多语言数据合成的统一闭环框架

Zhichao Shi, Cehao Yang, Hao Zhou, Xiaojun Wu, Huajie Li, Xuhui Jiang, Chengjin Xu, Yuanzhuo Wang, Jian Guo

机构 * DataArc Tech Ltd.(DataArc科技有限公司) IDEA Research(IDEA研究院) International Digital Economy Academy(国际数字经济学院) School of Advanced Interdisciplinary Sciences, UCAS(北京大学交叉学科研究院) Institute of Computing Technology, CAS(中国科学院计算技术研究所) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出DataArc-SynData-Toolkit,通过统一的合成范式和模块化架构,解决现有合成数据工具在流程复杂、标准碎片化和多模态扩展性方面的不足,提升数据生成效率和质量。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08128 2026-05-12 cs.LG cs.AI

Towards Universal Gene Regulatory Network Inference: Unlocking Generalizable Regulatory Knowledge in Single-cell Foundation Models

迈向通用基因调控网络推断:在单细胞基础模型中解锁可泛化的调控知识

Jiaxin Qi, Hang Li, Yan Cui, Yuhua Zheng, Jianqiang Huang

机构 * Computer Network Information Center, Chinese Academy of Sciences, Beijing, China(中国科学院计算机网络信息中心,北京,中国) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou, China(中国科学院大学杭州高等研究院,杭州,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

AI总结 本文提出两种新方法,通过单细胞基础模型提取隐含的调控信息,提升基因调控网络推断的泛化能力,实验表明优于现有方法。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00380 2026-05-11 cs.LG cs.CL

ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning

ResRL: 通过负样本投影残差强化学习提升大语言模型推理能力

Zihan Lin, Xiaohan Wang, Jie Cao, Jiajun Chai, Li Wang, Xiaodong Lu, Wei Lin, Ran He, Guojun Yin

机构 * MAIS\&NLPR, Institute of Automation, Chinese Academy of Sciences, Beijing, China(MAIS与NLPR,自动化研究所,中国科学院,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(先进交叉学科学院,中国科学院大学,北京,中国)

AI总结 本文提出ResRL,通过解耦正负响应的语义分布,提升LLM推理能力同时保持生成多样性,在十二个基准测试中超越强基线,尤其在数学推理上表现更优。

Comments Accepted to ICML 2026. Preprint version. https://github.com/1229095296/ResRL.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19697 2026-05-11 cs.CV

Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks

揭示细粒度视觉痕迹:评估多模态交错推理链在多模态STEM任务中的表现

Jing Jin, Hao Liu, Yan Bai, Yihang Lou, Zhenke Wang, Tianrun Yuan, Juntong Chen, Yongkang Zhu, Fanhu Zeng, Xuanyu Zhu, Tao Feng, Yige Xu

机构 * Tsinghua University(清华大学) Meituan Inc(美团公司) Central South University(中南大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出StepSTEM基准,通过严格筛选的283个STEM问题,评估多模态大语言模型的跨模态推理能力,发现现有模型仍依赖文本推理,揭示了真实跨模态STEM推理的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02001 2026-05-11 cs.NI cs.LG

Versatile yet Efficient Network Traffic Analysis: Offloading Network Foundation Model to SmartNIC

多功能且高效的网络流量分析:将网络基础模型卸载到智能网卡

Chungang Lin, Xuying Meng, Tianyu Zuo, Weiyao Zhang, Meng Shen, Ruijie Zhao, Guanming Che, Ruiqi Meng, Ziyue Huang, Haitong Luo, Zhiwei Xu, Yujun Zhang

机构 * Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所) University of Chinese Academy of Sciences, China(中国科学院大学) University of Virginia, USA(弗吉尼亚大学) Beijing Institute of Technology, China(北京理工大学) Southeast University, China(东南大学) Northeastern University, China(东北大学) Haihe Lab of ITAI, China(ITAI海河实验室) Corresponding authors(通讯作者)

AI总结 本文提出Nepco系统,通过将网络基础模型卸载到智能网卡,实现多功能且高效的网络流量分析,减少端到端延迟。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07492 2026-05-11 cs.CV

How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings

文档解析距离解决还有多远?PureDocBench:一个跨干净、退化和现实场景的可追溯基准测试

Zhiheng Li, Zongyang Ma, Jiaxian Chen, Jianing Zhang, Zhaolong Su, Yutong Zhang, Zhiyin Yu, Ruiqi Liu, Xiaolei Lv, Bo Li, Jun Gao, Ziqi Zhang, Chunfeng Yuan, Bing Li, Weiming Hu

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学技术大学) NWPU(西北工业大学) JLU(吉林大学) USTC(中国科学技术大学) PKU(北京大学) HelloGroup ShanghaiTech(上海科技大学) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(北京多模态信息超级智能安全重点实验室)

AI总结 本文提出PureDocBench,一个可追溯的基准测试,覆盖10个领域、66个子类和1475页文档,包含清洁、数字退化和现实退化三种版本。评估40种模型发现,文档解析尚未解决,最佳模型得分仅74分,公式识别仍是瓶颈,通用VLM在退化下表现不如专用模型。

Comments 42 pages, 20 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏