arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

共收录 1960
2601.01459 2026-01-06 cs.SD eess.AS

OV-InstructTTS: Towards Open-Vocabulary Instruct Text-to-Speech

OV-InstructTTS: 向开放词汇指令文本到语音迈进

Yong Ren, Jiangyan Yi, Jianhua Tao, Haiyang Sun, Zhengqi Wen, Hao Gu, Le Xu, Ye Bai

机构 * The State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

AI总结 OV-InstructTTS通过开放词汇指令和推理驱动框架提升文本到语音的指令遵循和表达性

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24794 2026-01-06 cs.CL

MR-Align: Meta-Reasoning Informed Factuality Alignment for Large Reasoning Models

MR-Align: 为大推理模型引入元推理的事实性对齐

Xinming Wang, Jian Xu, Bin Yu, Sheng Lian, Hongzhu Yi, Yi Chen, Yingjian Zhu, Boran Wang, Hongming Yang, Han Hu, Xu-Yao Zhang, Cheng-Lin Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) University of Chinese Academy of Sciences(中国科学院大学) Tencent(腾讯)

AI总结 MR-ALIGN通过元推理引导的对齐框架提升大型推理模型的事实准确性,通过优化推理过程中的状态转移概率来增强事实性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02109 2026-01-06 cs.CV

Unaligned RGB Guided Hyperspectral Image Super-Resolution with Spatial-Spectral Concordance

无对齐RGB引导的超分辨率超光谱图像与空间-光谱一致性

Yingkai Zhang, Zeqiang Lai, Tao Zhang, Ying Fu, Chenghu Zhou

机构 * Beijing Institute of Technology(北京理工大学) Hangzhou Dianzi University(杭州电子科技大学) Chinese Academy of Sciences(中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出SSC-HSR框架,通过改进的对齐和融合模块,解决超分辨率中空间和光谱一致性问题,提升超光谱图像的重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00264 2026-01-05 cs.CV

S1-MMAlign: A Large-Scale, Multi-Disciplinary Dataset for Scientific Figure-Text Understanding

S1-MMAlign: 一个大规模、跨学科的数据集用于科学图像-文本理解

He Wang, Longteng Guo, Pengkang Huo, Xuanxu Lin, Yichen Yuan, Jie Jiang, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 S1-MMAlign是一个大规模跨学科数据集,通过语义增强提升科学图像与文本的对齐质量,推动AI在科学领域的应用。

Comments 12 pages, 5 figures. Dataset available at https://huggingface.co/datasets/ScienceOne-AI/S1-MMAlign

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11116 2026-01-05 cs.IR cs.CL

PaperRegister: Boosting Flexible-grained Paper Search via Hierarchical Register Indexing

PaperRegister: 通过分层注册索引提升灵活粒度论文搜索

Zhuoqun Li, Xuanang Chen, Hongyu Lin, Yaojie Lu, Xianpei Han, Shanshan Jiang, Bin Dong, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Ricoh Software Research Center Beijing, Ricoh Company, Ltd.(富士通软件研究(北京)中心,富士通公司)

AI总结 PaperRegister通过分层注册索引提升灵活粒度论文搜索,实现细粒度查询的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01495 2026-01-05 cs.CL

C-VARC: A Large-Scale Chinese Value Rule Corpus for Value Alignment of Large Language Models

C-VARC:一个大规模的中文价值观规则语料库用于大语言模型的价值对齐

Ping Wu, Guobin Shen, Dongcheng Zhao, Yuwei Wang, Yiting Dong, Yu Shi, Enmeng Lu, Feifei Zhao, Yi Zeng

机构 * BrainCog Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所脑认知实验室,北京,中国) Beijing Key Laboratory of Safe AI and Superalignment, Beijing, China(北京安全人工智能与超对齐关键实验室,北京,中国) Beijing Institute of AI Safety and Governance, Beijing, China(北京人工智能安全与治理研究所,北京,中国) The School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院,北京,中国) Long-term AI, Beijing, China(长期人工智能,北京,中国)

AI总结 C-VARC通过构建大规模中文价值观规则语料库,提供了一种基于中国核心价值观的价值对齐方法,有效提升了大语言模型在不同文化背景下的伦理评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24754 2026-01-01 astro-ph.IM cs.AI

AstroReview: An LLM-driven Multi-Agent Framework for Telescope Proposal Peer Review and Refinement

AstroReview: 一种基于大语言模型的多智能体框架用于望远镜提案同行评审与优化

Yutong Wang, Yunxiang Xiao, Yonglin Tian, Junyong Li, Jing Wang, Yisheng Lv

机构 * The Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统重点实验室,自动化研究所,中国科学院) The School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

AI总结 AstroReview通过多智能体框架实现望远镜提案的自动化评审与优化,显著提升评审效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24733 2026-01-01 cs.CL

BIOME-Bench: A Benchmark for Biomolecular Interaction Inference and Multi-Omics Pathway Mechanism Elucidation from Scientific Literature

BIOME-Bench: 一个用于生物分子相互作用推断和多组学通路机制阐明的基准

Sibo Wei, Peng Chen, Lifeng Dong, Yin Luo, Lei Wang, Peng Zhang, Wenpeng Lu, Jianbin Guo, Hongjun Yang, Dajun Zeng

机构 * Beijing Wenge Technology Co., Ltd(北京文格科技有限公司) Experimental Research Center, China Academy of Chinese Medical Sciences(中国中医科学院实验研究中心) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东科学院)) School of New Media and Communication, Tianjin University(天津大学新闻与传播学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 BIOME-Bench通过四阶段工作流评估LLMs在多组学分析中的生物分子相互作用推断和通路机制阐明能力,揭示现有模型在细粒度关系区分和通路解释上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10161 2026-01-01 cs.CL cs.AI

Large Language Model Sourcing: A Survey

大语言模型的来源:一项综述

Liang Pang, Jia Gu, Sunhao Dai, Zihao Wei, Zenghao Duan, Kangxi Wu, Zhiyi Yin, Jun Xu, Huawei Shen, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

AI总结 本文综述了大语言模型来源的四个维度,并提出双范式分类法以分类现有来源方法,旨在提高模型的透明度和可信度。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23105 2026-01-01 cs.CV

Towards Comprehensive Interactive Change Understanding in Remote Sensing: A Large-scale Dataset and Dual-granularity Enhanced VLM

迈向遥感中全面交互变化理解:一个大规模数据集和双粒度增强VLM

Junxiao Xue, Quan Deng, Xuecheng Wu, Kelu Yao, Xinyi Yin, Fei Yu, Wei Zhou, Yanfei Zhong, Yang Liu, Dingkang Yang

机构 * Research Center for Space Computing System, Zhejiang Lab(浙江省实验室空间计算系统研究中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Cyber Science and Engineering, Zhengzhou University(郑州大学网络科学与工程学院) Liaoning University of Technology(辽宁科技学院) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS), Wuhan University(武汉测绘遥感与信息工程国家重点实验室(LIESMARS)) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)

AI总结 本文提出ChangeIMTI数据集和ChangeVG模型,通过双粒度增强方法提升遥感图像变化理解的准确性和交互性。

Comments Junxiao Xue, Quan Deng, and Xuecheng Wu deserve equal contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04903 2026-01-01 cs.CL

ACE-RL: Adaptive Constraint-Enhanced Reward for Long-form Generation Reinforcement Learning

ACE-RL:自适应约束增强的长形式生成强化学习

Jianghao Chen, Wei Sun, Qixiang Yin, Zhixing Tan, Jiajun Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) Tsinghua University(清华大学) Wuhan AI Research(武汉人工智能研究所)

AI总结 ACE-RL通过自适应约束增强的强化学习方法,提升长形式生成任务的训练效果,实验显示在WritingBench上优于现有基线模型。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07307 2026-01-01 cs.CV cs.AI

MCITlib: Multimodal Continual Instruction Tuning Library and Benchmark

MCITlib: 多模态持续指令微调库与基准

Haiyang Guo, Fei Zhu, Hongbo Zhao, Fanhu Zeng, Wenzhuo Liu, Shijie Ma, Da-Han Wang, Xu-Yao Zhang

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(中国科学院香港创新科学研究院人工智能与机器人中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Fujian Key Laboratory of Pattern Recognition and Image Understanding, School of Computer and Information Engineering, Xiamen University of Technology(福建 pattern recognition and image understanding 工程学院,厦门大学科技学院)

AI总结 MCITlib提供多模态持续学习的库和基准,支持8种算法并评估3个基准,旨在解决灾难性遗忘和跨模态协调问题。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06752 2026-01-01 cs.LG cs.NA math.NA stat.ML

Mathematical artificial data for operator learning

用于算子学习的数学人工数据

Heng Wu, Benzhuo Lu

机构 * SKLMS, ICMSEC, NCMIS, Academy of Mathematics and Systems Science, Chinese Academy of Sciences, Beijing 100190, China School of Mathematical Sciences, University of Chinese Academy of Sciences, Beijing 100049, China(SKLMS,ICMSEC,NCMIS,系统科学 academy,中国科学院,北京 100190,中国 数学科学学院,中国科学院大学,北京 100049,中国)

AI总结 本文提出MAD框架,通过整合物理定律与数据驱动学习,实现高效且严谨的微分方程算子学习。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22941 2025-12-30 cs.MA cs.AI

Heterogeneity in Multi-Agent Reinforcement Learning

多智能体强化学习中的异质性

Tianyi Hu, Zhiqiang Pu, Yuan Wang, Tenghai Qiu, Min Chen, Xin Yu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) National Key Laboratory of Cognition and Decision Intelligence for Complex Systems(复杂系统认知与决策智能国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本文提出了一种多智能体动态参数共享算法,通过定义异质性距离和量化方法,提升MARL中对异质性的理解和应用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22822 2025-12-30 cs.CV

KANO: Kolmogorov-Arnold Neural Operator for Image Super-Resolution

KANO:Kolmogorov-Arnold神经算子用于图像超分辨率

Chenyu Li, Danfeng Hong, Bing Zhang, Zhaojie Pan, Jocelyn Chanussot

机构 * Southeast University(东南大学) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所) College of Resources and Environment, University of Chinese Academy of Sciences(中国科学院大学资源与环境学院) Univ. Grenoble Alpes, Inria, CNRS, Grenoble INP, LJK(格勒诺布尔阿尔卑斯大学、法国国家科研机构(Inria)、法国国家科学研究中心(CNRS)、格勒诺布尔INP、LJK)

AI总结 KANO利用Kolmogorov-Arnold定理提出可解释性神经算子,用于图像超分辨率,通过结构化方法捕捉频谱特征,提升结果的物理可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19683 2025-12-30 cs.CV

From Indoor to Open World: Revealing the Spatial Reasoning Gap in MLLMs

从室内到开放世界:揭示MLLMs中的空间推理差距

Mingrui Wu, Zhaozhi Wang, Fangjinhua Wang, Jiaolong Yang, Marc Pollefeys, Tong Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) ETH Zürich(苏黎世联邦理工学院) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出了一种大规模基准测试,通过户外数据集揭示MLLMs在空间推理方面的不足,并证明其依赖语言先验而非真实视觉推理。

Comments Project page: https://mingrui-wu.github.io/openbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15560 2025-12-30 cs.CV

GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models

GRAN-TED: 生成稳健、对齐且细腻的文本嵌入以用于扩散模型

Bozhou Li, Sihan Yang, Yushuo Guan, Ruichuan An, Xinlong Chen, Yang Shi, Pengfei Wan, Wentao Zhang, Yuanxing zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Xi’an Jiaotong University(西安交通大学) School of Artificial Intelligence, UCAS(清华大学人工智能学院)

AI总结 GRAN-TED提出了一种生成稳健、对齐且细腻的文本嵌入以用于扩散模型的范式,通过TED-6K基准提升文本编码器性能,显著加快扩散模型训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21118 2025-12-30 cs.CL cs.AI

The Gray Zone of Faithfulness: Taming Ambiguity in Unfaithfulness Detection

信仰的灰色地带:在不忠检测中消除歧义

Qiang Ding, Lvzhou Luo, Yixuan Cao, Ping Luo

机构 * Key Lab of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院信息处理重点实验室) State Key Lab of Al Safety(人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出了一种新的忠实性注释框架和VeriGray基准,用于解决摘要任务中因外部知识边界不明确导致的注释歧义问题,并展示了其对现有方法的挑战。

Comments Update the evaluation results due to the annotation updates; revise the citation to Seo et al., 2025; add the acknowledgements

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14894 2025-12-30 cs.RO cs.SY eess.SY

Never too Cocky to Cooperate: An FIM and RL-based USV-AUV Collaborative System for Underwater Tasks in Extreme Sea Conditions

从不自大合作:一种基于FIM和强化学习的USV-AUV协作系统用于极端海况下的水下任务

Jingzehua Xu, Guanwen Xie, Jiwei Tang, Yimian Ding, Weiyi Liu, Junhao Huang, Shuai Zhang, Yi Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Department of Data and Systems Engineering, The University of Hong Kong(数据与系统工程系,香港大学) School of Engineering Science, University of Chinese Academy of Sciences(工程科学学院,中国科学院大学) Department of Data Science, New Jersey Institute of Technology(数据科学系,新泽西理工学院)

AI总结 本文提出一种基于FIM和强化学习的USV-AUV协作系统,用于提升极端海况下水下任务的性能。

Comments This paper has been accepted by IEEE Transactions on Mobile Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13264 2025-12-30 cs.LG cs.AI

Constraint Decoupled Latent Diffusion for Protein Backmapping

约束解耦的潜在扩散用于蛋白质反向映射

Xu Han, Yuancheng Sun, Kai Chen, Yuxuan Ren, Kang Liu, Qiwei Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 CODLAD通过约束解耦的潜在扩散方法,实现了蛋白质反向映射中高精度、多样化的构象生成。

Comments v2: Title changed. Major revision with new experiments. Accepted by JCTC

Journal ref J. Chem. Theory Comput. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03427 2025-12-30 cs.AI

TPTU: Large Language Model-based AI Agents for Task Planning and Tool Usage

TPTU:基于大型语言模型的AI代理用于任务规划和工具使用

Jingqing Ruan, Yihong Chen, Bin Zhang, Zhiwei Xu, Tianpeng Bao, Guoqing Du, Shiwei Shi, Hangyu Mao, Ziyue Li, Xingyu Zeng, Rui Zhao

机构 * University of Chinese Academy of Sciences(中国科学院大学) SenseTime Research(商汤科技研究院) HKUST(香港科技大学)

AI总结 本文提出基于大型语言模型的AI代理框架,设计两种代理类型以提升任务规划和工具使用能力,并通过实验验证其在复杂任务中的有效性。

Comments Accepted in NeurIPS-2023 Workshop on Foundation Models for Decision Making

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00336 2025-12-30 cs.RO cs.AI

Never-Ending Behavior-Cloning Agent for Robotic Manipulation

永不终止的行为克隆代理用于机器人操作

Wenqi Liang, Gan Sun, Yao He, Yu Ren, Jiahua Dong, Yang Cong

机构 * State Key Laboratory of Robotics, Shenyang Institute of Automation, Chinese Academy of Sciences(机器人国家重点实验室,沈阳自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) School of Automation Science and Engineering, South China University of Technology(自动化科学与工程学院,华南理工大学) Mohamed bin Zayed University of Artificial Intelligence(马斯达尔大学人工智能学院)

AI总结 本文提出NBAgent,通过持续学习技能共享和特定属性,解决具身机器人中3D场景表示和人类水平任务学习的挑战。

Comments 17 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21857 2025-12-29 cs.CV

Fast Inference of Visual Autoregressive Model with Adjacency-Adaptive Dynamical Draft Trees

视觉自回归模型快速推断的邻接自适应动态草案树

Haodong Lei, Hongsong Wang, Xin Geng, Liang Wang, Pan Zhou

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(东南大学新一代人工智能技术及交叉应用重点实验室(教育部)) New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室(NLPR),多模态人工智能系统国家重点实验室(MAIS),中国科学院自动化研究所(CASIA)) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Computing and Information Systems, Singapore Management University(新加坡国立大学计算机与信息学院)

AI总结 ADT-Tree通过邻接自适应动态草案树提升视觉自回归模型的推断速度,实现3.13倍和3.05倍的加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21683 2025-12-29 cs.CV

Contrastive Graph Modeling for Cross-Domain Few-Shot Medical Image Segmentation

对比图模型用于跨域少样本医学图像分割

Yuntian Bo, Tao Zhou, Zechao Li, Haofeng Zhang, Ling Shao

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出对比图模型,通过结构一致性先验和子图匹配解码机制,在跨域少样本医学图像分割中实现高精度与强源域准确性。

Comments Accepted to IEEE Transactions on Medical Imaging (T-MI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21586 2025-12-29 cs.LG

Videos are Sample-Efficient Supervisions: Behavior Cloning from Videos via Latent Representations

视频是高效的监督:通过潜在表示从视频中进行行为克隆

Xin Liu, Haoran Li, Dongbin Zhao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

AI总结 本文提出通过潜在表示从视频中进行行为克隆的方法,实现了高效样本的视觉策略学习,无需其他专家监督。

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25244 2025-12-29 cs.LG

BSFA: Leveraging the Subspace Dichotomy to Accelerate Neural Network Training

BSFA:利用子空间二元性加速神经网络训练

Wenjie Zhou, Bohan Wang, Wei Chen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团)

AI总结 BSFA通过子空间二元性加速神经网络训练,利用PCA估计子空间并分块策略提升收敛速度和稳定性。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06558 2025-12-29 cs.LG cs.AI

The Primacy of Magnitude in Low-Rank Adaptation

低秩适应中的主导性

Zicheng Zhang, Haoran Li, Yifeng Zhang, Guoqiang Gong, Jiaxing Wang, Junxing Hu, Pengzhang Liu, Qixia Jiang

机构 * University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出LoRAM,一种基于幅度驱动的低秩适应初始化方法,通过优化更新幅度提升效率并匹配或超越传统谱初始化方法。

Comments Accepted by NeurIPS 2025, spotlight

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20937 2025-12-25 cs.CV

Beyond Artifacts: Real-Centric Envelope Modeling for Reliable AI-Generated Image Detection

超越伪影:面向真实世界的环境建模用于可靠的AI生成图像检测

Ruiqi Liu, Yi Han, Zhengbo Zhang, Liwei Yao, Zhiyuan Yan, Jialiang Shen, ZhiJin Chen, Boyi Sun, Lubin Weng, Jing Dong, Yan Wang, Shu Wu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, UCAS(北京大学交叉信息学科研究中心) Southwest University(西南大学) Shanghai Second Polytechnic University(上海第二工业大学) Peking University(北京大学) The University of Sydney(悉尼大学) Tsinghua University(清华大学)

AI总结 本文提出REM方法,通过建模真实图像分布来提升AI生成图像检测的可靠性,并构建RealChain基准以评估模型在真实世界退化下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20174 2025-12-24 cs.CV cs.CL cs.IR

Towards Natural Language-Based Document Image Retrieval: New Dataset and Benchmark

迈向基于自然语言的文档图像检索:新数据集和基准

Hao Guo, Xugong Qin, Jun Jie Ou Yang, Peng Zhang, Gangyan Zeng, Yubo Li, Hailun Lin

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Science and Engineering, Nanjing University of Science and Technology(南京理工大学 cyber 科学与工程学院) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) University of Southern California(美国南加州大学) Laboratory for Advanced Computing and Intelligence Engineering(先进计算与智能工程实验室)

AI总结 本文提出基于自然语言的文档图像检索基准,通过生成细粒度语义查询提升检索性能,推动视觉文档理解领域研究。

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20166 2025-12-24 cs.RO

LoLA: Long Horizon Latent Action Learning for General Robot Manipulation

LoLA:面向通用机器人操作的长周期隐式动作学习

Xiaofan Wang, Xingyu Gao, Jianlong Fu, Zuolei Li, Dean Fortier, Galen Mullins, Andrey Kolobov, Baining Guo

机构 * Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) University of Chinese Academy of Sciences(中国科学院大学) Microsoft Research(微软研究院)

AI总结 LoLA通过整合长期多视角观察和机器人本体感觉,实现长周期、语言引导的机器人操作任务,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏