arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

共收录 1960
2209.14711 2025-12-19 cs.CV

Low-Resolution Action Recognition for Tiny Actions Challenge

低分辨率动作识别挑战

Boyu Chen, Yu Qiao, Yali Wang

机构 * ShenZhen Key Lab of Computer Vision and Pattern Recognition, Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences, China(深圳计算机视觉与模式识别重点实验室,深圳先进技术研究院,中国科学院,中国) University of Chinese Academy of Sciences(中国科学院大学) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) SIAT Branch, Shenzhen Institute of Artificial Intelligence and Robotics for Society(SIAT分支,深圳人工智能与机器人社会研究院)

AI总结 本文提出了一种针对低分辨率动作识别挑战的解决方案,通过数据平衡、双分辨率蒸馏和模型集成提升长尾类别性能,取得排行榜第一。

Comments This article is the report of the CVPR 2022 ActivityNet workshop Tiny Actions Challenge(https://tinyactions-cvpr22.github.io/). The time of the first submission to the organizers is June 6th

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15347 2025-12-18 cs.CV cs.LG

Expand and Prune: Maximizing Trajectory Diversity for Effective GRPO in Generative Models

扩展与剪枝:为生成模型中的有效GRPO最大化轨迹多样性

Shiran Ge, Chenyi Huang, Yuang Ai, Qihang Fan, Huaibo Huang, Ran He

机构 * MAIS & NLPR, Institute of Automation, CAS(自动化研究所信息与智能系统研究所与神经语言处理研究所) School of Artificial Intelligence, UCAS(人工智能学院)

AI总结 本文提出Pro-GRPO框架,通过扩展与剪枝策略在生成模型中提升GRPO效果,减少计算开销并提高轨迹多样性。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14040 2025-12-17 cs.CV cs.LG

ChartAgent: A Chart Understanding Framework with Tool Integrated Reasoning

ChartAgent: 一种集成工具推理的图表理解框架

Boran Wang, Xinming Wang, Yi Chen, Xiang Li, Jian Xu, Jing Yuan, Chenglin Liu

机构 * College of Artificial Intelligence, Nankai University(人工智能学院,南开大学) University of Chinese Academy of Sciences(中国科学院大学) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institution of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室(MAIS),自动化研究所,中国科学院) Zhongguancun Academy(中关村学院) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

AI总结 ChartAgent通过集成工具推理框架提升图表理解的鲁棒性与可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19609 2025-12-16 cs.LG cs.AI

Skrull: Towards Efficient Long Context Fine-tuning through Dynamic Data Scheduling

Skrull:通过动态数据调度实现高效的长上下文微调

Hongtao Xu, Wenting Shen, Yuanxin Wei, Ang Wang, Guo Runfan, Tianxing Wang, Yong Li, Mingzhen Li, Weile Jia

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所 processors 国家重点实验室) Alibaba Group(阿里巴巴集团) Sun Yat-sen University(中山大学)

AI总结 Skrull通过动态数据调度提升长上下文微调效率,实现高效训练和性能优化。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12690 2025-12-16 cs.LG cs.CL cs.CV

Reassessing the Role of Supervised Fine-Tuning: An Empirical Study in VLM Reasoning

重新评估监督微调的作用:VLM推理中的实证研究

Yongcan Yu, Lingxiao He, Shuo Lu, Lijun Sheng, Yinuo Xu, Yanbo Wang, Kuangpu Guo, Jianjie Cheng, Meng Wang, Qianlong Xie, Xingxing Wang, Dapeng Hu, Jian Liang

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(人工智能研究院 & 模式识别与人工智能研究所,中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Meituan(美团)

AI总结 本研究通过实证分析发现,监督微调在VLM推理中具有重要作用,挑战了强化学习优于监督微调的主流观点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12613 2025-12-16 cs.CL

StruProKGR: A Structural and Probabilistic Framework for Sparse Knowledge Graph Reasoning

StruProKGR: 一种用于稀疏知识图谱推理的结构和概率框架

Yucan Guo, Saiping Guan, Miao Su, Zeya Zhao, Xiaolong Jin, Jiafeng Guo, Xueqi Cheng

机构 * CAS Key Laboratory of Network Data Science and Technology, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院网络数据科学与技术重点实验室,计算技术研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

AI总结 StruProKGR提出了一种结构和概率框架,通过距离引导路径收集和概率路径聚合,提升稀疏知识图谱推理的有效性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12578 2025-12-16 quant-ph cs.CC cs.LG

Scalable Quantum Error Mitigation with Neighbor-Informed Learning

可扩展的邻域感知学习量子误差缓解

Zhenyu Chen, Bin Cheng, Minbo Gao, Xiaodie Lin, Ruiqi Zhang, Zhaohui Wei, Zhengfeng Ji

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Centre for Quantum Technologies, National University of Singapore(新加坡国立大学量子技术中心) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院) Yau Mathematical Sciences Center, Tsinghua University(清华大学姚期 Banking 数学科学中心) Department of Mathematics, Tsinghua University(清华大学数学系) Yanqi Lake Beijing Institute of Mathematical Sciences and Applications(燕琦湖北京数学科学与应用研究院)

AI总结 本文提出邻域感知学习框架,通过灵活高效的训练方法提升量子误差缓解的性能,实现理论与实际的双重优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12268 2025-12-16 cs.CV

MetaTPT: Meta Test-time Prompt Tuning for Vision-Language Models

MetaTPT: 用于视觉-语言模型的元测试时间提示微调

Yuqing Lei, Yingjun Du, Yawen Huang, Xiantong Zhen, Ling Shao

机构 * UCAS-Terminus AI Lab, University of Chinese Academic of Sciences(中国科学院大学Terminus AI实验室,中国科学院大学) AIM Lab, University of Amsterdam(阿姆斯特丹大学AIM实验室) Jarvis Research Center, Tencent Youtu Lab(腾讯优图实验室 Jarvis 研究中心) Central Research Institue, United Imaging Healthcare Co., Ltd(联合影像医疗科技有限公司中央研究所)

AI总结 MetaTPT通过元学习框架结合自监督任务和提示微调,提升视觉-语言模型在领域偏移下的测试时间适应性,实现领域泛化和跨数据集的高性能表现。

Comments NeurIPS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10309 2025-12-16 q-bio.MN cs.LG physics.bio-ph

Tracking large chemical reaction networks and rare events by neural networks

通过神经网络追踪大规模化学反应网络和罕见事件

Jiayu Weng, Xinyi Zhu, Jing Liu, Linyuan Lü, Pan Zhang, Ying Tang

机构 * Institute of Data Science, University of Hong Kong, Hong Kong(数据科学研究所,香港大学) Department of Systems Science, Faculty of Arts and Sciences, Beijing Normal University, Zhuhai 519087, China(艺术与科学学院系统科学系,北京师范大学) School of Physics, University of Electronic Science and Technology of China, Chengdu 611731, China(电子科学与技术大学物理学院) School of Physical Science and Technology, Beijing University of Posts and Telecommunications, Beijing 102206, China(邮电大学物理科学与技术学院) Institute of Theoretical Physics, Chinese Academy of Sciences, Beijing 100190, China(中国科学院理论物理研究所) School of Cyber Science and Technology, University of Science and Technology of China, Hefei 230027, China(科学技术大学网络科学与技术学院) School of Fundamental Physics and Mathematical Sciences, Hangzhou Institute for Advanced Study, UCAS, Hangzhou 310024, China(杭州高等研究院基础物理与数学科学学院) Institute of Fundamental and Frontier Sciences, University of Electronic Science and Technology of China, Chengdu 611731, China(电子科学与技术大学基础与前沿科学研究所) Non-classical Information Science Basic Discipline Research Center of Sichuan Province, University of Electronic Science and Technology of China, Chengdu 611731, China(四川省非经典信息科学基础学科研究中心,电子科学与技术大学)

AI总结 本文提出通过神经网络高效追踪大规模化学反应网络及罕见事件的方法,结合优化算法和增强采样策略,实现显著加速和高精度建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13261 2025-12-16 cs.CV

Unlocking the Potential of Difficulty Prior in RL-based Multimodal Reasoning

解锁基于强化学习的多模态推理中难度先验的潜力

Mingrui Chen, Haogeng Liu, Hao Liang, Huaibo Huang, Wentao Zhang, Ran He

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) NLPR&MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) Zhongguancun Academy(中关村学院)

AI总结 本文通过建模问题难度先验信息,改进基于强化学习的多模态推理性能,通过数据筛选、优势分化和难度提示提升模型推理深度和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11686 2025-12-15 physics.comp-ph cs.LG

Stable spectral neural operator for learning stiff PDE systems from limited data

稳定频谱神经算子用于从有限数据中学习刚性PDE系统

Rui Zhang, Han Wan, Yang Liu, Hao Sun

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院( Gallagher 学院)) School of Engineering Science, University of Chinese Academy of Sciences(中国科学院大学工程科学学院)

AI总结 本研究提出稳定频谱神经算子(SSNO),通过频谱启发式结构在有限数据下高效学习刚性PDE系统,实现高精度预测与强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15351 2025-12-15 cs.AI cs.CV

Octopus: Agentic Multimodal Reasoning with Six-Capability Orchestration

Octopus: 六种能力协同的代理多模态推理

Yifu Guo, Zishan Xu, Zhiyuan Yao, Yuquan Lu, Jiaye Lin, Sen Hu, Zhenheng Tang, Huacan Wang, Ronghao Chen

机构 * Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 Octopus通过六种能力协同实现多模态代理推理,有效提升复杂任务中的自主探索与动态能力选择能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00811 2025-12-15 cs.LG

Equilibrium Policy Generalization: A Reinforcement Learning Framework for Cross-Graph Zero-Shot Generalization in Pursuit-Evasion Games

均衡策略泛化:一种用于追捕-躲避游戏跨图零样本泛化的强化学习框架

Runyu Lu, Peng Zhang, Ruochuan Shi, Yuanheng Zhu, Dongbin Zhao, Yang Liu, Dong Wang, Cesare Alippi

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Dalian University of Technology(大连理工大学) Università della Svizzera italiana(瑞士意大利大学) Politecnico di Milano(米兰理工学院)

AI总结 本文提出EPG框架,通过均衡策略训练实现追捕-躲避游戏中跨图零样本泛化的高效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02630 2025-12-15 cs.LG cs.CL

HyperAdaLoRA: Accelerating LoRA Rank Allocation During Training via Hypernetworks without Sacrificing Performance

HyperAdaLoRA: 通过超网络在训练过程中加速LoRA秩分配而不牺牲性能

Hao Zhang, Zhenjia Li, Runfeng Bao, Yifan Gao, Xi Xiao, Heng Zhang, Shuyang Zhang, Bo Huang, Yuhang Wu, Tianyang Wang, Hao Xu

机构 * Harvard University(哈佛大学) University of Chinese Academy of Sciences(中国科学院大学) Fudan University(复旦大学) University of Chicago(芝加哥大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) South China Normal University(华南师范大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai University of Engineering Science(上海工程技术大学)

AI总结 HyperAdaLoRA通过超网络实现训练过程中LoRA秩分配的加速,提升收敛速度同时保持性能

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10403 2025-12-12 cs.SD cs.CL

BRACE: A Benchmark for Robust Audio Caption Quality Evaluation

BRACE:一种用于鲁棒音频描述质量评估的基准

Tianyu Guo, Hongyu Chen, Hao Liang, Meiyi Qiang, Bohan Zeng, Linzhuang Sun, Bin Cui, Wentao Zhang

机构 * Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 BRACE基准用于评估参考自由环境下音频描述质量,揭示CLAP模型和LALM的局限性,推动未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08511 2025-12-12 cs.CV

Thinking with Images via Self-Calling Agent

通过自我调用代理进行图像思考

Wenxi Yang, Yuzhong Zhao, Fang Wan, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出sCoT范式,通过自我调用代理实现无需多模态交错的高效视觉推理,实验显示其在HR-Bench 4K上性能提升达1.9%且训练效率提高75%。

Comments Code is available at https://github.com/YWenxi/think-with-images-through-self-calling

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22613 2025-12-12 math.OC cs.AI cs.LG

Variational analysis of determinantal varieties

极值分析中的行列式流形

Yan Yang, Bin Gao, Ya-xiang Yuan

机构 * Academy of Mathematics and Systems Science, Chinese Academy of Sciences(数学与系统科学研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学研究院,中国科学院)

AI总结 本文提出统一框架推导低秩集合的一阶和二阶切集公式,并研究了低秩优化的最优条件及二阶最优性的计算复杂性。

Comments 76 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08464 2025-12-12 cs.AI cond-mat.mtrl-sci

A Generation Framework with Strict Constraints for Crystal Materials Design

具有严格约束的晶体材料设计生成框架

Chao Huang, Jiahui Chen, Chen Chen, Chen Chen, Chunyan Chen, Renjie Su, Shiyu Du

机构 * Institute of Computing Technology(计算技术研究所) Chinese Academy of Science(中国科学院) Ningbo Institute of Artificial Intelligence Industry(宁波人工智能产业研究所) Hangzhou Institute for Advanced Study(杭州高级研究所) UCAS China University of Petroleum (East China)(中国石油大学(华东)) Ningbo Institute of Materials Technology and Engineering(宁波材料技术与工程研究所)

AI总结 本文提出一种具有严格约束的晶体材料设计生成框架,通过约束生成器和结构生成器生成满足特定化学和物理性质的晶体结构,提高生成效率并确保化学组成准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13732 2025-12-12 cs.CL cond-mat.mtrl-sci cs.LG

Enhancing Large Language Models with Domain-Specific Knowledge: The Case in Topological Materials

通过领域特定知识增强大型语言模型:拓扑材料案例

HuangChao Xu, Baohua Zhang, Zhong Jin, Tiannian Zhu, Quansheng Wu, Hongming Weng

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) Institute of Physics, Chinese Academy of Sciences(中国科学院物理研究所)

AI总结 本文提出通过构建材料知识图谱与提示学习,开发专用对话系统TopoChat,以提升拓扑材料领域的信息检索与知识交互能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01270 2025-12-12 cs.AI cs.LG cs.RO

Multi-Robot Path Planning Combining Heuristics and Multi-Agent Reinforcement Learning

结合启发式方法和多智能体强化学习的多机器人路径规划

Shaoming Peng

机构 * School of Artificial Intelligence University of Chinese Academy of Sciences(人工智能学院 中国科学院大学)

AI总结 本文提出MAPPOHR方法,结合启发式搜索与多智能体强化学习,提升多机器人路径规划效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09663 2025-12-11 cs.CV

IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting

IF-Bench:基于生成视觉提示的多模态大语言模型在红外图像上的基准测试与增强

Tao Zhang, Yuyang Hong, Yang Xia, Kun Ding, Zeyu Zhang, Ying Wang, Shiming Xiang, Chunhong Pan

机构 * MAIS, Institute of Automation(自动化研究所信息处理中心) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Research Center of Aerospace Information, Institute of Automation(自动化研究所航空信息研究中心)

AI总结 IF-Bench通过生成视觉提示方法提升多模态大语言模型对红外图像的理解能力,提供首个高质量基准测试及实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09487 2025-12-11 cs.CL cs.AI cs.IR

RouteRAG: Efficient Retrieval-Augmented Generation from Text and Graph via Reinforcement Learning

RouteRAG: 通过强化学习实现文本和图的高效检索增强生成

Yucan Guo, Miao Su, Saiping Guan, Zihao Sun, Xiaolong Jin, Jiafeng Guo, Xueqi Cheng

机构 * CAS Key Laboratory of Network Data Science and Technology, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所网络数据科学与技术重点实验室) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

AI总结 RouteRAG通过强化学习实现文本和图的高效混合检索增强生成,提升多轮推理和复杂任务的适应性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00718 2025-12-11 cs.CV

VFM-ISRefiner: Towards Better Adapting Vision Foundation Models for Interactive Segmentation of Remote Sensing Images

VFM-ISRefiner: 向更适应交互分割遥感图像的视觉基础模型迈进

Deliang Wang, Peng Liu, Yan Ma, Rongkai Zhuang, Lajiao Chen, Bing Li, Yi Zeng

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) School of Information Science and Technology, Beijing Forestry University(北京林业大学信息科学与技术学院)

AI总结 VFM-ISRefiner提出了一种基于点击的交互分割框架,通过适配器调优和混合注意力机制提升遥感图像分割的精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03166 2025-12-11 cs.CV

RingMoE: Mixture-of-Modality-Experts Multi-Modal Foundation Models for Universal Remote Sensing Image Interpretation

RingMoE:面向通用遥感图像解释的多模态专家混合多模态基础模型

Hanbo Bi, Yingchao Feng, Boyuan Tong, Mengyu Wang, Haichen Yu, Yongqiang Mao, Hao Chang, Wenhui Diao, Peijin Wang, Yue Yu, Hanyang Peng, Yehong Zhang, Kun Fu, Xian Sun

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of Target Cognition and Application Technology(TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(目标认知与应用技术重点实验室) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Peng Cheng Laboratory, Shenzhen(鹏城实验室)

AI总结 RingMoE是一种多模态专家混合模型,通过自监督学习和物理信息嵌入,提升遥感图像的多模态处理能力,实现从单模态到多模态的高效适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05593 2025-12-11 cs.CV

Semantic Data Augmentation Enhanced Invariant Risk Minimization for Medical Image Domain Generalization

语义数据增强增强不变风险最小化用于医学图像领域泛化

Yaoyao Zhu, Xiuding Cai, Yingkai Wang, Yu Yao, Xu Luo, Zhongliang Fu

机构 * Chengdu Institute of Computer Application, Chinese Academy of Sciences(中国科学院成都计算机应用研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出一种基于语义数据增强的不变风险最小化方法,通过领域导向的增强方向选择器提升医学图像领域泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20090 2025-12-11 cs.CV

Towards Robust Infrared Small Target Detection: A Feature-Enhanced and Sensitivity-Tunable Framework

迈向鲁棒的红外小目标检测:一种特征增强和灵敏度可调的框架

Jinmiao Zhao, Zelin Shi, Chuang Yu, Yunpeng Liu, Yimian Dai

机构 * Key Laboratory of Opto-Electronic Information Processing, Chinese Academy of Sciences(光电信息处理重点实验室,中国科学院) Shenyang Institute of Automation, Chinese Academy of Sciences(沈阳自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Nankai University(南开大学)

AI总结 本文提出FEST框架,通过特征增强和灵敏度调节提升红外小目标检测性能,增强模型鲁棒性和适应性。

Comments Accepted by Knowledge-Based Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08374 2025-12-10 cs.CV

The Unseen Bias: How Norm Discrepancy in Pre-Norm MLLMs Leads to Visual Information Loss

看不见的偏见:预规范MLLM中规范差异如何导致视觉信息丢失

Bozhou Li, Xinda Xue, Sihan Yang, Yang Shi, Xinlong Chen, Yushuo Guan, Yuanxing Zhang, Wentao Zhang

机构 * Peking University(北京大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Xi’an Jiaotong University(西安交通大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

AI总结 本文揭示了预规范MLLM中规范差异导致的视觉信息丢失问题,并提出通过插入层规范层来解决这一问题,提升模型整体能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08305 2025-12-10 astro-ph.SR astro-ph.IM cs.LG

Magnetic activity of ultracool dwarfs in the LAMOST DR11

LAMOST DR11中超冷矮星的磁活动性

Yue Xiang, Shenghong Gu, Dongtao Cao

机构 * Yunnan Observatories, Chinese Academy of Sciences(云南天文台,中国科学院) Key Laboratory for the Structure and Evolution of Celestial Objects, Chinese Academy of Sciences(天文物理重点实验室,中国科学院) International Centre of Supernovae, Yunnan Key Laboratory(超新星国际中心,云南重点实验室) School of Astronomy and Space Science, University of Chinese Academy of Sciences(天文与空间科学学院,中国科学院大学)

AI总结 利用LAMOST DR11数据和模拟CSST光谱,通过半监督机器学习识别超冷矮星并研究其磁活动性与自转关系。

Comments 13 pages, 10 figures, accepted for publication in ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08188 2025-12-10 cs.RO cs.AI cs.CV

Embodied Tree of Thoughts: Deliberate Manipulation Planning with Embodied World Model

具身思维树:基于具身世界模型的 deliberative 操控规划

Wenjiang Xu, Cindy Wang, Rui Fang, Mingkang Zhang, Lusong Li, Jing Xu, Jiayuan Gu, Zecui Zeng, Rui Chen

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tsinghua University(清华大学) JD Explore Academy(京东探索学院) ShanghaiTech University(上海科技大学) Nanjing University(南京大学)

AI总结 EToT通过基于物理的交互数字双胞胎实现具身世界模型,结合先验分支和反思分支机制,提升机器人操控规划的物理一致性和鲁棒性。

Comments Website at https://embodied-tree-of-thoughts.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07599 2025-12-09 cs.CV

Online Segment Any 3D Thing as Instance Tracking

在线分割三维物体作为实例跟踪

Hanshi Wang, Zijian Cai, Jin Gao, Yiwei Zhang, Weiming Hu, Ke Wang, Zhipeng Zhang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), CASIA(多模态人工智能系统国家重点实验室(MAIS),中国科学院自动化所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab) Anyverse Intelligence Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(北京超智能多模态信息安全重点实验室) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

AI总结 将在线3D分割重新定义为实例跟踪问题,通过时间信息传播和空间一致性学习提升具身智能体对环境的理解能力。

Comments NeurIPS 2025, Code is at https://github.com/AutoLab-SAI-SJTU/AutoSeg3D

详情

展开后加载摘要…

URL PDF HTML 收藏