arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

共收录 1952
2607.08769 2026-07-10 cs.CV 新提交

Geometry and Gradient-based Partitioning for Panoramic Outdoor Reconstruction

基于几何和梯度的全景户外重建分区方法

Weijian Chen, Weibo Yao, Yuhang Zhang, Xiaolin Tang, Guo Wang, Weijun Zhang, Xitong Gao, Yihao Chen, Hongde Qin, Lu Qi

机构 * Insta360 Research(Insta360研究机构) Sun Yat-sen University(中山大学) South China University of Technology(华南理工大学) University of Chinese Academy of Sciences(中国科学院大学) Harbin Engineering University(哈尔滨工程大学) Wuhan University(武汉大学)

AI总结 针对大规模全景3D高斯点云重建成本高问题,提出PanoLOG两阶段框架,利用几何和梯度进行分区,粗阶段用天球建模等,细化阶段构建自适应边界体积等,还构建数据集,实现了高质量渲染和可扩展训练。

Comments Project Webpage: https://insta360-research-team.github.io/GGPS-Website

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08395 2026-07-10 cs.CR cs.CL 新提交

Token-Flow Firewall: Semantic Runtime Auditing for Persistent AI Agents

令牌流防火墙:持久人工智能代理的语义运行时审计

Puji Wang, Yingchen Zhang, Ruqing Zhang, Jiafeng Guo, Xueqi Cheng

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学北京校区)

AI总结 针对持久人工智能代理不安全内容传播问题,提出TokenWall运行时防御框架,通过对令牌流进行语义审计及相关操作,实现安全-效用权衡,实验显示其有效降低攻击成功率,保持高良性通过率且增加延迟少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08161 2026-07-10 cs.CL cs.CV 新提交

SQuaD-SQL: Efficient Text-to-SQL with Small Language Models via LLM-Guided Knowledge Distillation

SQuaD-SQL:通过大语言模型引导的知识蒸馏,利用小语言模型实现高效的文本到SQL转换

Wangyu Wu, Xiaojian Lin, Rong Fu, Zaiyang Yu, Xuhang Chen, Wenjun Yu, Zhenhong Chen

机构 * The University of Liverpool(利物浦大学) University of Macau(澳门大学) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Microsoft(微软) Shanghai University of International Business and Economics(上海国际经贸管理大学) Huizhou University(惠州市大学)

AI总结 研究如何让小语言模型在文本到SQL任务中接近大语言模型性能。核心方法是通过知识蒸馏和合成数据生成,包含基于大语言模型的合成数据生成、参数高效微调和领域自适应微调三个关键组件。主要贡献是在WikiSQL数据集上执行准确率达86.9%,推理更快、内存使用更低。

Comments Accepted at IEEE SMC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12886 2026-07-10 cs.CV cs.AI 新提交

Bridging Modal Isolation in Interleaved Thinking: Supervising Modality Transitions via Stepwise Reinforcement

交错思维中的模态隔离桥接:通过逐步强化监督模态转换

Tingyu Li, Le Zhou, Siyuan Li, Yujun Wu, Xinglong Xu, Jingxuan Wei, Conghui He, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 提出MoTiF框架,通过反射式SFT和Flow-GRPO优化模态转换保真度,解决交错思维中图像与文本脱节的模态隔离问题,提升跨模态一致性和任务准确性。

Comments 22 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10180 2026-07-10 cs.DC cs.LG 版本更新

Tessera: Unlocking Heterogeneous GPUs through Kernel-Granularity Disaggregation

Tessera:通过内核粒度解耦解锁异构GPU

Tiancheng Hu, Jin Qin, Zheng Wang, Junhao Hu, Yuzheng Wang, Lei Chen, Yizhou Shan, Mingxing Zhang, Ting Cao, Chunwei Xia, Huimin Cui, Tao Xie, Chenxi Wang

机构 * Peking University(北京大学) Key Lab of HCST (PKU), MOE(高可信软件技术教育部重点实验室(北京大学)) University of Chinese Academy of Sciences(中国科学院大学) Institute for AI Industry Research, Tsinghua University(清华大学人工智能研究院) Tsinghua University(清华大学) University of Leeds(利兹大学) Huawei Cloud(华为云)

AI总结 Tessera通过内核粒度解耦提升异构GPU上的大模型推理性能和成本效率,利用离线分析与在线适应结合,实现计算与硬件能力的匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16920 2026-07-10 cs.CV 版本更新

DeltaDeno: Zero-Shot Anomaly Generation via Delta-Denoising Attribution

DeltaDeno:通过Delta去噪归因实现零样本异常生成

Chaoran Xu, Chengkan Lv, Qiyu Chen, Yunkang Cao, Feng Zhang, Zhengtao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院) CASI Vision Technology CO., LTD., Luoyang, China(CASI视觉科技有限公司) School of Artificial Intelligence and Robotics, Hunan University, Changsha, China(湖南大学人工智能与机器人学院)

AI总结 研究在无真实异常样本和训练情况下的零样本异常生成问题,提出DeltaDeno方法,通过对比两个扩散分支定位编辑缺陷,累积去噪增量生成掩码,经令牌级提示细化等操作提升性能,在公共数据集实验中效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07708 2026-07-09 cs.CL cs.AI cs.CE cs.LG 新提交

Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning

通过深度原生结构推理实现准确、跨学科和透明的结构-属性理解

Chen Tang, Yizhou Wang, Jianyu Wu, Lintao Wang, Shixiang Tang, Pengze Li, Encheng Su, Jun Yao, Jiabei Xiao, Yuqi Shi, Jielan Li, Hongxia Hao, Zhangyang Gao, Fang Wu, Ben Fei, Xiangyu Yue, Pan Tan, Bozitao Zhong, Jinouwen Zhang, Aoran Wang, Yan Lu, Jiaheng Liu, Xinzhu Ma, Liang Hong, Mingyue Zheng, Phil Torr, Bowen Zhou, Wanli Ouyang, Lei Bai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) University of Sydney(悉尼大学) Nanjing University(南京大学) University of Oxford(牛津大学) The University of Science and Technology of China(中国科学技术大学) Drug Discovery and Design Center, State Key Laboratory of Drug Research, Shanghai Institute of Materia Medica, Chinese Academy of Sciences(药物发现与设计中心、国家药物研究重点实验室、上海中医药材料医学研究所、中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Stanford University(斯坦福大学)

AI总结 研究聚焦利用人工智能解释结构-属性关系的挑战,提出多模态科学基础模型SciReasoner,通过离散化结构信息为可寻址单元进行推理,在多领域基准测试中表现出色,实现准确预测与可解释科学推理的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07702 2026-07-09 cs.CL 新提交

From Noisy Traces to Root Causes: Structural Trajectory Analysis and Causal Extraction for Agent Optimization

从噪声轨迹到根本原因:用于智能体优化的结构轨迹分析和因果提取

Ying Chang, Jiahang Xu, Xuan Feng, Chenyuan Yang, Peng Cheng, Yuqing Yang

机构 * Microsoft Research(微软研究院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 研究针对长期智能体优化中实际执行轨迹难直接用于优化的问题,提出STRACE框架。该框架在批次和轨迹内分别进行故障模式挖掘与因果定位,去除冗余和非因果步骤,实验表明其显著优于基线,提升了智能体优化成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07383 2026-07-09 cs.CV 新提交

MMAgent-R$^2$: Learning to Rerank and Reject for Agentic mRAG

MMAgent-R$^2$:用于智能mRAG的重排与拒绝学习

Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Yang, Bing Li, Chunfeng Yuan, Kang Rong, Fengyun Rao, Jing Lyu, Weiming Hu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院复杂系统管理与控制国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(北京多模态信息超智能安全重点实验室) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) PeopleAI Inc.(人智公司) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

AI总结 针对KB-VQA中现有mRAG方法在处理视觉相似实体时的不足,提出MMAgent-R$^2$框架,集成视觉重排和主动拒绝机制,设计复合奖励函数,经GRPO训练实现联合优化,实验证明其在多任务中性能达最优。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07330 2026-07-09 cs.LG cs.AI 新提交

Hypergraph Neural Stochastic Diffusion: An SDE Framework for Uncertainty Estimation

超图神经随机扩散:一种用于不确定性估计的SDE框架

Zhiheng Zhou, Mengyao Zhou, Dengyi Zhao, Xingqin Qi, Guiying Yan

机构 * School of Mathematics and Statistics, Shandong University, Weihai(山东大学(威海)数学与统计学院) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 研究超图神经网络预测不确定性,提出超图神经随机扩散框架HyperNSD,将超图表示建模为随机过程,通过可学习函数量化不确定性,经理论分析和实验验证,能可靠估计不确定性并保持预测精度,提供随机动力学框架。

Comments 26 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07169 2026-07-09 cs.CV 新提交

TACoS: Weakly Supervised Learning of Two-Dimensional Materials from Scribble Annotations to Precise Segmentation

TACoS:从涂鸦注释到精确分割的二维材料弱监督学习

Jiabei Chen, Liping Zhang, Jiang-Bin Wu, Zhongming Wei, Enhao Ning, Su Yan, Weijun Li, Ping-Heng Tan, Xin Ning

机构 * AnnLab, Institute of Semiconductors, Chinese Academy of Sciences(中国科学院半导体研究所安实验室) Institute of Semiconductors, Chinese Academy of Sciences(中国科学院半导体研究所) Center of Materials Science and Optoelectronics Engineering & School of Integrated Circuits, University of Chinese Academy of Sciences(中国科学院大学材料科学与光电技术中心及集成电路学院)

AI总结 研究二维材料薄片像素级定位问题,提出TACoS框架,整合半监督一致性学习与结构化树能量约束,引入不对称区域对比学习,用少量注释数据实现高性能,在复杂场景中表现优越,为二维材料高通量筛选提供高效方案。

Comments 35 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06726 2026-07-09 cs.CV 新提交

A Good Initialization is All You Need for Faithful Visual Attribution

忠实视觉归因只需一个良好的初始化

Zihan Gu, Jiayu Wang, Hua Zhang, Yue Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

AI总结 研究忠实视觉归因中掩码优先问题,介绍CoPAIR和TRACE两种仅向前方法,用于构建紧凑的top-k证据掩码。在多个模型和任务上实验,初始化搜索方法达新前沿,TRACE+贪心在多模态语言模型归因中表现优,直接的TRACE掩码有高修复率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06620 2026-07-09 cs.CV cs.AI 新提交

SpaR3D-MoE: Adaptive 3D Spatial Reasoning from Sparse Views Meets Geometry-Inductive Mixture-of-Experts

SpaR3D-MoE:来自稀疏视图的自适应3D空间推理与几何归纳专家混合模型

Haida Feng, Hao Wei, Haolin Wang, Shiwei Li, Chade Li, Yihong Wu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) YUKUN Intelligent World(宇琨智能世界)

AI总结 研究针对多模态大语言模型在2D与3D表征差距问题,提出SpaR3D-MoE框架,通过自适应时空采样和几何归纳专家混合模型,从稀疏RGB输入实现自适应空间推理,在多个实验中取得最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07623 2026-07-09 cs.LG cs.NA math.NA physics.chem-ph physics.comp-ph physics.data-an 新提交

Higher-Order Geometric Updates for Levenberg-Marquardt Method via Riemann Normal Coordinates

通过黎曼法坐标对列文伯格-马夸特方法进行高阶几何更新

Jianing Liu, Dong H. Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Chinese Academy of Sciences(中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Hefei National Laboratory(合肥国家实验室)

AI总结 研究针对非线性最小二乘优化问题,提出黎曼法坐标列文伯格-马夸特方法(RNC-LM)。通过重新表述测地线方程扩展校正阶数,构建有限步更新。该方法提高了收敛性和鲁棒性,在多任务中表现出色,如降低误差、加速计算等。

Comments 34 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29744 2026-07-09 cs.CV 版本更新

HTC-SGA Former: A Hybrid Transformer-CNN Network with Self-Guided Attention and a New Boundary-Weighted Adaptive Loss for Coronary DSA Vessel Segmentation

HTC-SGA Former: 一种结合自引导注意力与新型边界加权自适应损失的混合Transformer-CNN网络用于冠状动脉DSA血管分割

Rayan Merghani Ahmed, Marwa Omer Mohammed Omer, Mohamed Elmanna, Shijie Li, Bin Li, Shoujun Zhou

机构 * Shenzhen Institutes of Advanced Technology (SIAT)(深圳先进技术研究院) University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Department of Biomedical Engineering and Systems, Faculty of Engineering(工程学院生物医学工程与系统系) Cairo University(开罗大学)

AI总结 提出HTC-SGA Former混合网络,通过CNN编码器提取局部血管形态、Transformer解码器建模上下文、MS-GLWA模块实现全局-局部注意力、SGFA模块增强弱血管响应及BWACL损失函数优化边界,在0.81M参数下超越14种方法,提升细血管恢复与连续性。

Comments 20 pages, 10 figures, 3 tables. Submitted for journal review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07831 2026-07-09 cs.CR cs.CL cs.CV 版本更新

Are GUI Agents Focused Enough? Automated Distraction via Semantic-level UI Element Injection

GUI代理是否足够专注?通过语义层面的UI元素注入实现自动化干扰

Wenkui Yang, Chao Jin, Haisu Zhu, Weilin Luo, Derek Yuen, Kun Shao, Junxian Duan, Huaibo Huang, Jie Cao, Ran He

机构 * SAIS, UCAS(中国科学院大学人工智能学院) SIST, ShanghaiTech University(上海科技大学信息科学与技术学院)

AI总结 本文提出语义层面UI元素注入方法,通过在截图上叠加安全对齐且无害的UI元素来误导代理的视觉基础。实验显示,该方法在五个受害者模型上提升了攻击成功率,并证明注入元素可作为持久吸引器。

Comments Accepted by ECCV 2026, public code at https://github.com/HashTAG00002/UI-Injection

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15779 2026-07-09 cs.CV

Diffusion Model-Based Data Augmentation for Enhanced Neuron Segmentation

基于扩散模型的数据增强用于增强神经元分割

Liuyun Jiang, Yanchao Zhang, Jinyue Guo, Yizhuo Lu, Ruining Zhou, Hua Han

机构 * State Key Laboratory of Brain Cognition(脑认知国家重点实验室) Brain-inspired Intelligence Technology, Institute of Automation, Chinese Academy of Sciences(脑启发智能技术,自动化研究所,中国科学院) School of Future Technology, University of Chinese Academy of Sciences(未来技术学院,中国科学院大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

AI总结 本文提出基于扩散模型的数据增强方法,用于提升神经元分割的性能,通过生成结构合理的图像-标签对,提高分割准确率。

Journal ref 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI), pp. 01-05, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06374 2026-07-08 cs.CV 新提交

VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery

花瓶博物馆:古希腊陶器数字智能博物馆

Jiazi Wang, Nonghai Zhang, Qiushi Xie, Zeyu Zhang, Yufeng Chen, Yang Zhao, Ling Shao, Hao Tang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院) Huazhong University of Science and Technology(华中科技大学) Department of Computer Science and Information Technology, La Trobe University(拉筹伯大学计算机科学与信息技术系) UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学UCAS-Terminus人工智能实验室)

AI总结 针对古希腊陶器文化遗产领域中视觉语言模型面临的挑战,提出轻量级模块化多模态智能体框架花瓶博物馆,结合虚拟博物馆与花瓶智能体,经多模态感知等操作,提高引用有效性,减少幻觉并产生更中立答案。

Comments Code: https://github.com/AIGeeksGroup/VaseMuseum. Website: https://aigeeksgroup.github.io/VaseMuseum

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06148 2026-07-08 cs.CV 新提交

RFHNet: Relational and Frequency-Aware Hashing Network for Large-Scale Fine-Grained Food Image Retrieval

RFHNet:用于大规模细粒度食品图像检索的关系与频率感知哈希网络

Junsong Wang, Weiqing Min, Guorui Sheng, Tao Yao, Lili Wang, Shuqiang Jiang

机构 * College of Computer Science and Artificial Intelligence, Ludong University(鲁东大学计算机科学与人工智能学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 针对细粒度食品图像检索难题,提出RFHNet,通过级联分层哈希网络,利用细粒度关系建模、多频调制融合和分层语义协同三个组件,有效捕获全局与局部细节,实验证明其性能优于现有方法,提升了大规模视觉食品检索效果。

Comments 10 pages, 6 figures. Published in ACM ICMR 2026

Journal ref Proceedings of the 2026 International Conference on Multimedia Retrieval. 2026: 177-185

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06118 2026-07-08 cs.CV cs.MM 新提交

WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation

WebRetriever:用于高效网络智能体评估的大规模综合基准测试

Wei Dong, Tianyu Fu, Zhe Yu, Hanning Wang, Anyang Su, Zhizhou Fang, Yuyang Chen, Shuo Wang, Minghui Wu, Ping Jiang, Zhen Lei, Chenxu Zhao

机构 * Mininglamp Technology(旷视科技) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所综合技术集成中心)

AI总结 针对现有网络智能体评估基准测试的局限,提出WebRetriever这一大规模综合基准测试,涵盖多领域网站和任务。采用NavEval框架及三个评估协议,实验揭示不同协议性能差异,为网络智能体研发提供细粒度见解和严谨基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20023 2026-07-08 cs.SE cs.AI cs.CL 新提交

When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents

当较低权限足够时:探究LLM代理中的过度权限工具选择

Kaiyue Yang, Yuyan Bu, Jingwei Yi, Yuchi Wang, Biyu Zhou, Juntao Dai, Songlin Hu, Yaodong Yang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Chinese University of Hong Kong(香港中文大学) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

AI总结 针对LLM代理在工具选择中偏好高权限工具的安全问题,提出ToolPrivBench评估框架,发现主流代理普遍存在过度权限选择且被瞬态故障放大,并设计权限感知后训练防御方法有效减少不必要的高权限工具使用。

Comments code: https://github.com/AISafetyHub/agent-tool-selection-bias

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17034 2026-07-08 cs.CV cs.RO

DualReg: Dual-Space Filtering and Reinforcement for Rigid Registration

DualReg: 双空间过滤与强化在刚体配准中的应用

Jiayi Li, Yuxin Yao, Qiuhang Lu, Juyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出DualReg方法,结合特征匹配和几何匹配的优势,通过高效过滤和优化算法提升刚体配准的准确性和效率,实验显示在KITTI数据集上速度提升32倍。

Comments Accepted to CVPR 2026, Project page: https://ustc3dv.github.io/DualReg/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12100 2026-07-08 cs.CV 版本更新

Did Models Learn Sufficiently? Attribution-Guided Training via Subset-Selected Counterfactual Augmentation

模型是否充分学习?通过子集选择的反事实增强进行归因引导训练

Yannan Chen, Ruoyu Chen, Wei Wang, Bin Zeng, Jinke Li, Shiming Liu, Qunli Zhang, Yaowei Wang, Xiaochun Cao

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区信息科学与技术学院) PCL Institute of Information Engineering, CAS(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) Tianjin University(天津大学) Lanzhou University(兰州大学) Imperial College London(伦敦帝国理工学院)

AI总结 针对模型仅依赖有限充分原因导致泛化性差的问题,提出子集选择反事实增强(SS-CA),通过基于LIMA归因的反事实生成和数据增强,改善模型因果学习,提升分布内和分布外性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10356 2026-07-08 cs.CL 版本更新

Decoding the Multimodal Mind: Generalizable Brain-to-Text Translation via Multimodal Alignment and Adaptive Routing

解码多模态思维:通过多模态对齐和自适应路由实现可泛化的脑到文本翻译

Chunyu Ye, Yunhao Zhang, Jingyuan Sun, Chong Li, Yang Zhao, Shaonan Wang

机构 * State Key Laboratory of Multimodal Artificial Intelligence System, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) Department of Language Science and Technology, Hong Kong Polytechnic University(香港理工大学语言科学与技术系)

AI总结 该研究针对脑机接口从人脑解码语言的挑战,提出利用多模态大语言模型和路由模块的统一框架,通过多模态对齐和自适应路由将脑信号与多模态语义空间对齐,在fMRI等数据集实验中性能领先,还扩展到EEG和MEG数据,为现实应用提供灵活方案。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05150 2026-07-07 cs.CV 新提交

Claim-Level Rubric Rewards for Video Caption Reinforcement Learning

用于视频字幕强化学习的声明级评分标准奖励(CuRe)

Mingqi Gao, Hongyuan Dong, Yifei Chen, Zhisheng Zhong, Zheng Ruan, Wenjin Hou, Yu Chen, Han Hu, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) University of Chinese Academy of Sciences(中国科学院大学) LLM Department, Tencent(腾讯大语言模型部)

AI总结 针对密集视频字幕强化学习的奖励设计瓶颈,提出声明级评分标准奖励框架,将奖励建模重构为细粒度声明级验证,规避传统奖励方案的固有缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05089 2026-07-07 cs.CV 新提交

TimeThink: Reasoning with Time for Video LLMs

TimeThink:用于视频语言模型的时间推理

Handong Li, Longteng Guo, Zikang Liu, Dongze Hao, Yepeng Tang, Zijia Zhao, Jie Jiang, Zhiwei Jin, Chen Chen, Haonan Lu, Jing Liu

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) OPPO AI Center, OPPO Inc.(OPPO公司OPPO人工智能中心)

AI总结 研究视频推理中模型发现时间证据的问题,提出TimeThink框架,将时间线索步骤作为优化原语,引入奖励和优化目标,构建数据集,实验表明该框架提升了时间定位和推理性能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04779 2026-07-07 cs.CV 新提交

DGSeg: Dynamic Gating of Semantic-Spatial Guided Predictions for Reasoning Segmentation

DGSeg:用于推理分割的语义-空间引导预测的动态门控

Ruizhe Zeng, Siyu Cao, Lu Zhang, Zhiyong Liu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Nanjing Artificial Intelligence Research of IA(中国科学院自动化所南京人工智能研究院)

AI总结 研究推理分割问题,提出DGSeg框架,借助MLLM生成语义和空间线索,经动态门控模块自适应融合预测,抑制噪声或冲突区域,在多基准测试中表现出色。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04696 2026-07-07 cs.CV 新提交

Probe-EM: Targeted Neuron Tracing via Training-Free Semantic Verification

Probe-EM:通过无训练语义验证进行靶向神经元追踪

Liuyun Jiang, Yanchao Zhang, Jinyue Guo, Chuanyue Chen, Haiyang Yan, Ye Yuan, Jing Liu, Hua Han

机构 * State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化所脑认知与脑机智能技术重点实验室) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学高等研究院)

AI总结 为解决自动重建算法过分割瓶颈及传统追踪方法问题,提出无训练靶向神经元追踪框架,利用几何先验和新策略迭代重建神经元形态,集成到平台减少人工校对时间。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04394 2026-07-07 cs.AI cs.SC 新提交

MechMath Agent Team: LLM Driven Agents for Mathematical Research

机械数学智能体团队:用于数学研究的大语言模型驱动智能体

Yichuan Cao, Ruichen Qiu, Junqi Liu, Jiaqi Wang, Dakai Guo, Ruyong Feng, Lihong Zhi, Xiao-Shan Gao

机构 * State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, CAS(中国科学院数学与系统科学研究院数学科学国家重点实验室) School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学高等研究院)

AI总结 针对数学研究给现有推理系统带来的挑战,提出机械数学智能体团队,设计三方架构,实例化三个专业智能体,闭环协作生成形式化认证的数学证明,经评估可在研究全周期辅助,有通用架构、系统实例及实证验证三大贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04265 2026-07-07 cs.RO cs.AI 新提交

HALO-WA: Hybrid-Attention Latent-Guided Online Reinforcement Learning for World-Action Models

HALO-WA:用于世界-动作模型的混合注意力潜在引导在线强化学习

Angen Ye, Weijie Ke, Xiaofeng Wang, Xinze Chen, Chaojun Ni, Guosheng Zhao, Boyuan Wang, Zheng Zhu, Junjie Xie, Dapeng Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) GigaAI(字节跳动公司(推测,根据常见语境)) Tsinghua University(清华大学)

AI总结 针对世界-动作模型在现实精度任务中易受多种误差影响的问题,提出HALO-WA框架,利用潜在特征和动作先验,通过混合注意力结构实现快速在线适应,提升动作块精度,实验验证效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏