arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

共收录 243
2607.06620 2026-07-09 cs.CV cs.AI 新提交

SpaR3D-MoE: Adaptive 3D Spatial Reasoning from Sparse Views Meets Geometry-Inductive Mixture-of-Experts

SpaR3D-MoE:来自稀疏视图的自适应3D空间推理与几何归纳专家混合模型

Haida Feng, Hao Wei, Haolin Wang, Shiwei Li, Chade Li, Yihong Wu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) YUKUN Intelligent World(宇琨智能世界)

AI总结 研究针对多模态大语言模型在2D与3D表征差距问题,提出SpaR3D-MoE框架,通过自适应时空采样和几何归纳专家混合模型,从稀疏RGB输入实现自适应空间推理,在多个实验中取得最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07623 2026-07-09 cs.LG cs.NA math.NA physics.chem-ph physics.comp-ph physics.data-an 新提交

Higher-Order Geometric Updates for Levenberg-Marquardt Method via Riemann Normal Coordinates

通过黎曼法坐标对列文伯格-马夸特方法进行高阶几何更新

Jianing Liu, Dong H. Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Chinese Academy of Sciences(中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Hefei National Laboratory(合肥国家实验室)

AI总结 研究针对非线性最小二乘优化问题,提出黎曼法坐标列文伯格-马夸特方法(RNC-LM)。通过重新表述测地线方程扩展校正阶数,构建有限步更新。该方法提高了收敛性和鲁棒性,在多任务中表现出色,如降低误差、加速计算等。

Comments 34 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06374 2026-07-08 cs.CV 新提交

VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery

花瓶博物馆:古希腊陶器数字智能博物馆

Jiazi Wang, Nonghai Zhang, Qiushi Xie, Zeyu Zhang, Yufeng Chen, Yang Zhao, Ling Shao, Hao Tang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院) Huazhong University of Science and Technology(华中科技大学) Department of Computer Science and Information Technology, La Trobe University(拉筹伯大学计算机科学与信息技术系) UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学UCAS-Terminus人工智能实验室)

AI总结 针对古希腊陶器文化遗产领域中视觉语言模型面临的挑战,提出轻量级模块化多模态智能体框架花瓶博物馆,结合虚拟博物馆与花瓶智能体,经多模态感知等操作,提高引用有效性,减少幻觉并产生更中立答案。

Comments Code: https://github.com/AIGeeksGroup/VaseMuseum. Website: https://aigeeksgroup.github.io/VaseMuseum

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06148 2026-07-08 cs.CV 新提交

RFHNet: Relational and Frequency-Aware Hashing Network for Large-Scale Fine-Grained Food Image Retrieval

RFHNet:用于大规模细粒度食品图像检索的关系与频率感知哈希网络

Junsong Wang, Weiqing Min, Guorui Sheng, Tao Yao, Lili Wang, Shuqiang Jiang

机构 * College of Computer Science and Artificial Intelligence, Ludong University(鲁东大学计算机科学与人工智能学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 针对细粒度食品图像检索难题,提出RFHNet,通过级联分层哈希网络,利用细粒度关系建模、多频调制融合和分层语义协同三个组件,有效捕获全局与局部细节,实验证明其性能优于现有方法,提升了大规模视觉食品检索效果。

Comments 10 pages, 6 figures. Published in ACM ICMR 2026

Journal ref Proceedings of the 2026 International Conference on Multimedia Retrieval. 2026: 177-185

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06118 2026-07-08 cs.CV cs.MM 新提交

WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation

WebRetriever:用于高效网络智能体评估的大规模综合基准测试

Wei Dong, Tianyu Fu, Zhe Yu, Hanning Wang, Anyang Su, Zhizhou Fang, Yuyang Chen, Shuo Wang, Minghui Wu, Ping Jiang, Zhen Lei, Chenxu Zhao

机构 * Mininglamp Technology(旷视科技) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所综合技术集成中心)

AI总结 针对现有网络智能体评估基准测试的局限,提出WebRetriever这一大规模综合基准测试,涵盖多领域网站和任务。采用NavEval框架及三个评估协议,实验揭示不同协议性能差异,为网络智能体研发提供细粒度见解和严谨基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20023 2026-07-08 cs.SE cs.AI cs.CL 新提交

When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents

当较低权限足够时:探究LLM代理中的过度权限工具选择

Kaiyue Yang, Yuyan Bu, Jingwei Yi, Yuchi Wang, Biyu Zhou, Juntao Dai, Songlin Hu, Yaodong Yang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Chinese University of Hong Kong(香港中文大学) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

AI总结 针对LLM代理在工具选择中偏好高权限工具的安全问题,提出ToolPrivBench评估框架,发现主流代理普遍存在过度权限选择且被瞬态故障放大,并设计权限感知后训练防御方法有效减少不必要的高权限工具使用。

Comments code: https://github.com/AISafetyHub/agent-tool-selection-bias

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05150 2026-07-07 cs.CV 新提交

Claim-Level Rubric Rewards for Video Caption Reinforcement Learning

用于视频字幕强化学习的声明级评分标准奖励(CuRe)

Mingqi Gao, Hongyuan Dong, Yifei Chen, Zhisheng Zhong, Zheng Ruan, Wenjin Hou, Yu Chen, Han Hu, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) University of Chinese Academy of Sciences(中国科学院大学) LLM Department, Tencent(腾讯大语言模型部)

AI总结 针对密集视频字幕强化学习的奖励设计瓶颈,提出声明级评分标准奖励框架,将奖励建模重构为细粒度声明级验证,规避传统奖励方案的固有缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05089 2026-07-07 cs.CV 新提交

TimeThink: Reasoning with Time for Video LLMs

TimeThink:用于视频语言模型的时间推理

Handong Li, Longteng Guo, Zikang Liu, Dongze Hao, Yepeng Tang, Zijia Zhao, Jie Jiang, Zhiwei Jin, Chen Chen, Haonan Lu, Jing Liu

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) OPPO AI Center, OPPO Inc.(OPPO公司OPPO人工智能中心)

AI总结 研究视频推理中模型发现时间证据的问题,提出TimeThink框架,将时间线索步骤作为优化原语,引入奖励和优化目标,构建数据集,实验表明该框架提升了时间定位和推理性能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04779 2026-07-07 cs.CV 新提交

DGSeg: Dynamic Gating of Semantic-Spatial Guided Predictions for Reasoning Segmentation

DGSeg:用于推理分割的语义-空间引导预测的动态门控

Ruizhe Zeng, Siyu Cao, Lu Zhang, Zhiyong Liu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Nanjing Artificial Intelligence Research of IA(中国科学院自动化所南京人工智能研究院)

AI总结 研究推理分割问题,提出DGSeg框架,借助MLLM生成语义和空间线索,经动态门控模块自适应融合预测,抑制噪声或冲突区域,在多基准测试中表现出色。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04696 2026-07-07 cs.CV 新提交

Probe-EM: Targeted Neuron Tracing via Training-Free Semantic Verification

Probe-EM:通过无训练语义验证进行靶向神经元追踪

Liuyun Jiang, Yanchao Zhang, Jinyue Guo, Chuanyue Chen, Haiyang Yan, Ye Yuan, Jing Liu, Hua Han

机构 * State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化所脑认知与脑机智能技术重点实验室) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学高等研究院)

AI总结 为解决自动重建算法过分割瓶颈及传统追踪方法问题,提出无训练靶向神经元追踪框架,利用几何先验和新策略迭代重建神经元形态,集成到平台减少人工校对时间。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04394 2026-07-07 cs.AI cs.SC 新提交

MechMath Agent Team: LLM Driven Agents for Mathematical Research

机械数学智能体团队:用于数学研究的大语言模型驱动智能体

Yichuan Cao, Ruichen Qiu, Junqi Liu, Jiaqi Wang, Dakai Guo, Ruyong Feng, Lihong Zhi, Xiao-Shan Gao

机构 * State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, CAS(中国科学院数学与系统科学研究院数学科学国家重点实验室) School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学高等研究院)

AI总结 针对数学研究给现有推理系统带来的挑战,提出机械数学智能体团队,设计三方架构,实例化三个专业智能体,闭环协作生成形式化认证的数学证明,经评估可在研究全周期辅助,有通用架构、系统实例及实证验证三大贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04265 2026-07-07 cs.RO cs.AI 新提交

HALO-WA: Hybrid-Attention Latent-Guided Online Reinforcement Learning for World-Action Models

HALO-WA:用于世界-动作模型的混合注意力潜在引导在线强化学习

Angen Ye, Weijie Ke, Xiaofeng Wang, Xinze Chen, Chaojun Ni, Guosheng Zhao, Boyuan Wang, Zheng Zhu, Junjie Xie, Dapeng Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) GigaAI(字节跳动公司(推测,根据常见语境)) Tsinghua University(清华大学)

AI总结 针对世界-动作模型在现实精度任务中易受多种误差影响的问题,提出HALO-WA框架,利用潜在特征和动作先验,通过混合注意力结构实现快速在线适应,提升动作块精度,实验验证效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04033 2026-07-07 cs.LG cs.AI 新提交

OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers

OmniOpt:现代优化器的分类法、几何结构及基准测试

Siyuan Li, Jiabao Pan, Yumou Liu, Zhuoli Ouyang, Xin Jin, Xinglong Xu, Jingxuan Wei, Shengye Pang, Jintao Che, Xuanhe Zhou, Conghui He, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai University(上海大学) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学) UCAS(中国科学技术大学) Zhejiang University(浙江大学) Southern University of Science and Technology(南方科技大学)

AI总结 针对大规模模型训练的优化器选择受多种因素制约且方法零散,介绍OmniOpt,通过五阶段元管道、规范约束线性最小化预言机等构建统一分类法和跨域基准测试,为优化器选择提供操作坐标系。

Comments Survey & benchmark preprint V1 (91 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03900 2026-07-07 cs.CV cs.LG 新提交

USE: A Unified Self-Ensembling Framework for Test-Time Prompt Tuning

USE:一种用于测试时提示调整的统一自集成框架

Siru Jiang, Jian Liang, Ran He, Tieniu Tan

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所国家智能机器人实验室及模式识别实验室) Nanjing University(南京大学)

AI总结 重新审视测试时提示调整(TPT),揭示其优化可视为从自生成伪标签隐式学习,在此基础上提出统一自集成框架(USE),优化时引入自集成策略,实验表明USE及其自集成策略表现出色。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03350 2026-07-07 cs.CR cs.AI cs.SE 新提交

LLM-Enhanced Hierarchical Heterogeneous Graph Representation Learning for Malicious Python Package Detection

用于恶意Python包检测的基于大语言模型增强的分层异构图表示学习

Hang Gao, Xiaoyu Chen, Baoquan Cui, Zhen Tang, Peng Qiao, Fengge Wu, Jian Zhang

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 提出用于恶意Python包检测的LLM增强分层异构图表示学习框架,构建分层异构代码图,利用LLMs推理功能语义角色,开发分层异构图神经网络并结合功能级归因机制,实验表明该框架性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03154 2026-07-07 cs.CL cs.AI 新提交

Conditional Diffusion Guided Knowledge Transfer for Multi-Domain Knowledge Graph Completion

多域知识图谱补全的条件扩散引导知识转移

Jiawei Sheng, Taoyu Su, Xixun Lin, Xiaodong Li, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) UCAS(中国科学院大学)

AI总结 研究多域知识图谱补全问题,提出基于条件扩散引导的知识转移框架DMKGC,将各知识图谱视为实体信息的部分视图,通过扩散模型生成通用实体嵌入,提升尾实体预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03050 2026-07-07 cs.LG cs.AI cs.CV cs.SD 新提交

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

OmniFocus:用于全模态大语言模型的查询引导模态平衡令牌压缩

Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所中文信息处理实验室) University of Limerick(利默里克大学) CUHK, Shenzhen(香港中文大学(深圳))

AI总结 研究全模态大语言模型推理成本高的问题,提出无训练的查询引导令牌压缩方法OmniFocus,独立评估音视频重要性,实现模态对称压缩,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02881 2026-07-07 cs.CL 新提交

PraMem: Practice-derived Experiential Memory for Long-horizon Behavior Prediction

PraMem:用于长时行为预测的实践衍生经验记忆

Zhuoqun Li, Boxi Cao, Jiawei Chen, Hanshu Zhou, Ruoxi Xu, Guiping Jiang, Ruotong Pan, Tingting Gao, Han Li, Xiangyu Wu, Hongyu Lin, Yaojie Lu, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所中文信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Fudan University(复旦大学) Kuaishou Technology(快手科技)

AI总结 研究长时行为预测问题,针对大语言模型在该任务中的不足,提出PraMem范式,通过对历史序列预实践构建经验记忆辅助长时行为预测,实验证明其性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02568 2026-07-07 cs.CV 新提交

MAGE: View-guided Point Cloud Completion with Efficient Modality Alignment and Adaptive Geometry Enhancement

MAGE:基于视图引导的点云补全,具有高效模态对齐和自适应几何增强

Weize Quan, Zhengwei Wu, Kai Wang, Dong-Ming Yan

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS研究室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) GIPSA-lab, Univ. Grenoble Alpes, CNRS, Grenoble INP(格勒诺布尔大学GIPSA实验室,法国国家科学研究中心,格勒诺布尔国立综合理工学院)

AI总结 提出统一几何感知框架,集成高效模态对齐与自适应几何增强,解决视图引导点云补全的跨模态几何不一致问题,含几何感知模态对齐等模块,实验证明性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02934 2026-07-07 cs.CV cond-mat.mtrl-sci cs.AI 新提交

MatPhaseBench: A Semantics-Guided Benchmark for Materials Phase Diagrams Understanding

MatPhaseBench:用于材料相图理解的语义引导基准测试

Hanwen Wang, Sihan Liang, Zhiwei Liu, Yangang Wang, Wei Yan, Yuqin Liu, Zongguo Wang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) University of Manchester(曼彻斯特大学) Institute of Metal Research, Chinese Academy of Sciences(中国科学院金属研究所) China University of Geosciences(中国地质大学)

AI总结 介绍用于材料相图理解的MatPhaseBench基准测试,从文献选图与文字构建,有复杂科学图像理解、图文全面对齐、高质量人工监督文本采集三个关键特性,实验显示当前VLM距专家理解有差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01050 2026-07-07 cs.CV 新提交

GeoSearcher: Anchor-Guided Progressive Reasoning for Remote Sensing Visual Grounding with Process Supervision

GeoSearcher: 基于锚点引导的渐进推理遥感视觉定位与过程监督

Dianyu Wang, Peirong Zhang, Xuyang Li, Xiaoxuan Liu, Lei Wang

机构 * Key Laboratory of Target Cognition and Application Technology (TCAT), Chinese Academy of Sciences(中国科学院目标认知与应用技术重点实验室) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)

AI总结 提出GeoSearcher,通过锚点引导的渐进推理和过程监督,将遥感视觉定位转化为两阶段过程,解决小目标定位和复杂查询的挑战。

Comments 14 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26997 2026-07-07 cs.DC cs.LG 新提交

RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning

RolloutPipe: 分离式在线策略LLM强化学习中的流水线化Rollout与训练重叠

Rongjian Chen, Jianmin Hu, Kejiang Ye, Minxian Xu

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Southern University of Science and Technology(南方科技大学)

AI总结 针对分离式RLVR系统中rollout与训练阶段空闲问题,提出RolloutPipe框架,通过完整组流水线(CGP)和前沿组调度(FGD)实现训练与rollout重叠,保持在线策略正确性,减少训练等待时间30.7%-42.3%。

Comments 15 pages

Journal ref Proceedings of the 2026 International Conference on Cognitive Computing (ICCC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26092 2026-07-07 cs.CV 新提交

TryOnCrafter: Unleashing Camera Trajectories for Realistic Video Virtual Try-on via a Renderable 4D Try-on Proxy

TryOnCrafter: 通过可渲染的4D试穿代理释放相机轨迹以实现逼真的视频虚拟试穿

Hao Sun, Hao Yan, Mengting Chen, Quanjian Song, Yu Li, Juan Cao, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, Sheng Tang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Xiamen University(厦门大学) Alibaba Group(阿里巴巴集团)

AI总结 提出TryOnCrafter,首个基于DiT的统一框架,通过可渲染4D试穿代理解耦人体与环境,实现相机可控的视频虚拟试穿,支持任意视角合成和下游应用。

Comments Project Page: https://sunhao242.github.io/TryOnCrafter_web.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18932 2026-07-07 astro-ph.EP astro-ph.IM cs.AI cs.LG 新提交

TransitNet: A Compact Attention-Augmented Deep Learning Framework for Low-SNR Transit Blind Searches

TransitNet: 一种用于低信噪比凌星盲搜索的紧凑型注意力增强深度学习框架

Xingchen Yan, Jian Ge, Qingtian Liu, Kevin Willis, Quanquan Hu, Jiapeng Zhu

机构 * Shanghai Astronomical Observatory, Shanghai 200030, China(上海天文台,上海200030,中国) University of Chinese Academy of Sciences, Yanqi Lake Campus, East Road 1, Huairou, Beijing 101408, China(中国科学院大学,燕琦湖校区,东路1号,北京101408,中国) Science Talent Training Center, Gainesville, FL, 32606 USA(科学人才培训中心,佛罗里达州盖恩斯维尔,32606美国)

AI总结 提出紧凑型注意力增强深度学习框架TransitNet,用于低信噪比凌星盲搜索,在SNR 6-8范围内达到95.2%准确率,恢复率93.0%,远超TLS和BLS,且模型仅1.5 MB,推理速度提升12-25倍。

Comments 25 pages, 23 figures, 3 tables, submitted to A&A

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02503 2026-07-03 cs.RO 新提交

VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation

VT-WAM: 面向密集接触操作的视觉-触觉世界动作模型

Shuai Tian, Yupeng Zheng, Yuhang Zheng, Songen Gu, Yujie Zang, Yuxing Qin, Weize Li, Haoran Li, Wenchao Ding, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) TARS Robotics National University of Singapore(新加坡国立大学) Fudan University(复旦大学)

AI总结 提出VT-WAM,在统一流匹配框架中联合学习视觉预测、触觉变形预测和动作预测,通过非对称混合Transformer注意力和接触门控注意力引导,在六项真实密集接触操作任务中平均成功率71.67%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02262 2026-07-03 cs.CL 新提交

CheckRLM: Effective Knowledge-Thought Coherence Checking in Retrieval-Augmented Reasoning

CheckRLM: 检索增强推理中的有效知识-思维连贯性检查

Dingling Xu, Ruobing Wang, Qingfei Zhao, Yukun Yan, Zhichun Wang, Daren Zha, Shi Yu, Zhenghao Liu, Shuo Wang, Xu Han, Maosong Sun

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Beijing Key Laboratory of Artificial Intelligence for Education(北京人工智能教育重点实验室) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University(清华大学人工智能研究院计算机科学与技术系) Northeastern University(东北大学)

AI总结 提出CheckRLM框架,通过检索增强生成及时检查和纠正推理链中的事实错误,确保推理与知识一致,降低长程推理错误累积成本。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01876 2026-07-03 cs.CV cs.AI 新提交

SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models

SAB-LVLM: 面向大型视觉-语言模型的重要性感知二值化

Qi Lyu, Jiahua Dong, Baichen Liu, Xudong Wang, Mingfei Han, Yulun Zhang, Fahad Shahbaz Khan, Salman Khan, Lianqing Liu, Zhi Han

机构 * State Key Laboratory of Robotics and Intelligent Systems(机器人学国家重点实验室) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出SAB-LVLM方法,通过构建空间重要性图与模态引导整合策略,实现跨层跨模态权重重要性感知的二值化,在约1比特压缩下优于现有二值化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01870 2026-07-03 cs.AI 新提交

CamoNAS: Neural Architecture Search for Enhanced Camouflaged Object Detection

CamoNAS:面向增强伪装目标检测的神经架构搜索

Dawei Ren, Yan Zhang, Hongying Tang, Qiaoling Zhou, Jianpo Liu

机构 * University of Chinese Academy of Sciences(中国科学院大学) School of Information Science and Technology, Shanghaitech University(上海科技大学信息科学与技术学院)

AI总结 提出CamoNAS,一种频率感知多分辨率神经架构搜索框架,自动搜索细胞级操作和网络级下采样路径,并采用RGB频率双流架构,在四个伪装目标检测基准上达到最先进性能。

Comments Published in The Visual Computer. Author manuscript version

Journal ref The Visual Computer 42, Article 194 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01651 2026-07-03 cs.RO 新提交

One Demonstration Is Enough for Real-World Robotic Reinforcement Learning

一个演示足以实现真实世界机器人强化学习

Yuwan Liu, Hongze Yu, Song Liu, Yuhan Wang, Junge Zhang, Yaodong Yang, Yuanpei Chen, Ceyao Zhang

机构 * National Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institution of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能国家重点实验室) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) PKU-PsiBot Joint Lab(北大-鹏城实验室联合实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

AI总结 提出AutoSERL框架,仅需一个演示即可自动化真实世界机器人强化学习,通过滑动窗口干预、安全恢复和自动终止机制,在六个接触密集型任务上超越基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01642 2026-07-03 cs.CV 新提交

Multi-Resolution Flow Matching: Training-Free Diffusion Acceleration via Staged Sampling

多分辨率流匹配:通过分阶段采样实现无训练扩散加速

Xingyu Zheng, Xianglong Liu, Yifu Ding, Weilun Feng, Junqing Lin, Jinyang Guo, Haotong Qin

机构 * State Key Laboratory of Complex & Critical Software Environment, Beihang University(北京航空航天大学复杂关键软件环境国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Nanyang Technological University(南洋理工大学) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ETH Zürich(苏黎世联邦理工学院)

AI总结 提出MrFlow,一种基于分阶段低到高分辨率管道的无训练多分辨率加速策略,利用低分辨率采样减少计算量,像素空间超分辨率和高频重采样保持质量,实现10倍加速且质量损失小于1%。

Comments The code is available at https://github.com/Xingyu-Zheng/MrFlow

详情

展开后加载摘要…

URL PDF HTML 收藏