arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-05-14 至 2026-05-14 共收录 14
2605.13534 2026-05-14 cs.AI

Scaling Retrieval-Augmented Reasoning with Parallel Search and Explicit Merging

通过并行搜索和显式合并扩展检索增强推理

Jiabei Liu, Wenyu Mao, Junfei Tan, Chunxu Shen, Lingling Yi, Jiancan Wu, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) WeChat Technical Architecture Department, Tecent Inc.(腾讯公司微信技术架构部门)

AI总结 本文提出MultiSearch框架,通过多查询检索和显式信息融合提升检索增强推理效果,实验表明其在问答任务中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13486 2026-05-14 cs.CL

R^2-Mem: Reflective Experience for Memory Search

R^2-Mem: 用于记忆搜索的反思经验

Xinyuan Wang, Wenyu Mao, Junkang Wu, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 R^2-Mem通过反思经验框架提升记忆搜索系统的有效性和效率,通过历史轨迹评分和自我反思学习,减少重复错误并提高搜索质量,实验表明其在F1分数提升和资源消耗降低方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13375 2026-05-14 cs.CV cs.AI

GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models

GRIP-VLM:基于组相对重要性的高效视觉-语言模型压缩

Mingzhe Huang, Weijun Wang, Xin Ding, Liang Mi, Hao Wen, Yuanchun Li, Lichen Pang, Shansong Yang, Yunxin Liu, Ting Cao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) Juhaokan Technology Co.,Ltd(极皓科技有限公司) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学)

AI总结 GRIP-VLM通过强化学习框架解决视觉语言模型中大规模视觉token处理的计算瓶颈,通过组相对重要性策略优化实现高效压缩,达到15%的推理加速。

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12088 2026-05-14 cs.CV

UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation

UniCustom: 多参考图像生成的统一视觉条件化

Yiyan Xu, Qiulin Wang, Wenjie Wang, Yunyao Mao, Xintao Wang, Pengfei Wan, Kun Gai, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Kling Team, Kuaishou Technology(快手技术团队)

AI总结 UniCustom通过融合ViT和VAE特征提升多参考图像生成中主体一致性和指令遵循能力,采用两阶段训练策略和槽绑定正则化减少跨参考混淆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06021 2026-05-14 stat.ML cs.LG cs.NA math.NA math.PR

Diffusion Model's Generalization Can Be Characterized by Inductive Biases toward a Data-Dependent Ridge Manifold

扩散模型的泛化能力可以通过数据依赖的ridge流形的归纳偏差来表征

Ye He, Yitong Qiu, Molei Tao

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Science and Technology of China(中国科学技术大学)

AI总结 本文研究扩散模型泛化能力的几何机制,通过引入时间依赖的log-density ridge流形,揭示生成样本在流形附近的运动规律,并通过实验验证了其在多模态数据和MNIST中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20239 2026-05-14 cs.RO

TouchGuide: Inference-Time Steering of Visuomotor Policies via Touch Guidance

TouchGuide: 通过触觉引导在推理时操控视觉-触觉策略

Zhemeng Zhang, Jiahua Ma, Xincheng Yang, Xin Wen, Yuzhi Zhang, Boyan Li, Yiran Qin, Jin Liu, Can Zhao, Li Kang, Haoqin Hong, Zhenfei Yin, Philip Torr, Hao Su, Ruimao Zhang, Daolin Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Xense Robotics(Xense机器人公司) Sun Yat-sen University(中山大学) Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) UCSD(加州大学圣地亚哥分校)

AI总结 本文提出TouchGuide,一种新的跨策略视觉-触觉融合方法,通过触觉引导在推理时优化预训练的视觉-触觉策略,提升机器人精细接触操作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13037 2026-05-14 cs.AI

MAP: A Map-then-Act Paradigm for Long-Horizon Interactive Agent Reasoning

MAP:一种用于长周期交互代理推理的先映射再行动范式

Yuxin Liu, Ziang Ye, Yueqing Sun, Mingye Zhu, Jinwei Xiao, Zhuowen Han, Qi GU, Xunliang Cai, Lei Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团) Institution of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tianjin University(天津大学)

AI总结 本文提出MAP范式,通过先构建环境认知再执行任务,解决交互代理中环境感知延迟问题,实验显示在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12163 2026-05-14 cs.CV

Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model

自洽潜在推理:面向视觉语言模型的长潜在序列推理

Chenfeng Wang, Wei He, Xuhan Zhu, Chunpeng Zhou, Qizhen Li, Song Yan, Yufei Zheng, Chengjun Yu, Fan Lu, Wei Zhai, Yang Cao, Pengfei Yu, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Li Auto Inc.(利亚自动化公司)

AI总结 本文提出SCOLAR模型,通过轻量级detransformer生成辅助视觉token,结合三阶段SFT和ALPO强化学习,显著提升视觉语言模型的长序列推理能力,达到开源模型在现实任务中的最佳性能。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01690 2026-05-14 cs.AI

Scale over Preference: The Impact of AI-Generated Content on Online Content Ecology

规模胜过偏好:AI生成内容对在线内容生态的影响

Tianhao Shi, Yang Zhang, Xiaoyan Zhao, Fengbin Zhu, Chenyi Lei, Han Li, Wenwu Ou, Tian Yang, Yang Song, Yongdong Zhang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Kuaishou Technology(快手科技) The Chinese University of Hong Kong(香港中文大学)

AI总结 研究通过分析中国视频平台用户数据,发现AI生成内容在高产量下可与人类生成内容在参与度上持平,尽管消费者更偏好人类生成内容,算法机制在调节竞争中起关键作用。

Comments update authors in v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09628 2026-05-14 cs.RO

TeleGate: Whole-Body Humanoid Teleoperation via Gated Expert Selection with Motion Prior

TeleGate: 通过门控专家选择与运动先验实现全身人形机器人远程操作

Jie Li, Bing Tang, Feng Wu

机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) AnyWit Robotics Co., Ltd., Shushan District, Hefei, Anhui, China(安徽合肥蜀山 district AnyWit 机器人有限公司)

AI总结 本文提出TeleGate框架,通过门控网络动态激活专家策略,结合VAE运动先验模块预测未来动作,实现高精度动态动作远程操作。

Comments Accepted by RSS 2026. Project page: https://anywitresearch.github.io/TeleGate/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18842 2026-05-14 cs.CR cs.AI cs.CV

GUIGuard-Bench: Toward a General Evaluation for Privacy-Preserving GUI Agents

GUIGuard-Bench:面向隐私保护GUI代理的通用评估

Yanxi Wang, Zhiling Zhang, Wenbo Zhou, Weiming Zhang, Jie Zhang, Qiannan Zhu, Yu Shi, Shuxin Zheng, Jiyan He

机构 * Beijing Normal University(北京师范大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) A*STAR Zhongguancun Institution of Artificial Intelligence(中关村人工智能研究所)

AI总结 GUIGuard-Bench通过241个真实GUI代理轨迹和4080张截图,评估隐私保护GUI代理的隐私识别、规划一致性和保护策略影响,揭示隐私识别是实际应用中的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10265 2026-05-14 cs.CL

Backdoor Collapse: Eliminating Unknown Threats via Known Backdoor Aggregation in Language Models

后门崩溃:通过已知后门聚合消除未知威胁

Liang Lin, Miao Yu, Moayad Aloqaily, Zhenhong Zhou, Kun Wang, Linsey Pang, Prakhar Mehrotra, Qingsong Wen

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Science and Technology of China(中国科学技术大学) United Arab Emirates University(阿联酋大学) PayPal Inc(PayPal公司) Walmart Labs(沃尔玛实验室) Squirrel Ai Learning(Squirrel Ai学习) Nanyang Technological University(南洋理工大学)

AI总结 本文提出一种无需提前了解触发器设置的防御框架,通过后门表示聚合和恢复微调,有效降低攻击成功率并保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12876 2026-05-14 cs.LG

MaskPro: Linear-Space Probabilistic Learning for Strict (N:M)-Sparsity on LLMs

MaskPro: 用于LLMs上严格(N:M)-稀疏性的线性空间概率学习

Yan Sun, Qixin Zhang, Zhiyuan Yu, Xikun Zhang, Li Shen, Dacheng Tao

机构 * School of Computer Science Faculty of Engineering The University of Sydney(悉尼大学计算机科学与工程学院) Generative AI Lab College of Computing and Data Science Nanyang Technological University(南洋理工大学生成人工智能实验室) University of Science and Technology of China(中国科学技术大学) RMIT University(皇家理工大学) School of Cyber Science and Technology Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)

AI总结 MaskPro通过学习每个M连续权重的先验分类分布,在N-way采样中生成(N:M)-稀疏性,解决了现有方法在误差和训练成本上的问题,同时提升内存效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12570 2026-05-14 cs.CV

M3Net: A Macro-to-Meso-to-Micro Clinical-inspired Hierarchical 3D Network for Pulmonary Nodule Classification

M3Net:一种受临床诊断流程启发的宏-中-微三级层次3D网络用于肺结节分类

Jinyue Li, Yuzhou Yu, Jingjing Yang, Meng Fu, Yani Zhang, Shuyao He, Dianlong Ge, Xin Ning, Yannan Chu, Qiankun Li

机构 * Hefei Cancer Hospital of CAS, Institute of Health and Medical Technology, Hefei Institutes of Physical Science, Chinese Academy of Sciences(中国科学院合肥医疗健康研究院、健康与医疗技术研究所、物理研究所) University of Science and Technology of China(中国科学技术大学) Graduate School, Bengbu Medical College(蚌埠医疗学院研究生院) Department of Pulmonary and Critical Care Medicine, The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, University of Science and Technology of China (USTC)(中国科学技术大学附属第一医院呼吸与危重症医学科、生命科学与医学学院) Northeastern University(东北大学) Institute of Semiconductors, Chinese Academy of Sciences(中国科学院半导体研究所) College of Computing and Data Science (CCDS), Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 本文提出M3Net,通过多尺度上下文信息整合,提升肺结节分类的准确性和可解释性,在LIDC-IDRI和USTC-FHLN数据集上取得最佳性能。

Comments Published in Information Fusion (2026), 15 pages, 5 figures

Journal ref Information Fusion, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏