arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

共收录 2226
2511.22940 2026-05-20 cs.CV

One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer

一对一动画:无对齐角色动画和图像姿态转换

Shijun Shi, Jing Xu, Zhihang Li, Chunli Peng, Xiaoda Yang, Lijing Lu, Kai Hu, Jiangning Zhang

机构 * Jiangnan University(江南大学) University of Science and Technology of China(中国科学技术大学) Chinese Academy of Sciences(中国科学院) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学)

AI总结 本文提出了一种统一框架,用于高保真角色动画和图像姿态转换,解决了参考姿态错位问题,通过自监督补全任务和混合参考融合注意力机制提升生成质量。

Comments Project Page:https://ssj9596.github.io/one-to-all-animation-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19425 2026-05-20 cs.LG cs.AI

When to Stop Reusing: Dynamic Gradient Gating for Sample-Efficient RLVR

何时停止重用:动态梯度门控用于样本高效的RLVR

Yuchun Miao, Sen Zhang, Yuqi Zhang, Yaorui Shi, Qi Gu, Xunliang Cai, Lefei Zhang

机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University(国家多媒体软件工程研究中心,武汉大学计算机学院) Meituan Longcat Team(美团Longcat团队) The University of Sydney(悉尼大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出动态梯度门控(DGG)方法,通过实时监控lm_head梯度范数来检测并阻止有害的梯度传播,从而提高样本效率和训练速度。

Comments 23 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14678 2026-05-20 cs.AI

$π$-Bench: Evaluating Proactive Personal Assistant Agents in Long-Horizon Workflows

$π$-Bench:评估长周期工作流中主动型个人助理代理

Haoran Zhang, Luxin Xu, Zhilin Wang, Runquan Gui, Shunkai Zhang, Haodi Lei, Zihao He, Bingsu He, Chicheng Qin, Tong Zhu, Xiaoye Qu, Yang Yang, Yu Cheng, Yafu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Nanjing University(南京大学) Zhejiang University(浙江大学) Tongji University(同济大学) Soochow University(苏州大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出$π$-Bench基准,用于评估个人助理代理在长周期工作流中的主动协助能力,通过100个多轮任务和5种特定领域用户角色,验证代理在未明确表达意图前识别和执行隐藏意图的能力,揭示主动协助的挑战及前期交互对后续任务的重要性。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05974 2026-05-20 cs.CR cs.AI

PragLocker: Protecting Agent Intellectual Property in Untrusted Deployments via Non-Portable Prompts

PragLocker: 通过非可移植提示保护代理知识产权

Qinfeng Li, Yuntai Bao, Jianghui Hu, Wenqi Zhang, Jintao Chen, Huifeng Zhu, Yier Jin, Xuhong Zhang

机构 * Zhejiang University(浙江大学) Management Center, School of Software Technology (Ningbo), Zhejiang University(浙江大学软件学院(宁波)管理中心) University of Science and Technology of China(中国科学技术大学) Chang'an University(长安大学) Washington University in St. Louis(圣路易斯华盛顿大学)

AI总结 针对无信任部署中代理提示易被复制和重用的问题,PragLocker提出了一种保护方案,通过构建语义锚定的混淆提示并注入噪声,有效降低跨LLM可移植性,同时保持目标性能和对抗鲁棒性。

Comments accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21196 2026-05-20 cs.LG cs.CV

Differential-Integral Neural Operator for Long-Term Turbulence Forecasting

微分-积分神经算子用于长期湍流预测

Hao Wu, Yuan Gao, Fan Xu, Fan Zhang, Qingsong Wen, Kun Wang, Xiaomeng Huang, Xian Wu

机构 * Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) Tencent(腾讯)

AI总结 本文提出了一种基于物理原理的微分-积分神经算子,通过并行分支学习不同的物理算子,以提高长期湍流预测的稳定性与鲁棒性,从而在2D Kolmogorov流基准测试中实现了更精确的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18882 2026-05-20 cs.LG cs.AI

To Call or Not to Call: Diagnosing Intrinsic Over-Calling Bias in LLM Agents

叫还是不叫:诊断LLM代理中的内在过度调用偏差

Wei Shi, Ziheng Peng, Sihang Li, Xiting Wang, Xiang Wang, Mengnan Du, Na Zou

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Renmin University of China(中国人民大学) The Chinese University of Hong Kong Shenzhen(香港中文大学(深圳)) University of Science and Technology of China(中国科学技术大学)

AI总结 本文研究了LLM代理中过度调用现象,提出内在偏差假说,通过稀疏自编码器恢复行为对齐的特征基,减少到带符号激活边距,并估计偏移量,从而修正过度调用问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18820 2026-05-20 cs.LG cs.AI

Emergence of Frontier Superposition: Möbius attractor and Cascade Supervision

前沿叠加的涌现:莫比乌斯吸引子与级联监督

Hongyu Gu, Jingwen Fu

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院)

AI总结 本文研究了通过叠加实现深度推理的问题,提出莫比乌斯吸引子和级联监督方法,证明了在Erdős-Rényi图上,叠加推理的涌现是通过建筑和监督的贡献实现的。

Comments 40 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18599 2026-05-19 cs.CV

Resolving Representation Ambiguity in Feedforward Novel View Synthesis Transformer via Semantic-Spatial Decoupling

通过语义-空间解耦解决前馈新视角合成变换器中的表示歧义

Yihang Wu, Yihang Sun, Shaofeng Zhang, Zuxuan Wu, Junchi Yan, Xiaosong Jia, Yu-gang Jiang

机构 * Institute of Trustworthy Embodied Artificial Intelligence (TEAI)(可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) Sch. of Artificial Intelligence & Sch. of Computer Science, Shanghai Jiao Tong University(上海交通大学人工智能学院与计算机科学学院) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出通过语义-空间解耦解决前馈新视角合成变换器中的表示歧义问题,通过分离语义和空间令牌,保持两者的显式表示并利用共享注意力路由保持跨分支交互,同时引入可选分类监督和双向调制以提高交互效果,从而在解码器-only和编码器-解码器前馈NVS模型中实现一致的改进。

Comments 24 pages, 11 figures, 4 tables. Project page: https://hangzay.github.io/ssd_lvsm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14371 2026-05-19 cs.RO cs.AI

OxyGen: Unified KV Cache Management for VLA Inference under Multi-Task Parallelism

OxyGen: 为多任务并行下的VLA推理提供统一的KV缓存管理

Xiangyu Li, Huaizhi Tang, Xin Ding, Weijun Wang, Ting Cao, Yunxin Liu

机构 * Institute for AI Industry Research (AIR)(人工智能产业研究院) Department of Electronic Engineering(电子工程系) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出OxyGen,一种统一的KV缓存管理方法,用于在多任务并行下提高VLA推理效率,通过跨任务KV共享和跨帧连续批处理实现冗余计算和资源竞争的减少,从而在设备端实现更高的吞吐量和频率。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03851 2026-05-19 cs.CL

Rethinking Table Pruning in TableQA: From Sequential Revisions to Gold Trajectory-Supervised Parallel Search

重新思考表格修剪在表格问答中的应用:从顺序修订到黄金轨迹监督的并行搜索

Yu Guo, Shenghao Ye, Shuangwu Chen, Zijian Wen, Tao Zhang, Qirui Bai, Dong Jin, Yunpeng Hou, Huasen He, Jian Yang, Xiaobin Tan

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)

AI总结 本文提出TabTrim框架,通过将表格修剪从顺序修订转变为由黄金轨迹监督的并行搜索,解决了现有方法中无法检测关键答案数据丢失的问题,并在多个表格推理任务中实现了最先进的性能。

Comments 17 pages, 5 figures, accepted to ACL 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17680 2026-05-19 cs.CL

When TableQA Meets Noise: A Dual Denoising Framework for Complex Questions and Large-scale Tables

当表格问答遇见噪声:为复杂问题和大规模表格设计的双去噪框架

Shenghao Ye, Yu Guo, Dong Jin, Yikai Shen, Yunpeng Hou, Shuangwu Chen, Jian Yang, Xiaofeng Jiang

机构 * University of Science and Technology of China(中国科学技术大学) The University of Melbourne(墨尔本大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

AI总结 本文提出EnoTab双去噪框架,通过改进相关性过滤和表格修剪能力,解决复杂问题和大规模表格中的噪声问题,提升表格问答性能。

Comments 24 pages, 24 figures, accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20218 2026-05-19 cs.LG

Fine-grained List-wise Alignment for Generative Medication Recommendation

细粒度列表级对齐用于生成性药物推荐

Chenxiao Fan, Chongming Gao, Wentao Shi, Yaxin Gong, Zihao Zhao, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出FLAME框架,通过细粒度列表级对齐方法,利用大语言模型生成药物列表,以提高药物推荐的准确性和安全性,同时考虑药物间的相互作用和潜在不良反应。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18059 2026-05-19 cs.RO

Bench2Drive-Robust: Benchmarking Closed-Loop Autonomous Driving under Deployment Perturbations

Bench2Drive-Robust: 在部署扰动下闭环自动驾驶的基准测试

Zhiyuan Zhang, Zhenghao Jin, Yanlun Peng, Xianda Guo, Haoran Liu, Shaofeng Zhang, Xingjun Ma, Zuxuan Wu, Junchi Yan, Xiaosong Jia, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI (TEAI)(可信具身人工智能研究院) Great Wall Motor(长城汽车) Sch. of Computer Science & Sch. of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学计算机学院及人工智能学院) School of Computer Science, Wuhan University(武汉大学计算机学院) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出Bench2Drive-Robust,首个针对闭环端到端自动驾驶在现实部署扰动下的设备中心鲁棒性基准测试,评估了三种主要来源的部署相关扰动对自动驾驶系统的影响,揭示了传统图像级腐蚀评估未能完全捕捉的鲁棒性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17933 2026-05-19 cs.CV

AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents

AtlasVA: 无教师视觉技能记忆用于无需教师的VLM代理

Pan Wang, Yihao Hu, Xiujin Liu, Jingchu Yang, Hang Wang, Zhihao Wen

机构 * Ant Group(蚂蚁集团) University of Science and Technology of China(中国科学技术大学) Westlake University(西湖大学) University of Michigan - Ann Arbor(密歇根大学-安娜堡分校) Sun Yat-sen University(中山大学)

AI总结 本研究提出AtlasVA,一种无需教师的视觉技能记忆框架,通过空间热图、视觉示例和符号文本技能三层结构,统一感知、记忆和优化,实现在无需外部LLM监督下的强化学习性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17912 2026-05-19 cs.RO cs.CV

WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform

WorldArena 2.0: 扩展模态、功能和平台的具身世界模型基准测试

Yu Shang, Yinzhou Tang, Yiding Ma, Zhuohang Li, Lei Jin, Weikang Su, Xin Jin, Zhaolu Wang, Ziyou Wang, Xin Zhang, Haisheng Su, Weizhen He, Wei Wu, Haoyi Duan, Gordon Wetzstein, Xihui Liu, Dhruv Shah, Zhaoxiang Zhang, Zhibo Chen, Jun Zhu, Yonghong Tian, Tat-Seng Chua, Wenwu Zhu, Chen Gao, Yong Li

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Stanford University(斯坦福大学) The University of Hong Kong(香港大学) Princeton University(普林斯顿大学) Chinese Academy of Sciences(中国科学院) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出WorldArena 2.0,扩展了具身世界模型的评估,涵盖模态、功能和平台三个维度,提供全面的测试平台以评估具身世界模型的进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17526 2026-05-19 cs.SE cs.AI

SaaSBench: Exploring the Boundaries of Coding Agents in Long-Horizon Enterprise SaaS Engineering

SaaSBench: 探索编码代理在长周期企业SaaS工程中的边界

Qingnan Ren, Shun Zou, Shiting Huang, Ziao Zhang, Kou Shi, Zhen Fang, Yiming Zhao, Yu Zeng, Qisheng Su, Lin Chen, Yong Wang, Zehui Chen, Xiangxiang Chu, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) AMAP, Alibaba Group(阿里云实验室)

AI总结 本文提出SaaSBench,首个针对企业SaaS工程的基准,旨在探索AI代理在复杂系统中的边界,通过30个任务和5370个验证节点,涵盖8种编程语言、6种数据库和13种框架,揭示了当前最先进代理在多组件系统配置和集成中的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17453 2026-05-19 cs.CR cs.CL

Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback

勿信工具:在不可信工具反馈下评估和防御LLM代理

Lecheng Yan, Ruizhe Li, Xicheng Han, Wenxi Li, Binwu Wang, Longyue Wang, Chenyang Lyu, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) University of Science and Technology of China(中国科学技术大学) University of Birmingham(伯明翰大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) Alibaba Group(阿里巴巴集团)

AI总结 本研究探讨了在不可信工具反馈环境下评估和防御LLM代理的问题,提出了一种新的失败模式'认知中毒',并介绍了TRUST-Bench基准、GuardedJoint惩罚指标和VISTA-Guard框架,展示了轨迹感知的最终动作评分在安全与效用权衡中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23231 2026-05-19 cs.AI

PERMA: Benchmarking Personalized Memory Agents via Event-Driven Preference and Realistic Task Environments

PERMA:通过事件驱动的偏好和现实任务环境评估个性化记忆代理

Shuochen Liu, Junyi Zhu, Long Shu, Junda Lin, Yuhao Chen, Haotian Zhang, Chao Zhang, Derong Xu, Jia Li, Bo Tang, Zhiyu Li, Feiyu Xiong, Enhong Chen, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Northeastern University(东北大学) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司)

AI总结 本文提出PERMA基准,通过事件驱动的偏好和现实任务环境评估个性化记忆代理的长期一致性,引入文本变异和语言对齐以模拟真实数据中的不规则用户输入和个体语言风格,实验表明先进记忆系统能精准提取偏好并减少token消耗,但仍需更稳健的个性化记忆管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21468 2026-05-19 cs.AI

MemOCR: Layout-Aware Visual Memory for Efficient Long-Horizon Reasoning

MemOCR: 一种面向布局的视觉记忆用于高效的长周期推理

Yaorui Shi, Shugui Liu, Yu Yang, Wenyu Mao, Yuxin Chen, Qi GU, Hui Su, Xunliang Cai, Xiang Wang, An Zhang

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) School of Computing(计算学院)

AI总结 MemOCR通过利用视觉布局进行自适应信息密度分配,提高了在有限上下文预算下的长周期推理效率,其核心方法是维护结构化的丰富文本记忆并将其渲染为图像,以实现对关键证据的视觉优先级分配和辅助细节的压缩,从而在各种基准测试中优于基于文本的基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18158 2026-05-19 cs.CV eess.IV

Semantics Disentanglement and Composition for Universal Image Coding with Efficiently LLM Reasoning and Generative Diffusion

语义解耦与组合用于具有高效LLM推理和生成扩散的通用图像编码

Jinming Liu, Yuntao Wei, Junyan Lin, Shengyang Zhao, Heming Sun, Zhibo Chen, Wenjun Zeng, Xin Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室) Ningbo Institute of Digital Twin(宁波数字孪生研究院) Eastern Institute of Technology(东部技术研究院) University of Science and Technology of China(中国科学技术大学) Yokohama National University(Yokohama国立大学)

AI总结 本文提出UniCodec,一种基于语义解耦和组合生成的通用图像编码框架,通过高效LLM推理和生成扩散模型实现人类和机器需求的统一压缩,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17365 2026-05-19 cs.CV

Memory-Augmented Query Intent Understanding for Efficient Chat-based Image Retrieval

基于记忆的查询意图理解用于高效的基于聊天的图像检索

Xianke Chen, Daizong Liu, Yushuo Lou, Xin Tan, Xun Yang, Shuhui Wang, Xun Wang, Jianfeng Dong

机构 * School of Computer Science and Technology, and the School of Statistics and Mathematics, Zhejiang Gongshang University(计算机科学与技术学院,和统计与数学学院,浙江工商大学) School of Computer Science and Technology, Zhejiang Gongshang University, and the Zhejiang Key Laboratory of Big Data and Future E-Commerce Technology(计算机科学与技术学院,浙江工商大学,和大数据与未来电子商务技术浙江省重点实验室) Wangxuan Institute of Computer Technology, Peking University(王璇计算机技术研究所,北京大学) School of Information and Electronic Engineering, Zhejiang Gongshang University(信息与电子工程学院,浙江工商大学) School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,华东师范大学) Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences , Institute of Computing Technology, CAS(中国科学院智能信息处理重点实验室,计算技术研究所,中国科学院) School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学)

AI总结 本文提出了一种高效的基于聊天的图像检索任务中的记忆增强查询意图理解框架MAQIU,通过动态聚合和演化查询意图的语义表示,防止意图遗忘并增强长期语义完整性,从而在保持高计算效率的同时实现显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17295 2026-05-19 cs.LG cs.CL

DISA: Offline Importance Sampling for Distribution-Matching LLM-RL

DISA: 分布匹配强化学习中的离线重要性采样

Shaobo Wang, Yujie Chen, Yafeng Sun, Wenjie Qiu, Zhihui Xie, Sihang Li, Yucheng Li, Huiqiang Jiang, Xingzhang Ren, Xuming Hu, Dayiheng Liu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Qwen Team, Alibaba Group(阿里集团Qwen团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) The University of Hong Kong(香港大学)

AI总结 本研究提出DISA方法,通过离线重要性采样解决分布匹配强化学习中的校准问题,分离了分区函数估计与策略学习,提高了策略多样性并在多个基准测试中表现出色。

Comments 21 pages, 7 figures, 7 tables. Abstract shortened to respect the arXiv limit of 1920 characters. Please see the PDF for the full abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17070 2026-05-19 cs.CV

EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models

EPIC-Bench: 一种以感知为中心的细粒度具身视觉 grounding 的基准

Haozhe Shan, Xiancong Ren, Han Dong, Haoyuan Shi, Yingji Zhang, Jiayu Hu, Yi Zhang, Yong Dai, Bin Shen, Lizhen Qu, Zenglin Xu, Xiaozhu Ju

机构 * X-Humanoid Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) University of Manchester(曼彻斯特大学) Monash University(墨尔本大学) Celonis AI University of New South Wales(新南威尔士大学)

AI总结 本文提出 EPIC-Bench,一种以感知为中心的细粒度具身视觉 grounding 基准,旨在系统评估 VLMs 在现实世界具身环境中的视觉感知能力。该基准包含 6.6k 个精心标注的元组(图像,文本,掩码),涵盖 23 个细粒度任务,涉及具身交互管道的三个核心阶段:目标定位、导航和操作。评估结果显示,尽管先进推理模型表现出潜力,但当前 VLMs 在复杂视觉-文本对齐方面普遍存在困难,特别是在多目标计数、部分-整体关系理解和 affordance 区域检测方面存在瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17033 2026-05-19 cs.RO

Generalizable and Actionable Parts Pose Estimation with Symmetry Annotation-Free Learning Strategy

具有对称标注自由学习策略的通用且可操作的部件姿态估计

Wenxiao Chen, Xueyu Yuan, Liu Liu, Di Wu, Dan Guo

机构 * Hefei University of Technology, Hefei, Anhui, China(合肥工业大学) University of Science and Technology of China, Hefei, Anhui, China(中国科学技术大学)

AI总结 本文提出了一种无需对称标注的通用且可操作的部件姿态估计框架SAFAG,通过分步细化两阶段框架和自监督学习策略解决对称预测问题,提升了在数据匮乏场景下的姿态估计性能和鲁棒性。

Comments Accepted as a poster at the Forty-third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16949 2026-05-19 cs.CV

Beyond Point-Wise Matching: Structural Representation Alignment for Accelerating Diffusion Transformers

超越点对点匹配:为加速扩散变换器的结构表示对齐

Shaodong Xu, Zhendong Wang, Litong Gong, Zexian Li, Wengang Zhou, Tiezheng Ge, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出sREPA框架,通过显式结构约束来对齐特征图的相对几何关系,以提高生成质量并加速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16874 2026-05-19 cs.AI

Reasoning Can Be Restored by Correcting a Few Decision Tokens

通过纠正少量决策标记来恢复推理能力

Changshuo Shen, Leheng Sheng, Yuxin Chen, An Zhang, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

AI总结 本文研究了基础模型在生成过程中推理优势的稀疏性,提出了一种基于分歧指导的标记干预方法,在少量干预下显著恢复甚至超越了同规模推理模型的性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09395 2026-05-19 cs.AI cs.LG cs.MA cs.MM

Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning

通过定制代理推理增强VLMs在少样本多模态时间序列分类中的能力

Lin Li, Jiawei Huang, Qihao Quan, Dan Li, Boxin Li, Xiao Zhang, Erli Meng, Wenjie Feng, Jian Lou, See-Kiong Ng

机构 * Sun Yat-sen University(中山大学) Xiaomi Corporation(小米公司) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出MarsTSC框架,通过自演化知识库和代理推理提升少样本多模态时间序列分类性能,实验表明其在六个VLM基础上均优于传统和基础模型基线。

Comments 18 pages, 12 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08925 2026-05-19 cs.CV

ClickSeg3D: Few-Click Interactive Segmentation via Semantic Embeddings

ClickSeg3D: 通过语义嵌入实现少点击交互分割

Xueyang Kang, Zijian Yu, Kourosh Khoshelham, Liangliang Nan

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) University of Science and Technology of China(中国科学技术大学) Faculty of Architecture and the Built Environment, Delft University of Technology(代尔夫特理工大学建筑与环境学院)

AI总结 本文提出ClickSeg3D,通过语义嵌入实现高效3D实例分割,采用点集直接处理和多对象点击联合推理,提升分割精度与效率,适用于实时应用。

Comments 15 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16527 2026-05-19 cs.LG cs.AI cs.CL cs.CV

Beyond Superficial Unlearning: Sharpness-Aware Robust Erasure of Hallucinations in Multimodal LLMs

超越表面遗忘:多模态大语言模型中Hallucinations的锐度感知鲁棒擦除

Xianya Fang, Feiyang Ren, Xiang Chen, Yu Tian, Zhen Bi, Haiyang Yu, Sheng-Jun Huang

机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) Institute for AI, Tsinghua University(清华大学人工智能研究院) Huzhou University(湖州大学) Institute of Dataspace, Hefei Comprehensive National Science Center(合肥综合性国家科学中心数据空间研究院) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出SARE方法,通过目标导向的min-max优化和Targeted-SAM机制,解决多模态大语言模型中 hallucinations 的鲁棒擦除问题,提升模型稳定性与擦除效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16079 2026-05-19 cs.CL cs.AI

EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle

EvolveR:通过经验驱动的生命周期实现自进化大语言模型代理

Rong Wu, Xiaoman Wang, Jianbiao Mei, Pinlong Cai, Daocheng Fu, Cheng Yang, Licheng Wen, Xuemeng Yang, Yufan Shen, Yuxin Wang, Botian Shi

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Fudan University(复旦大学) Central South University(中南大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

AI总结 EvolveR通过闭环经验生命周期实现LLM代理的自进化,结合离线自蒸馏和在线交互,利用策略强化机制迭代优化,提升多跳问答任务性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏