arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-05-20 至 2026-05-20 共收录 34
2605.20182 2026-05-20 cs.LG cs.AI

Atoms of Thought: Universal EEG Representation Learning with Microstates

思想的原子:基于微状态的通用EEG表示学习

Xinyang Tian, Ruitao Liu, Ziyi Ye, Siyang Xue, Xin Wang, Xuesong Chen

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) School of Clinical Medicine, Tsinghua University(清华大学临床医学院) Beijing Five Seasons Medical Technology Co., Ltd.(北京五 Seasons 医疗科技有限公司)

AI总结 本文提出了一种基于微状态的通用EEG表示学习方法,通过将连续EEG信号聚类为离散的微状态序列,构建了一个通用的微状态分词器,并在睡眠分期、情绪识别和运动想象分类等下游任务中展示了其优越性,同时提高了可解释性和扩展性。

Comments Accepted by the 3rd International Workshop on Multimodal and Responsible Affective Computing (MRAC 2025). 8 pages of main text, 23 pages total, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20147 2026-05-20 cs.CV

PixVerve: Advancing Native UHR Image Generation to 100MP with a Large-Scale High-Quality Dataset

PixVerve:通过大规模高质量数据集将原生超高清图像生成推至100MP

Haojun Chen, Haoyang He, Chengming Xu, Qingdong He, Junwei Zhu, Yabiao Wang, Zhucun Xue, Xianfang Zeng, Zhennan Chen, Xiaobin Hu, Hao Zhao, Yong Liu, Jiangning Zhang, Dacheng Tao

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Nanjing University(南京大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出PixVerve-95K数据集,通过精心设计的数据管道构建,包含95K张高分辨率图像和七维标注,用于推动超高清图像生成技术,通过三种训练方案将T2I基础模型扩展到100MP生成,并建立PixVerve-Bench评估协议。

Comments Project page is available at https://haojunchen663.github.io/projects/PixVerve/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20022 2026-05-20 cs.CL

FlexDraft: Flexible Speculative Decoding via Attention Tuning and Bonus-Guided Calibration

FlexDraft: 通过注意力调节和奖励引导校准实现灵活的推测解码

Yaojie Zhang, Jianuo Huang, Junlong Ke, Yuhang Han, Yongji Long, Tianchen Zhao, Biqing Qi, Linfeng Zhang

机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) UESTC School of Software Engineering, HUST(华中科技大学软件工程学院) Tsinghua University(清华大学) HKUST(GZ)(香港科技大学(广州)) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本文提出FlexDraft框架,通过注意力调节和奖励引导校准,灵活适应不同批处理大小,解决传统并行推测解码在大批次时的吞吐量下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19950 2026-05-20 cs.CV

AffectVerse: Emotional World Models for Multimodal Affective Computing

AffectVerse: 多模态情感计算中的情感世界模型

Bo Zhao, Fanghua Ye, Yixin Ji, Sicheng Zhao, Xiaojiang Peng, Zitong YU

机构 * Great Bay University(大湾大学) Tencent(腾讯) Tsinghua University(清华大学) Shenzhen Technology University(深圳技术大学)

AI总结 本研究提出AffectVerse,一种基于Qwen2.5-Omni的多模态情感计算模型,通过引入情感世界模块实现短期潜在情感预测,利用未来预测作为自监督信号,提高了情感计算的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19928 2026-05-20 cs.GT cs.AI cs.LG

Real-Time Parallel Counterfactual Regret Minimization

实时并行反事实遗憾最小化

Boning Li, Longbo Huang

机构 * IIIS, Tsinghua University(清华大学信息科学技术学院)

AI总结 本文提出了一种实时深度限制下的CFR求解并行框架,通过剪枝、抽象和高级CFR变体的无缝整合,实现了在几秒内完成近均衡策略计算的高效方法,实验显示在德州扑克中速度提升了3.3-3.4倍。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19919 2026-05-20 cs.RO

Beyond Action Residuals: Real-World Robot Policy Steering via Bottleneck Latent Reinforcement Learning

超越动作残差:通过瓶颈潜在强化学习实现现实世界机器人策略引导

Dongjie Yu, Kun Lei, Zhennan Jiang, Jia Pan, Huazhe Xu

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Shanghai Qizhi Institute(上海启智研究院) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

AI总结 本文提出了一种名为Z-Perturbation Reinforcement Learning(ZPRL)的方法,通过紧凑的瓶颈潜在空间来引导预训练策略,从而提高样本效率和最终性能,同时在现实世界任务中显著提升了成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24139 2026-05-20 cs.LG stat.ME

Colorful Pinball: Density-Weighted Quantile Regression for Conditional Guarantee of Conformal Prediction

Colorful Pinball:基于密度加权分位数回归的条件保证置信预测

Qianyi Chen, Bo Li

机构 * School of Economics and Management, Tsinghua University, China(清华大学经济管理学院)

AI总结 本文提出了一种基于密度加权分位数回归的条件保证置信预测方法,通过改进标准置信预测的条件覆盖性能,提供更精确的非渐近保证。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19750 2026-05-20 cs.CV

CPC-VAR:Continual Personalized and Compositional Generation in Visual Autoregressive Models

CPC-VAR:视觉自回归模型中的持续个性化与组合生成

Junhao Li, Xinhao Zhong, Yi sun, Yuxia Qiao, Bin Chen, Shu-Tao Xia, Yaowei Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peng Cheng Laboratory(鹏城实验室) South China University of Technology(华南理工大学)

AI总结 本文研究了视觉自回归模型中的持续个性化生成问题,提出了一种统一框架,通过梯度基概念神经元选择和上下文感知组合策略,解决了连续单概念学习和多概念合成中的关键挑战,提升了长序列持续个性化和多概念图像合成的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19660 2026-05-20 cs.LG cs.CL

OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond

OScaR:LLMs及更广泛场景中的极压缩KV缓存量化之奥卡姆之刀

Zunhai Su, Rui Yang, Chao Zhang, Yaxiu Liu, Yifan Zhang, Wei Wu, Jing Xiong, Dayou Du, Xialie Zhuang, Yulei Qian, Yuchen Xie, Yik-Chung Wu, Hongxia Yang, Ngai Wong

机构 * Tsinghua University(清华大学) Meituan LongCat Team(美团LongCat团队) The University of Hong Kong(香港大学) The University of Edinburgh(爱丁堡大学) UCAS(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文针对LLMs中KV缓存极压缩时的量化保真问题,提出OScaR框架,通过Canalized Rotation和Omni-Token Scaling有效缓解Token Norm Imbalance,实现近无损的INT2量化性能,同时提升解码速度和吞吐量。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19524 2026-05-20 cs.RO cs.CV

SafeAlign-VLA: A Negative-Enhanced Safe Alignment Framework for Risk-Aware Autonomous Driving

SafeAlign-VLA: 一种增强负样本的安全对齐框架用于风险感知的自动驾驶

Kefei Tian, Yuansheng Lian, Kai Yang, Xiangdong Chen, Shen Li

机构 * College of Transportation, Tongji University(同济大学交通运输学院) Department of Civil Engineering, Tsinghua University(清华大学土木工程系) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Department of Civil and Environmental Engineering, National University of Singapore(新加坡国立大学土木与环境工程系)

AI总结 本文提出SafeAlign-VLA框架,通过整合负样本数据提升自动驾驶系统对安全边界的理解,通过生成安全标签和反事实轨迹,结合两阶段训练策略和基于锚点的群体相对策略优化,提高了自动驾驶的安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19506 2026-05-20 cs.CV

EventPrune: Cascaded Event-Assisted Token Pruning for Efficient First-Person Dynamic Spatial Reasoning

EventPrune: 用于高效第一人称动态空间推理的级联事件辅助标记修剪

Pengtao Ma, Ziliang Zhou, Ciyu Ruan, Haoyang Wang, Kaiyuan Li, Zihang Gong, Wenhua Ding, Chen Gao, Jingao Xu, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology(哈尔滨工业大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

AI总结 本文提出Event Cascade Pruning (ECP),一种无需训练的框架,利用事件相机的高频运动线索作为连续事件引导的运动先验,指导标记选择,从而在第一人称动态空间推理中实现高效的标记修剪,提升推理速度和减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19374 2026-05-20 cs.CV cs.AI cs.LG

Concept-Guided Noisy Negative Suppression for Zero-Shot Classification and Grounding of Chest X-Ray Findings

基于概念的噪声负样本抑制用于零样本分类和胸片发现的 grounding

Chenyu Lian, Hong-Yu Zhou, Chun-Ka Wong, Jing Qin

机构 * The Center for Smart Health, School of Nursing, the Hong Kong Polytechnic University, Hong Kong, China(香港理工大学智能健康中心,护理学院,中国香港) Research Institute for Smart Ageing, the Hong Kong Polytechnic University, Hong Kong, China(香港理工大学智能老龄化研究 institute,中国香港) School of Biomedical Engineering, Tsinghua Medicine, Tsinghua University, Beijing, China(清华大学生物医学工程学院,清华大学,北京,中国) Queen Mary Hospital, LKS Faculty of Medicine, The University of Hong Kong, Hong Kong, China(香港大学李嘉诚医学院Queen Mary医院,中国香港)

AI总结 本文提出了一种基于概念的噪声负样本抑制框架CoNNS,通过构建层次化概念本体,解决不同患者间相似发现导致的噪声负样本问题,提升零样本理解任务的性能。

Comments Early accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19338 2026-05-20 cs.MA cs.AI cs.CL

STAR-PólyaMath: Multi-Agent Reasoning under Persistent Meta-Strategic Supervision

STAR-PólyaMath: 多智能体在持久元策略监督下的推理

Jiaao Wu, Xian Zhang, Hanzhang Liu, Sophia Zhang, Fan Yang, Yinpeng Dong

机构 * Tsinghua University(清华大学) Microsoft Research(微软研究院) New York University(纽约大学) MIT(麻省理工学院)

AI总结 本文提出STAR-PólyaMath多智能体框架,通过元级监督和结构化的推理-验证交互系统性解决数学推理中的幻觉积累、记忆碎片化和推理工具平衡问题,并在多个顶级竞赛基准上取得最佳成绩。

Comments 25 pages, 4 figures. Code: https://github.com/Julius-Woo/STAR-PolyaMath

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19314 2026-05-20 cs.RO cs.AI

ContextFlow: Hierarchical Task-State Alignment for Long-Horizon Embodied Agents

ContextFlow:长周期具身智能体的分层任务-状态对齐

Shuhan Guo, Kun Zhang, Haifei Liu, Xingyu Gao, Yongqi Zhang, Yaqing Wang, Quanming Yao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Qiuzhen College, Tsinghua University(清华大学启祯学院) Beijing Institute of Mathematical Sciences and Applications(北京数学科学研究院) Department of Data Science and Analytics Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)数据科学与分析部门) Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文研究了长周期具身智能体中任务-状态不一致问题,提出ContextFlow框架通过显式合同表示阶段、运行时观测转为证据包以及应用作用域更新来实现任务前沿对齐,提高任务执行的连贯性和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19101 2026-05-20 cs.SD cs.LG

Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training

面向异质性的数据集调度以实现高效的音频大语言模型训练

Yanru Wu, Jianning Wang, Chongxin Gan, Yang Li

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Independent Researcher(独立研究者) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出了一种面向异质性的数据集调度方法GST,通过将数据集分组并按渐进调度策略引入,平衡了并行训练的稳定性与序列优化的效率,从而在14个AudioQA数据集上实现了30-40%的更快收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18474 2026-05-20 cs.CR cs.AI cs.CL cs.LG

Prompt2Fingerprint: Plug-and-Play LLM Fingerprinting via Text-to-Weight Generation

Prompt2Fingerprint: 通过文本到权重生成实现即插即用的LLM指纹生成

Sixu Chen, Xiang Chen, Hongyao Yu, Jiaxin Hong, Hao Fang, Shuoyang Sun, Bin Chen, Shu-Tao Xia

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,中国深圳) South China University of Technology, Guangzhou, China(华南理工大学,中国广州) Harbin Institute of Technology, Shenzhen, Shenzhen, China(哈尔滨工业大学深圳校区,中国深圳)

AI总结 本文提出Prompt2Fingerprint框架,将LLM指纹生成重新定义为条件参数生成任务,通过专用生成器将文本描述直接映射到低秩参数增量,实现无需进一步模型微调的即插即用LLM指纹注入,显著降低计算开销,提供可扩展且即时的LLM所有权管理解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17003 2026-05-20 cs.LG cs.AI

Learning-Zone Energy: Online Data Selection for Efficient RL Post-Training

学习区能量:用于高效RL后训练的在线数据选择

Peng Cui, Boyao Yang, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech.(计算机科学与技术系) Institute for AI(人工智能研究院) BNRist Center(BNRist中心) Tsinghua-Bosch Joint ML Center(清华大学-博世联合机器学习中心) THBI Lab(THBI实验室) Tsinghua University(清华大学) Dept. of Automation(自动化系)

AI总结 本文提出学习区能量(LZE)方法,通过在线数据选择框架集中计算在模型的主动学习前沿,提高RL后训练的效率,实验表明在多个数据集上表现优异,且计算资源消耗减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16353 2026-05-20 cs.CV cs.AI

StrLoRA: Towards Streaming Continual Visual Instruction Tuning for MLLMs

StrLoRA: 向流式连续视觉指令微调迈进以适应大规模多模态语言模型

Chang Che, Ziqi Wang, Hui Ma, Cheems Wang, Zenglin Shi

机构 * Hefei University of Technology(合肥工业大学) Tsinghua University(清华大学)

AI总结 本文提出StrLoRA,一种流式连续视觉指令微调方法,旨在解决动态任务流中模型持续学习的问题,通过任务感知的专家路由框架提升模型在不断变化的数据流中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15846 2026-05-20 cs.SE cs.AI

RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades

RoadmapBench: 评估跨版本升级的长期代理软件开发

Xinbo Xu, Ruihan Yang, Haiyang Shen, Wendong Xu, Bofei Gao, Ruoyu Wu, Kean Shi, Weichu Xie, Xuanzhong Chen, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

机构 * UniPat AI Peking University(北京大学) Fudan University(复旦大学) The University of Hong Kong(香港大学) Tsinghua University(清华大学) G Labs(0G实验室) Pipeline Lab(Pipeline实验室)

AI总结 本文提出RoadmapBench,一个基于真实开源版本升级的115个长期编码任务的基准,旨在评估长期多目标软件开发,发现现有基准无法有效评估此类任务,表明长期软件开发仍是难题。

Comments 30 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11796 2026-05-20 cs.CL cs.AI

C-ReD: A Comprehensive Chinese Benchmark for AI-Generated Text Detection Derived from Real-World Prompts

C-ReD:一个源自真实世界提示的综合性中文AI生成文本检测基准

Chenxi Qing, Junxi Wu, Zheng Liu, Yixiang Qiu, Hongyao Yu, Bin Chen, Hao Wu, Shu-Tao Xia

机构 * Tsinghua University(清华大学) Nankai University(南开大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Shannon InfoTech

AI总结 本文提出C-ReD基准,用于检测AI生成的中文文本,通过解决模型多样性、领域覆盖和提示真实性等关键问题,提升检测性能和泛化能力。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07561 2026-05-20 cs.CV

PureCC: Pure Learning for Text-to-Image Concept Customization

PureCC: 文本到图像概念定制的纯学习

Zhichao Liao, Xiaole Xian, Qingyu Li, Wenyu Qin, Meng Wang, Weicheng Xie, Siyang Song, Pingfa Feng, Long Zeng, Liang Pan

机构 * Tsinghua University(清华大学) School of Computer Science & Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(深圳大学智能信息处理广东省重点实验室) Kling Team, Kuaishou Technology(快手科技Kling团队) University of Exeter(埃克塞特大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

AI总结 本文提出PureCC,一种用于文本到图像概念定制的纯学习方法,通过分离学习目标来平衡概念定制的保真度与模型保留。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00995 2026-05-20 physics.app-ph cs.AI eess.SP physics.optics

3D aperture-engineered diffractive neural networks for super-resolution electromagnetic wave computing

3D孔径工程衍射神经网络用于超分辨率电磁波计算

Sheng Gao, Songtao Yang, Haiou Zhang, Yuan Shen, Xing Lin

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心)

AI总结 本文提出了一种3D孔径工程衍射神经网络(AE-DNN),通过将传统二维孔径扩展到三维,实现了超分辨率传感和计算,解决了现有架构在处理密集信号和干扰时受衍射限制的瓶颈问题。

Comments 37 pages, 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09023 2026-05-20 cs.RO

TwinRL: Digital Twin-Driven Reinforcement Learning for Real-World Robotic Manipulation

TwinRL: 基于数字孪生的强化学习用于真实世界机器人操作

Qinwen Xu, Jiaming Liu, Rui Zhou, Shaojun Shi, Nuowei Han, Zhuoyang Liu, Chenyang Gu, Shuo Gu, Yang Yue, Gao Huang, Wenzhao Zheng, Sirui Han, Peng Jia, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) Simplexity Robotics(Simplexity机器人) Tsinghua University(清华大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出TwinRL框架,通过数字孪生与真实世界协同训练,提升视觉-语言-动作模型在真实世界中的探索效率和收敛速度,实现高成功率和快速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04381 2026-05-20 cs.CV cs.AI

Enabling Real-Time Colonoscopic Polyp Segmentation on Commodity CPUs via Ultra-Lightweight Architecture

通过超轻量架构在商用CPU上实现实时结肠镜息肉分割

Weihao Gao, Zhuo Deng, Zheng Gong, Lan Ma

机构 * School of Computer Science and Artificial Intelligence, Guangdong University of Education(广东教育学院计算机科学与人工智能学院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 本文提出UltraSeg家族,一种在CPU上运行的轻量级分割模型,能够在不依赖GPU的情况下实现实时结肠镜息肉分割,其核心方法是采用组多率扩张卷积和注意力门控跨层融合,主要贡献是建立了首个在商用CPU上实现高精度实时息肉分割的基准线。

Comments 18pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21196 2026-05-20 cs.LG cs.CV

Differential-Integral Neural Operator for Long-Term Turbulence Forecasting

微分-积分神经算子用于长期湍流预测

Hao Wu, Yuan Gao, Fan Xu, Fan Zhang, Qingsong Wen, Kun Wang, Xiaomeng Huang, Xian Wu

机构 * Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) Tencent(腾讯)

AI总结 本文提出了一种基于物理原理的微分-积分神经算子,通过并行分支学习不同的物理算子,以提高长期湍流预测的稳定性与鲁棒性,从而在2D Kolmogorov流基准测试中实现了更精确的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14787 2026-05-20 cs.RO

COMPASS: Confined-space Manipulation Planning with Active Sensing Strategy

COMPASS:基于主动感知策略的受限空间操作规划

Qixuan Li, Chen Le, Dongyue Huang, Jincheng Yu, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,中国深圳) Department of Electronic Engineering, and the Institute for Embodied Intelligence and Robotics, Tsinghua University, Beijing, China(清华大学电子工程系,以及 embodied intelligence and robotics 研究院,中国北京) The School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院,新加坡)

AI总结 本文提出COMPASS框架,通过主动感知策略在受限和杂乱环境中实现安全操作,提高了操作成功率。

Comments Accepted to the 2026 IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10492 2026-05-20 cs.CV cs.AI cs.LG

BenchReAD: A systematic benchmark for retinal anomaly detection

BenchReAD: 一种系统性的视网膜异常检测基准

Chenyu Lian, Hong-Yu Zhou, Zhanli Hu, Jing Qin

机构 * The Center for Smart Health, School of Nursing, the Hong Kong Polytechnic University, Hong Kong, China(香港理工大学护理学院智能健康中心) School of Biomedical Engineering, Tsinghua University, Beijing, China(清华大学生物医学工程学院) Research Center for Medical AI, Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(中国科学院深圳先进技术研究院医学人工智能研究中心)

AI总结 本研究提出BenchReAD基准,旨在解决视网膜异常检测领域缺乏全面且公开的评估标准的问题,通过系统化的数据和算法分类,引入了全监督方法DRA,并改进为NFM-DRA,实现了SOTA性能。

Comments MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23747 2026-05-20 cs.CV cs.AI cs.LG

Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence

Spatial-MLLM: 提升基于视觉的空域智能的MLLM能力

Diankun Wu, Fangfu Liu, Yi-Hsin Hung, Yueqi Duan

机构 * Tsinghua University(清华大学)

AI总结 本文提出Spatial-MLLM,一种基于纯2D观测的视觉空域推理框架,通过双编码器架构和空间感知帧采样策略提升空域理解能力,实验表明其在多种视觉空域任务中达到SOTA性能。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15362 2026-05-20 cs.LG cs.AI cs.CL cs.CR

Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models

Faster-GCG: 面向对齐大语言模型的高效离散优化监狱突破攻击

Xiao Li, Wei Zhang, Zhuhong Li, Qiongxiu Li, Shei PernChua, BingZe Lee, Jinghao Cui, Yifan Huang, Xiaolin Hu

机构 * Tsinghua University(清华大学) Sea-Fill Duke University(杜克大学) Aalborg University(奥胡斯大学) Chinese Institute for Brain Research (CIBR)(中国脑科学研究院)

AI总结 本文提出Faster-GCG,通过改进估计、高效采样和避免重复评估,提高了对齐大语言模型的监狱突破攻击效率,实现了样本效率提升8倍,时间减少7倍,并在多个模型上取得了更高的突破成功率。

Comments 18 pages, new version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18829 2026-05-20 cs.LG cs.CR

Lossless Anti-Distillation Sampling

无损反蒸馏采样

Zibo Diao, Jingchu Gai, Xinyue Ai, Zhang Zhang, Zhenyu He, Di He

机构 * Peking University(北京大学) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出了一种无损反蒸馏采样方法,通过在保持良性用户体验的同时,有效对抗多账号蒸馏攻击,降低蒸馏模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏