arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4536
2605.28548 2026-05-28 cs.CV

GEM: Generative Supervision Helps Embodied Intelligence

GEM: 生成式监督助力具身智能

Ruowen Zhao, Bangguo Li, Zuyan Liu, Yinan Liang, Junliang Ye, Fangfu Liu, Diankun Wu, Zhengyi Wang, Xumin Yu, Yongming Rao, Han Hu, Jun Zhu

机构 * Tsinghua University(清华大学) Tencent Hunyuan(腾讯文心)

AI总结 提出GEM模型,通过在视觉语言模型预训练中引入深度图生成任务,联合训练以提升具身智能的语义理解与物理操作能力,并发布大规模数据集GEM-4M,在多个基准上取得最优结果。

Comments Project Page: https://zhaorw02.github.io/GEM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28359 2026-05-28 cs.AI q-fin.TR

From Knowing to Doing: A Memory-Controlled Benchmark for LLM Trading Agents on Stock Markets

从知道到做到:面向LLM股票市场交易智能体的记忆控制基准

Taojie Zhu, Wentao Zhao, Rui Sun, Beidi Luan, Jiacheng Lu, Sinuo Wang, Jing Li, Daxin Jiang, Yonghong He, Zuo Bai

机构 * Tsinghua University(清华大学) Stepfun FinStep Shanghai Jiao Tong University(上海交通大学) Adelaide University(阿德莱德大学)

AI总结 针对LLM交易智能体评估中的知识泄露和收益归因问题,提出KTD-Fin基准,通过数据掩码和Barra风格归因框架,分离市场记忆与投资决策,并揭示收益主要来自被动市场暴露而非选股能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28277 2026-05-28 cs.AI

Do LLMs Build World Models From Text? A Multilingual Diagnostic of Spatial Reasoning

LLMs 是否从文本构建世界模型?多语言空间推理诊断

Zhikai Pan, Chih-Ting Liao, Chunrui Liu, Xi Xiao, Yitong Qiao, Chunlei Meng, Zhangquan Chen, Xin Cao

机构 * University of New South Wales(新南威尔士大学) Essential Energy University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Zhejiang University(浙江大学) Fudan University(复旦大学) Tsinghua University(清华大学)

AI总结 通过多语言诊断基准 MentalMap 评估大语言模型的空间推理能力,发现所有模型在视角推理上存在普遍的性能瓶颈(L3 推理悬崖),表明该限制源于纯文本工作记忆约束而非特定架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28273 2026-05-28 cs.AI

Global Policy-Space Response Oracles for Two-Player Zero-Sum Games

全局策略空间响应预言机用于两人零和博弈

Junyu Zhang, Feihong Yang, Jian Wang, Chao Wang, Xudong Zhang

机构 * Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系,北京,中国) Qiyuan Lab, Beijing, China(启元实验室,北京,中国)

AI总结 提出Global PSRO框架,通过直接最小化种群可利用性(PE)来引导策略种群扩展,以更少的策略迭代逼近纳什均衡。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25763 2026-05-28 cs.CV

AI-T2I: Aggregating-and-Isolating Cross-Attention to Diffusion Models for Text-to-Image Synthesis

AI-T2I: 面向文本到图像合成的扩散模型的聚合与隔离交叉注意力

Shipeng Cao, Biao Qian, Haipeng Liu, Yang Wang, Meng Wang

机构 * Institute of Advanced Medicine and Frontier Technology(先进医学与前沿技术研究院) Hefei University of Technology(合肥工业大学) Key Laboratory of Knowledge Engineering With Big Data, Ministry of Education(大数据知识工程重点实验室) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 针对扩散模型在文本到图像合成中交叉注意力图内文本-图像对齐不精确的问题,提出一种聚合与隔离交叉注意力方法(AI-T2I),通过聚合损失整合分散的令牌内激活并引入隔离损失分离令牌间激活,实现精确对齐。

Comments Accepted by IEEE Transactions on Multimedia (2026). 13 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24906 2026-05-28 cs.CV

Where Detectors Fail: Probing Generative Space for Generalizable AI-Generated Image Detection

探测器失效之处:探索生成空间以实现可泛化的AI生成图像检测

Zijie Cao, Weijie Tu, Yao Xiao, Weijian Deng, Liang Lin, Pengxu Wei

机构 * School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou, China(中山大学计算机科学与工程学院) Australian National University, Canberra, Australia(澳大利亚国立大学) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生学院)

AI总结 提出PROBE框架,通过主动探索生成过程中的困难区域来改进AI生成图像检测器的泛化能力。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28123 2026-05-28 cs.CL

Risk-aware Selective Prompting for Hallucination Mitigation in Large Vision-Language Models

风险感知的选择性提示用于大型视觉-语言模型中的幻觉缓解

Yuang Huang, Yafeng Zhang, Yu Zilan

机构 * Shanghai Jiao Tong University(上海交通大学) iFLYTEK Tsinghua University(清华大学)

AI总结 本文系统研究提示验证在大型视觉-语言模型中的风险,发现其效果依赖输入难度,并提出基于预生成不确定性信号的选择性提示方法RSP以平衡性能。

Comments 7 pages, 1 figures, submitted to ACL ARR 2026 May (EMNLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28070 2026-05-28 cs.AI

Bridging the Detection-to-Abstention Gap in Reasoning Models under Insufficient Information

弥合推理模型在信息不足情况下的检测到弃权差距

Renjie Gu, Jiaxu Li, Yihao Wang, Yun Yue, Hansong Xiao, Yefei Chen, Yuan Wang, Chunxiao Guo, Pei Wei, Jinjie Gu, Yixin Cao

机构 * Fudan University(复旦大学) Ant Group(蚂蚁集团) Zhejiang University(浙江大学) Tsinghua University(清华大学)

AI总结 针对推理模型在信息不足时无法有效弃权的问题,提出Judge-Then-Solve(JTS)轨迹级推理控制框架,通过可回答性判断和强化学习训练,显著提升可靠弃权率并减少不必要的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28035 2026-05-28 cs.AI cs.MM cs.SD

MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation

MTAVG-Bench 2.0:诊断多说话人音视频生成中电影表现力的失败模式

Haitian Li, Yanghao Zhou, Heyan Huang, Liangji Chen, YiMing Cheng, Xu Liu, Dian Jin, Jiajun Xu, Jingyun Liao, Tian Lan, Ziqin Zhou, Yueying Liu, Yu Bai, Changsen Yuan, Jinxing Zhou, Xian-Ling Mao, Xuefeng Chen, Yousheng Feng

机构 * Shanghai University(上海大学) Beijing Institute of Technology(北京理工大学) Shanghai Film Academy(上海电影学院) Tsinghua University(清华大学) Hefei University of Technology(合肥工业大学) Inkeverse Group Limited(Inkeverse集团有限公司) The University of Adelaide(阿德莱德大学) Beijing University of Technology(北京工业大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) OpenNLP Lab(OpenNLP实验室)

AI总结 针对多说话人音视频生成中电影表现力评估不足的问题,提出MTAVG-Bench 2.0基准,通过构建涵盖表演、叙事、氛围和视听语言的高层次失败分类体系及超过1万个问答实例,系统评估全模态大语言模型诊断复杂视听失败的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27911 2026-05-28 cs.AI

SuiChat-CN: Benchmarking Contextual Suicide Risk Assessment in Chinese Group Chats

SuiChat-CN:中文群聊情境自杀风险评估基准

Xiangyu Wang, Zhiwei Yu, Chengze Du, Dingchang Wang, Yuhan Ye, Fangyu Zheng

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology of China(中国科学技术大学)

AI总结 针对即时通讯群聊中消息碎片化、多轮对话和隐晦表达带来的挑战,构建了首个中文群聊情境自杀风险评估基准SuiChat-CN,通过信号词提取和双向上下文扩展构建连贯对话片段,并利用专家验证的LLM辅助范式标注用户风险等级,实验表明上下文信息对可靠评估至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27906 2026-05-28 cs.AI

Reasoning Matters: Mitigate Hallucination in Multimodal Large Reasoning Models via Reasoning-Conditioned Preference Optimization

推理至关重要:通过推理条件偏好优化减轻多模态大型推理模型中的幻觉

Jiawei Kong, Hao Fang, Shunxiang Liao, Jinyu Li, Bin Chen, Hao Wu, Shu-Tao Xia, Min Zhang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳)

AI总结 提出推理条件直接偏好优化(RC-DPO)方法,通过将思维链作为答案生成的条件并对比不同思维链下的偏好,结合蒙特卡洛树搜索和注意力引导的思维链剪枝生成偏好数据,有效减轻多模态大型推理模型中的幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27840 2026-05-28 eess.AS cs.AI cs.SD

LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation

LoSATok: 用于跨域音频理解与生成的低维语义-声学分词器

Zhisheng Zhang, Xiang Li, Yixuan Zhou, Jing Peng, Guoyang Zeng, Zhiyong Wu

机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院,中国) ModelBest Inc., China(ModelBest公司,中国)

AI总结 提出低维音频分词器LoSATok,通过语义瓶颈压缩和双级语义监督,在紧凑潜空间中联合捕获语义和声学细节,提升扩散Transformer的生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27375 2026-05-28 cs.CL

LCO: LLM-based Constraint Optimization for Safer Agentic LLMs in Real-world Tasks

LCO:基于LLM的约束优化,用于现实任务中更安全的智能体LLM

Jiayong Wan, Jiawei Chen, Zhaoxia Yin, Liu Shuyuan, Hang Su

机构 * East China Normal University(东华大学) Beijing Zhongguancun Academy(北京中关村学院) Tsinghua University(清华大学)

AI总结 提出LCO框架,通过自思考模块和进化采样模块约束LLM行为,在不微调模型的情况下减少上下文奖励黑客行为,实验表明在输出优化和策略优化场景中显著提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23192 2026-05-28 cs.CV

Occlusion-Aware Physics-Semantic Keyframe Selection for Robust Video Editing

遮挡感知的物理-语义关键帧选择用于鲁棒视频编辑

Lin Liu, Zhihan Xiao, Haohang Xu, Rong Cong, Zhibo Zhang, Xiaopeng Zhang, Qi Tian

机构 * Huawei(华为) Tsinghua University(清华大学) East China Normal University(华东师范大学)

AI总结 提出一种遮挡感知的物理-语义关键帧选择框架,通过从结构完整性、跟踪稳定性和属性可见性三个角度评估候选帧,自动选择最优锚定帧,并利用双向跟踪生成时空掩码,实现鲁棒且时序一致的视频编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06025 2026-05-28 cs.CL cs.AI cs.LG

Learning Query-Aware Budget-Tier Routing for Runtime Agent Memory

学习面向运行时智能体记忆的查询感知预算层级路由

Haozhen Zhang, Haodong Yue, Tao Feng, Quanyu Long, Jianzhu Bao, Bowen Jin, Weizhi Zhang, Xiao Li, Jiaxuan You, Chengwei Qin, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois Chicago(伊利诺伊大学香槟分校) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

AI总结 提出 BudgetMem 框架,通过强化学习训练的轻量级路由器实现查询感知的预算层级路由,以在运行时平衡任务性能与记忆构建成本。

Comments Accepted by ICML 2026. Code is available at https://github.com/ViktorAxelsen/BudgetMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20150 2026-05-28 cs.CV cs.PF

TideGS: Scalable Training of Over One Billion 3D Gaussian Splatting Primitives via Out-of-Core Optimization

TideGS: 通过外存优化训练超过十亿个3D高斯溅射基元

Chonghao Zhong, Linfeng Shi, Hua Chen, Tiecheng Sun, Hao Zhao, Binhang Yuan, Chaojian Li

机构 * Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 针对大规模3D高斯溅射训练的内存瓶颈,提出TideGS外存训练框架,通过SSD-CPU-GPU层次化管理和三种协同技术,在单GPU上实现超过十亿高斯基元的训练并达到最优重建质量。

Comments Accepted to ICML 2026 as Spotlight. Website: https://sponge-lab.github.io/TideGS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19342 2026-05-28 cs.CV

Semantic-Enriched Latent Visual Reasoning

语义增强的潜在视觉推理

Tianrun Xu, Yue Sun, Qixun Wang, Jingyi Lu, Yuan Wang, Tianren Zhang, Longteng Guo, Fengyun Rao, Jing Lyu, Feng Chen, Jing Liu

机构 * Department of Automation, Tsinghua University, Beijing, China(清华大学自动化系) Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系) Zhongguancun Academy, Beijing, China(中关村学院) China Agricultural University, Beijing, China(中国农业大学) Peking University, Beijing, China(北京大学) Beijing Institute of Technology, Beijing, China(北京理工大学) Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院) WeChat Vision, Tencent Inc, Beijing, China(微信视觉,腾讯公司)

AI总结 提出两阶段学习框架SLVR,通过属性级语义监督和多查询组相对策略优化增强潜在表示的语义丰富性,提升潜在视觉推理的鲁棒性和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16030 2026-05-28 cs.LG cs.RO

Mind Dreamer: Untethering Imagination via Active Causal Intervention on Latent Manifolds

Mind Dreamer: 通过潜在流形上的主动因果干预释放想象力

Shaojun Xu, Xiaoling Zhou, Yihan Lin, Yapeng Meng, Xinglong Ji, Luping Shi, Rong Zhao

机构 * Center for Brain-Inspired Computing Research, Department of Precision Instrument, Tsinghua University, Beijing, China(脑启发计算研究中心,精密仪器系,清华大学,北京,中国) College of Computer Science and Technology, Zhejiang University, Hangzhou, China(计算机科学与技术学院,浙江大学,杭州,中国) Pen-Tung Sah Institute of Micro-Nano Science and Technology, Xiamen University, Xiamen, China(彭途萨微纳米科学与技术研究院,厦门大学,厦门,中国)

AI总结 针对基于模型的强化学习中历史束缚导致策略优化滞后的问题,提出Mind Dreamer框架,通过主动因果干预生成非连续潜在跳跃,并推导中继价值函数与中继不确定性函数,实现样本效率提升。

Comments 34 pages, 7 figures, ICML 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10325 2026-05-28 cs.AI

Verifiable Process Rewards for Agentic Reasoning

可验证过程奖励用于智能体推理

Huining Yuan, Zelai Xu, Huaijie Wang, Xiangmin Yi, Jiaxuan Gao, Xiao-Ping Zhang, Yu Wang, Chao Yu, Yi Wu

机构 * Tsinghua University(清华大学)

AI总结 提出可验证过程奖励(VPR)框架,通过符号或算法预言机将密集的中间步骤验证转化为强化学习的逐轮监督信号,解决长程智能体推理中的信用分配问题,并在搜索、约束和后验验证三种场景中验证其有效性。

Comments Corrected minor typos and LLM-assisted data extraction errors. The main conclusions are unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08758 2026-05-28 cs.RO cs.AI math.OC

Omni-scale Learning-based Sequential Decision Framework for Order Fulfillment of Tote-handling Robotic Systems

基于全尺度学习的料箱搬运机器人系统订单履行序贯决策框架

Jiaxin Liu, Peng Yang, Yuping Li, Xinyue Xie

机构 * Institution of Data and Information, Shenzhen International Graduate School, Tsinghua University, Nanshan District, Shenzhen 518055, China(数据与信息研究所,深圳国际研究生院,清华大学,南山区,深圳518055,中国)

AI总结 针对料箱搬运机器人系统的订单履行决策,提出一种结合结构化组合优化与多智能体强化学习的通用可扩展序贯决策框架OLSF-TRS,在小规模系统上平均最优性差距低于3.5%,在大规模场景中相比启发式基线减少8-12%的料箱移动,并保持实时响应。

Comments 35 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23472 2026-05-28 cs.AI

Escher-Loop: Mutual Evolution by Closed-Loop Self-Referential Optimization

Escher-Loop:通过闭环自我指涉优化的共同进化

Ziyang Liu, Xinyan Guo, Xuchen Wei, Han Hao, Liu Yang

机构 * Shenzhen X-Institute(深圳X研究所) Soochow University(苏州大学) Shenzhen Loop Area Institute(深圳河套学院) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

AI总结 提出Escher-Loop框架,通过任务代理和优化代理的闭环共同进化及动态基准机制,实现超越静态基线的持续性能提升。

Comments The first three authors contributed equally. Corresponding Authors: Han Hao, Liu Yang

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18235 2026-05-28 cs.CL cs.AI

Negative Advantages Is a Double-Edged Sword: Calibrating advantages in GRPO for Search Agents

负优势是一把双刃剑:为搜索智能体校准GRPO中的优势

Jiayi Wu, Ruobing Xie, Zeqian Huang, Lei Jiang, Can Xu, Kangyang Luo, Bochen Lin, Ming Gao, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(东华师范大学数据科学与工程学院) Tencent(腾讯) Tsinghua University(清华大学)

AI总结 针对GRPO算法在多跳搜索中因粗粒度优势分配和正负优势不平衡导致的训练不稳定问题,提出CalibAdv方法,通过细粒度降低过度负优势并重新平衡正负优势,提升模型性能和训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09258 2026-05-28 cs.LG

Nexus: Same Pretraining Loss, Better Downstream Generalization via Common Minima

Nexus: 相同预训练损失,通过公共极小值实现更好的下游泛化

Huanran Chen, Huaqing Zhang, Xiao Li, Yinpeng Dong, Ke Shen, Jun Zhu

机构 * Tsinghua University(清华大学)

AI总结 本文提出Nexus优化器,通过最大化梯度相似性促使不同数据源的损失函数极小值靠近,在保持相同预训练损失的情况下显著提升下游泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21309 2026-05-28 cs.LG

Transferable Graph Condensation from the Causal Perspective

从因果视角的可迁移图压缩

Huaming Du, Yijie Huang, Su Yao, Yiying Wang, Yueyang Zhou, Jingwen Yang, Jinshi Zhang, Han Ji, Yu Zhao, Guisong Liu, Hegui Zhang, Carl Yang, Gang Kou

机构 * Southwestern University of Finance and Economics(西南财经大学) Tsinghua University(清华大学) Ant Group(蚂蚁集团) Dongbei University of Finance and Economics(东北财经大学) Emory University(埃默里大学) Xiangjiang Laboratory(湘江实验室)

AI总结 提出基于因果不变性的可迁移图压缩方法TGCC,通过因果干预提取域不变特征并注入压缩图,实现跨任务和跨域场景下的有效压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01745 2026-05-28 cs.LG cs.AI

Probability-Entropy Calibration: An Elastic Indicator for Adaptive Fine-tuning

概率-熵校准:一种用于自适应微调的弹性指标

Wenhao Yu, Shaohang Wei, Jiahong Liu, Yifan Li, Minda Hu, Aiwei Liu, Hao Zhang, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Tsinghua University(清华大学) University of the Chinese Academy of Sciences(中国科学院大学)

AI总结 提出概率-熵校准信号(相对排名指标)进行token级重加权,以平衡预训练先验与下游对齐,在数学推理、分布外推理和代码生成任务上优于仅基于概率或熵的方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23074 2026-05-28 cs.LG cs.AI

Beyond Model Ranking: Predictability-Aligned Evaluation for Time Series Forecasting

超越模型排名:时间序列预测的可预测性对齐评估

Wanjin Feng, Yuan Yuan, Jingtao Ding, Yong Li

机构 * Department of Electronic Engineering, Tsinghua University, Beijing, China.(清华大学电子工程系,北京,中国)

AI总结 针对基准排行榜评估混淆模型性能与数据内在不可预测性的问题,提出基于谱相干的可预测性对齐诊断框架,包含SCP分数和LUR工具,揭示可预测性漂移和模型架构权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00814 2026-05-28 cs.CV

IRPO: Boosting Image Restoration via Post-training GRPO

IRPO:通过后训练GRPO提升图像恢复

Haoxuan Xu, Yi Liu, Tianfu Li, Ruolin Shen, Boyuan Jiang, Jinlong Peng, Donghao Luo, Xiaobin Hu, Shuicheng Yan, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学) Technical University of Munich(慕尼黑技术大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学)

AI总结 提出IRPO框架,利用GRPO后训练优化确定性恢复模型,通过数据筛选和复合奖励建模,在域内和域外任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10185 2026-05-28 cs.CL cs.AI cs.MA

Auditing medical multi-agent AI reveals risks of false consensus

审计医疗多智能体AI揭示虚假共识风险

Yinghao Zhu, Lei Gu, Zixiang Wang, Haoran Sang, Dehao Sui, Wen Tang, Lan Mi, Yasha Wang, Junyi Gao, Liang Yao, Tianfan Fu, Ewen Harrison, Lequan Yu, Liantao Ma

机构 * National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心) School of Computing and Data Science, The University of Hong Kong(香港大学计算机与数据科学学院) Department of Nephrology, Peking University Third Hospital(北京大学第三医院肾内科) Key Laboratory of Carcinogenesis and Translational Research (Ministry of Education), Department of Lymphoma, Peking University Cancer Hospital & Institute(教育部癌症发生与转化研究重点实验室、北京大学肿瘤医院淋巴瘤科) Department of Automation, Tsinghua University(清华大学自动化系) Centre for Medical Informatics, The University of Edinburgh(爱丁堡大学医学信息学中心) Health Data Research UK(英国健康数据研究机构) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科贤医学院) State Key Laboratory for Novel Software Technology, School of Computer Science, Nanjing University(南京大学新型软件技术国家重点实验室、计算机科学学院)

AI总结 本研究提出MedAgentAudit框架,通过专家验证的审计流程诊断医疗多智能体系统中的协作失败模式,发现虚假共识、权威偏差等系统性风险。

Comments Code and Data: https://github.com/MedX-PKU/MedAgentAudit

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04540 2026-05-28 cs.CV cs.AI

The Point, the Vision and the Text: Does Point Cloud Boost Spatial Reasoning of Large Language Models? A Bias-Controlled Study

点、视觉与文本:点云能否提升大语言模型的空间推理能力?一项偏差控制研究

Weichen Zhang, Ruiying Peng, Xin Zeng, Jianjie Fang, Ziyou Wang, Kaiyuan Li, Heng Dong, Wei Li, Chen Gao, Xin Wang, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学) ByteDance Seed(字节跳动种子)

AI总结 本文通过引入包含文本、视觉和点云模态的3D空间推理基准ScanReQA,评估不同模态下大语言模型的空间推理能力,发现点云和视觉模态的模型表现优于纯文本模型,并揭示了3D大语言模型中的注意力下沉现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04498 2026-05-28 cs.LG

AdaMemento: Adaptive Memory-Assisted Policy Optimization for Reinforcement Learning

AdaMemento: 自适应记忆辅助策略优化用于强化学习

Renye Yan, Yaozhong Gan, You Wu, Junliang Xing, Ling Liangn, Yeshang Zhu, Yimao Cai

机构 * Peking University(北京大学) Tsinghua University(清华大学)

AI总结 针对稀疏奖励强化学习问题,提出AdaMemento框架,通过记忆反思模块利用正负经验、细粒度内在动机引导探索以及集成学习自适应协调利用与探索,显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏