arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4536
2605.30062 2026-05-29 cs.CV

FakeVLM-R1: Internalizing Physical Laws via CoT for Synthetic Image Detection

FakeVLM-R1:通过思维链内化物理定律进行合成图像检测

Leqi Zhu, Junyan Ye, Kaiqing Lin, Zhiyuan Yan, Conghui He, Weijia Li

机构 * Shanghai AI Lab(上海人工智能实验室) Nanjing University(南京大学) Sun Yat-Sen University(中山大学) Shenzhen University(深圳大学) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 提出FakeVLM-R1框架,结合监督微调、组相对策略优化和批判性思维链机制,通过双向辩证推理和物理常识构建真实性反证,实现高精度、逻辑可解释的合成图像检测,解决现有方法的过度拒绝偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29960 2026-05-29 cs.CR cs.AI

Hijacking Agent Memory: Stealthy Trojan Attacks Through Conversational Interaction

劫持Agent记忆:通过对话交互的隐蔽木马攻击

Hongtao Wang, Se Yang, Yu Chen, Puzhuo Liu

机构 * North China Electric Power University(华北电力大学) Tencent(腾讯) Tsinghua University(清华大学)

AI总结 提出MemPoison攻击方法,通过语义关系桥、实体伪装和联合嵌入优化绕过选择性记忆机制,在LLM Agent长期记忆中注入触发器后门,实现高达0.95的攻击成功率。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29941 2026-05-29 cs.NI cs.LG

TraceCodec: A Compiler-Backed Neural Codec for Stateful Multi-Flow Network Traffic Traces

TraceCodec:一种基于编译器的有状态多流网络流量轨迹神经编解码器

Junhui Ding, Xinchen Zhang, Xiaohui Xie, Shinan Liu

机构 * Tsinghua University(清华大学) University of Hong Kong(香港大学)

AI总结 针对有状态多流网络流量轨迹的高保真生成问题,提出TraceCodec,通过将数据包解码为带时间戳的动作并学习连续潜在表示,再经确定性编译器还原为PCAP,实现精确的流量统计和TCP状态保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29935 2026-05-29 cs.CV cs.AI

CityGen: Structure-Guided City-Style Synthesis for Cross-City Autonomous Driving

CityGen: 结构引导的城市风格合成用于跨城市自动驾驶

Zezhong Qian, Zhao Yang, Lu Tan, Zhihao Yan, Weiyi Hong, Haizhuang Liu, Yawei Jueluo

机构 * Jiangsu Cytoderm Intelligent Technology Co., Ltd., China(江苏细胞膜智能科技有限公司,中国) Xi'an Jiaotong University, Xi'an, China(西安交通大学,中国) Tsinghua University, Beijing, China(清华大学,中国) University of Science and Technology of China, Hefei, China(中国科学技术大学,中国)

AI总结 提出CityGen,一种基于扩散模型的生成框架,通过高清地图条件和城市级视觉提示实现零标签城市适应,提升跨城市自动驾驶在感知、分割和规划任务上的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29711 2026-05-29 cs.CL cs.AI

Personalized Turn-Level User Conversation Satisfaction Benchmark

个性化轮级用户对话满意度基准

Zhefan Wang, Zhiqiang Guo, Weizhi Ma, Min Zhang, Quanjia Yan, Hengliang Luo

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China.(清华大学计算机科学与技术系,北京,中国) Institute for AI Industry Research, Tsinghua University, Beijing, China.(清华大学人工智能产业研究院,北京,中国) Meituan(美团)

AI总结 针对AI助手响应的个性化满意度评估问题,提出结合用户记忆与目标轮上下文的满意度评估器,并构建PersTurnBench基准,通过回放实现生成模型的受控比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29643 2026-05-29 cs.CV cs.MA

AgentCVR: Active Multi-Agent Cross-Video Reasoning via Script-Simulated Reinforcement Learning

AgentCVR:通过脚本模拟强化学习的主动多智能体跨视频推理

Yilun Qiu, Jiahe Wang, Cilin Yan, Jiayin Cai, Xiaolong Jiang, Yao Hu, Chun Yuan

机构 * Xiaohongshu Inc.(小红书公司) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院,清华大学)

AI总结 提出AgentCVR多智能体框架,将跨视频推理视为主动证据获取任务,通过主智能体协调视觉和音频智能体进行定向证据提取,并引入脚本模拟强化学习优化策略,在跨视频对齐和定位任务上超越单次基线,达到与闭源系统相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28711 2026-05-29 cs.LG

Stage-wise Distortion-Perception Traversal in Zero-shot Inverse Problems with Diffusion Models

基于扩散模型的零样本逆问题中的逐阶段失真-感知遍历

Jiawei Zhang, Ziyuan Liu, Leon Yan, Zhenyu Xiao, Yuantao Gu

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院) Department of Electronic Engineering, Tsinghua University , Beijing, China(清华大学电子工程系)

AI总结 提出一种逐阶段框架MAP-RPS,通过MAP估计和重噪声后验采样实现单扩散模型下的失真-感知权衡遍历,并扩展至潜空间LMAP-RPS以提升适用性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20752 2026-05-29 cs.RO

GaussianDream: A Feed-Forward 3D Gaussian World Model for Robotic Manipulation

GaussianDream:用于机器人操作的前馈3D高斯世界模型

Zijian Zhang, Yuqing Jiang, Qian Cheng, Xiaofan Li, Si Liu, Ding Zhao, Ping Luo, Weitao Zhou, Haibao Yu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

AI总结 提出GaussianDream,一种前馈3D高斯世界模型插件,通过可学习查询编码当前帧3D空间结构和短期未来演化,在训练时用静态重建和未来预测头监督,推理时仅保留查询条件化动作生成,在多个机器人操作基准上达到最先进性能。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13230 2026-05-29 cs.LG cs.AI

Teacher-Guided Policy Optimization for On-Policy Reasoning Distillation under Large Policy Divergence

教师引导的策略优化:大策略差异下的在线推理蒸馏

Xinyu Liu, Kechen Jiao, Chunyang Xiao, Runsong Zhao, Junhao Ruan, Bei Li, Jiahao Liu, Qifan Wang, Xin Chen, Jingang Wang, Chenglong Wang, Tong Xiao, JingBo Zhu

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Tsinghua University(清华大学) Meituan(美团) Meta AI NiuTrans Research, Shenyang, China(新译研究院,沈阳,中国)

AI总结 针对在线蒸馏中教师与学生策略差异大时反向KL监督失效的问题,提出教师引导策略优化(TGPO),通过教师直接指导学生上下文的token级生成并结合RLVR奖励,在推理基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02772 2026-05-29 cs.CV

Linearizing Vision Transformer with Test-Time Training

通过测试时训练线性化视觉Transformer

Yining Li, Dongchen Han, Zeyu Liu, Hanyi Wang, Yulin Wang, Gao Huang

机构 * Tsinghua University(清华大学)

AI总结 提出利用测试时训练(TTT)架构与Softmax注意力的结构对齐性,结合键实例归一化和局部性增强模块,实现从预训练Transformer到线性注意力模型的有效权重迁移,在Stable Diffusion 3.5上仅需1小时微调即可达到相近的图像生成质量并加速推理。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02288 2026-05-29 cs.CV

LabBuilder: Protocol-Grounded 3D Layout Generation for Interactable and Safe Laboratory

LabBuilder: 基于协议的可交互且安全的3D实验室布局生成

Jianbao Cao, Zhangrui Zhao, Bohan Feng, Zixuan Hu, Rui Li, Haiyuan Wan, Chenxi Li, Jingyuan Li, Wenzhe Cai, Lei Bai, Wanli Ouyang, Lingyu Duan, Di Huang, Minting Pan, Sha Zhang, Xinzhu Ma, Shixiang Tang, Dongzhan Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Wuhan University(武汉大学) Beihang University(北航) Peking University(北京大学) Tsinghua University(清华大学) Shanghai Jiaotong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出LabBuilder系统,通过协议引导和约束感知优化,从文本描述生成安全且可执行的3D实验室布局,显著优于现有方法。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10219 2026-05-29 cs.AI

Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models

认知支点与视觉锚定:揭示并纠正多模态推理模型中的幻觉

Zhe Qian, Yanbiao Ma, Zhuohan Ouyang, Zhonghua Wang, Zhongxing Xu, Fei Luo, Xinyu Liu, Zongyuan Ge, Yike Guo, Jungong Han

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 龙城人工智能学院) South China Agricultural University(华南农业大学) South China Normal University(华南师范大学) Monash University(莫纳什大学) Jishou University(吉首大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学)

AI总结 针对多模态大推理模型在长链推理中易产生幻觉的问题,提出V-STAR训练范式,通过分层视觉注意力奖励和强制反思机制,将视觉锚定引入推理过程以减轻幻觉。

Comments TPAMI under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18527 2026-05-29 cs.CV cs.AI cs.SD

JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments

JAEGER:模拟物理环境中的联合3D音频-视觉定位与推理

Zhan Liu, Changli Tang, Yuxin Wang, Zhiyuan Zhu, Youjun Chen, Yiwen Shao, Tianzi Wang, Lei Ke, Zengrui Jin, Chao Zhang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Tencent AI Lab(腾讯AI实验室)

AI总结 提出JAEGER框架,通过集成RGB-D观测和多通道一阶环境声学,将音频-视觉大语言模型扩展到3D空间,实现联合空间定位与推理,并引入神经强度向量(Neural IV)提升声源方向估计的鲁棒性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14754 2026-05-29 cs.SE cs.AI cs.CL

Revisiting the Reliability of Language Models in Instruction-Following

重新审视指令跟随中语言模型的可靠性

Jianshuo Dong, Yutong Zhang, Yan Liu, Zhenyu Zhong, Tao Wei, Chao Zhang, Han Qiu

机构 * Tsinghua University(清华大学) Ant Group(蚂蚁集团)

AI总结 本文提出可靠@k指标和自动生成相似提示的流水线,构建IFEval++基准,发现当前模型在细微差异提示下性能下降高达61.8%,并探索了三种改进方法。

Comments ACL 2026 main oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16077 2026-05-29 cs.PL cs.LG

CompilerDream: Learning a Compiler World Model for General Code Optimization

CompilerDream: 学习编译器世界模型以实现通用代码优化

Chaoyi Deng, Jialong Wu, Ningya Feng, Jianmin Wang, Mingsheng Long

机构 * School of Software, BNRist Tsinghua University Beijing China(软件学院、北师大清华大学北京中国) Tsinghua University(清华大学)

AI总结 提出基于模型的强化学习方法CompilerDream,通过编译器世界模型模拟优化pass属性并训练智能体,实现跨应用场景和语言的通用代码优化,在零样本泛化上超越LLVM内置优化。

Comments KDD 2025 camera-ready version with extended appendix. Code is available at https://github.com/thuml/CompilerDream. This update additionally fixes an issue in Table 6 where the dataset names in three rows were ordered incorrectly

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29495 2026-05-29 cs.LG

On-Policy Replay for Continual Supervised Fine-Tuning

面向持续监督微调的在策略重放

Yan Chen, Taojie Zhu, Meng Zhang, Xin Chen, Jiaqi Huang, Dongyang Xu, Yizhi Wang

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团)

AI总结 提出在策略重放(OPR)方法,通过重放模型自身生成的高质量响应来缓解持续监督微调中的灾难性遗忘,在多个大语言模型上显著降低遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29438 2026-05-29 cs.RO

ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models

ElegantVLA:学习何时思考以实现高效的视觉-语言-动作模型

Ye Li, Huanan Liu, Kangye Ji, Yuan Meng, Jiajun Fan, Yuansong Wang, Shiyu Qin, Chenglei Wu, Shu-Tao Xia, Zhi Wang

机构 * Tsinghua University(清华大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 提出ElegantVLA,一种即插即用的相位自适应推理框架,通过动态计算调度在视觉编码器、大语言模型和动作头之间分配计算资源,实现VLA模型加速,在GR00T和CogACT上分别获得最高2.55倍和3.77倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29188 2026-05-29 cs.CL

Slogans or Stance? A Label-Light Diagnostic for Entrepreneurial-Discourse Measurement on Chinese SOE Speeches

口号还是立场?一种用于中国国企演讲中创业话语测量的轻标签诊断方法

Ting Gong, Shangquan Sun

机构 * Tsinghua University(清华大学)

AI总结 本文提出一种轻标签诊断方法,利用同一企业不同演讲者的自然实验,评估词典方法、主题模型和嵌入相似度评分器在测量中国国企演讲中“创业精神”时的有效性,发现零样本大语言模型(Qwen3.5:9b)在区分演讲者身份方面表现最佳。

Comments 15 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29004 2026-05-29 cs.CV cs.GR

Auditing Training-Free 3D Shape Retrieval with Diffused Geodesic Moments

审计基于扩散测地矩的无训练三维形状检索

Zhicheng Du, Changyue Liu, Wenji Xi, Zhaotian Xie, Zhuo Deng, Ziheng Zhang, Yang Liu, Lan Ma

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Guangzhou International Economics College(广州国际经济学院) School of Electrical and Electronic Engineering, The University of Sheffield(谢菲尔德大学电子与电气工程学院)

AI总结 本文提出扩散测地矩(DGM)作为无训练形状描述符,通过协议审计方法隔离评估局部信号设计、归一化、聚合、码本拟合和度量选择等组件的影响,并在FAUST-Reg和TOSCA数据集上验证了协议主导性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26029 2026-05-29 cs.AI cs.CL

CausaLab: A Scalable Environment for Interactive Causal Discovery Toward AI Scientists

CausaLab:面向AI科学家的交互式因果发现可扩展环境

Junlin Yang, Dylan Zhang, Xiangchen Song, Qirun Dai, Xiao Liu, Yuen Chen, Aniket Vashishtha, Jing Shi, Chenhao Tan, Hao Peng

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学) University of Chicago(芝加哥大学) Adobe

AI总结 提出CausaLab环境,通过合成实验室任务评估LLM代理在因果发现中的预测准确性与因果机制恢复能力,发现两者存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16673 2026-05-29 cs.RO cs.AI cs.LG

When Should a Robot Think? Resource-Aware Reasoning via Reinforcement Learning for Embodied Robotic Decision-Making

机器人何时应该思考?基于强化学习的资源感知推理在具身机器人决策中的应用

Jun Liu, Pu Zhao, Zhenglun Kong, Xuan Shen, Peiyan Dong, Fan Yang, Lin Cui, Hao Tang, Geng Yuan, Wei Niu, Wenbin Zhang, Xue Lin, Gaowen Liu, Yanzhi Wang, Dong Huang

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Northeastern University(东北大学) Harvard University(哈佛大学) Cornell University(康奈尔大学) MIT(麻省理工学院) Fujitsu Research of America(美国富士通研究) Tsinghua University(清华大学) Peking University(北京大学) University of Georgia(佐治亚大学) Florida International University(佛罗里达国际大学) EmbodyX Inc(EmbodyX公司) Cisco Systems(思科系统)

AI总结 提出RARRL框架,通过强化学习学习高层编排策略,使具身代理能自适应决定是否调用LLM推理、选择推理角色及分配计算预算,以平衡推理开销与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05370 2026-05-29 cs.CL

Mining or Synthesis? Rethinking Exploration Efficiency in Iterative Alignment of Mathematical Reasoning

挖掘还是合成?重新思考数学推理迭代对齐中的探索效率

Jun Rao, Zixiong Yu, Xuebo Liu, Guhan Chen, Jing Li, Hejin Wang, Jiansheng Wei, Xiaojun Meng, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) Huawei Large Model Data Technology Lab(华为大模型数据技术实验室) Huawei Multimodal Model Lab(华为多模态模型实验室) Department of Statistics and Data Science, Tsinghua University, Beijing, China(清华大学统计与数据科学系)

AI总结 针对数学推理任务中迭代DPO对齐时高N采样收益递减且引入噪声的问题,提出PACE框架,通过低预算探索与纠错合成偏好对,以约1/5计算量达到或超越高N基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14365 2026-05-29 cs.CL

Understanding the Ability of LLMs to Handle Character-Level Perturbation

理解LLMs处理字符级扰动的能力

Anyuan Zhuo, Xuefei Ning, Ningyuan Li, Jingyi Zhu, Yu Wang, Pinyan Lu

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,Location,Country) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,Location,Country) Shanghai University of Finance(上海财经大学) Tsinghua University, China(清华大学,中国)

AI总结 本研究通过三种字符级扰动(单词内大量拼写错误、字符乱序、插入不可见字符)测试大型语言模型的鲁棒性,发现即使严重扰动下模型仍保持显著性能,并探索了其内在机制。

Comments Accepted by icml2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09574 2026-05-29 cs.CV cs.AI cs.CL

MENTOR: Efficient Multimodal-Conditioned Tuning for Autoregressive Vision Generation Models

MENTOR: 面向自回归视觉生成模型的高效多模态条件微调

Haozhe Zhao, Zefan Cai, Shuzheng Si, Liang Chen, Jiuxiang Gu, Wen Xiao, Minjia Zhang, Junjie Hu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Tsinghua University(清华大学) Peking University(北京大学) Microsoft(微软公司)

AI总结 提出MENTOR框架,通过两阶段训练范式实现自回归图像生成器与多模态输入的细粒度token级对齐,无需辅助适配器或交叉注意力模块,在DreamBench++上取得优异性能。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14279 2026-05-29 cs.CV cs.CL

Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance

超越文本:通过多模态双注意力和软图像引导减少大型视觉语言模型中的语言偏差

Haozhe Zhao, Shuzheng Si, Liang Chen, Yichi Zhang, Maosong Sun, Mingjia Zhang, Baobao Chang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 针对大型视觉语言模型因语言偏差导致的幻觉问题,提出LACING框架,采用多模态双注意力机制和软图像引导策略,在不增加训练资源的情况下增强视觉理解并减少幻觉。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00278 2026-05-29 cs.LG

KAN-AD: Time Series Anomaly Detection with Kolmogorov-Arnold Networks

KAN-AD:基于Kolmogorov-Arnold网络的时间序列异常检测

Quan Zhou, Changhua Pei, Fei Sun, Jing Han, Zhengwei Gao, Dan Pei, Haiming Zhang, Gaogang Xie, Jianhui Li

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of the Chinese Academy of Sciences(中国科学院大学) Hangzhou Institute for Advanced Study, University of the Chinese Academy of Sciences(中国科学院大学杭州高等研究 institute) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Frontier Sciences, Nanjing University(南京大学前沿科学学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 针对时间序列异常检测中预测模型易过拟合局部波动的问题,提出用截断傅里叶展开替代B样条的KAN-AD方法,通过强调全局模式并抵抗局部扰动,在四个基准上平均检测精度提升15%。

Comments 11 pages, ICML 2025

Journal ref Proceedings of the 42nd International Conference on Machine Learning, PMLR 267:79136-79149, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10398 2026-05-29 cs.CE cs.AI

Are LLMs Socially Adaptive? Contrasting Belief Evolution in Large Language Models and Humans

大型语言模型是否具有社会适应性?对比大型语言模型与人类的信念演化

Yu Lei, Hao Liu, Chengxing Xie, Songjia Liu, Zhiyu Yin, Canyu Chen, Guohao Li, Philip Torr, Zhen Wu

机构 * Tsinghua University(清华大学) Department of Psychological and Cognitive Sciences(心理与认知科学系) College AI(人工智能学院) School of Management(管理学院) Fudan University(复旦大学) Stevens Institute of Technology(史蒂文斯理工学院) Northwestern University(西北大学) University of Oxford(牛津大学)

AI总结 本研究提出基于社会心理学的仿真基准FairMindSim和信念-奖励对齐行为演化模型BREM,通过连续经济游戏对比人类与LLM的决策动态,发现中等能力模型表现出过度惩罚的刚性攻击性,而前沿模型随推理能力提升趋向人类式的克制与宽容。

Comments KDD 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28816 2026-05-28 cs.CV

Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players

Gamma-World: 超越双玩家的生成式多智能体世界建模

Fangfu Liu, Kai He, Tianchang Shen, Tianshi Cao, Sanja Fidler, Yueqi Duan, Jun Gao, Igor Gilitschenski, Zian Wang, Xuanchi Ren

机构 * NVIDIA Tsinghua University(清华大学) University of Toronto(多伦多大学) Vector Institute(向量研究所)

AI总结 提出一种生成式多智能体世界模型,通过Simplex Rotary Agent Encoding实现智能体置换等价性,并采用Sparse Hub Attention降低跨智能体注意力成本,支持多玩家交互视频生成。

Comments Project Page: https://research.nvidia.com/labs/sil/projects/gamma-world

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28805 2026-05-28 cs.CL cs.AI cs.CV cs.LG

OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration

OmniVerifier-M1: 具有显式结构化重校准的多模态元验证器

Xinchen Zhang, Bowei Liu, Jiale Liu, Chufan Shi, Yizhen Zhang, Junhong Liu, Youliang Zhang, Zhiheng Li, Yujiu Yang, Ling Yang

机构 * Tsinghua University(清华大学) Pennsylvania State University(宾夕法尼亚州立大学) University of Southern California(南加州大学) Microcyto Princeton University(普林斯顿大学)

AI总结 提出OmniVerifier-M1,通过符号化元验证(如边界框)和解耦强化学习,实现多模态大模型的可靠细粒度验证与动态区域级自校正。

Comments ICML 2026. Project: https://github.com/Cominclip/OmniVerifier

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28791 2026-05-28 cs.CL cs.AI

Skill-Conditioned Gated Self-Distillation for LLM Reasoning

技能条件门控自蒸馏用于大语言模型推理

Jiazhen Huang, Xiao Chen, Xiao Luo, Yong Dai, Senkang Hu, Yuzhi Zhao

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) City University of Hong Kong(香港城市大学) Huazhong University of Science and Technology(华中科技大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 提出技能条件门控自蒸馏(SGSD),通过从经验技能库中检索技能-错误对构建多教师池,并利用验证器验证教师极性,以鲁棒门控目标蒸馏信息性师生差异,在弱先验信息假设下提升数学推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏