arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4536
2605.18309 2026-05-19 cs.LG cs.AI

Alignment Dynamics in LLM Fine-Tuning

在LLM微调中的对齐动力学

Yuhan Huang, Huanran Chen, Yinpeng Dong

机构 * Shanghai Qi Zhi Institue & University of Tokyo(上海启智研究院 & 东京大学) College of AI, Tsinghua University(清华大学人工智能学院)

AI总结 本文研究了在LLM微调过程中对齐的动态特性,提出了一种可计算的对齐评分,并推导了其在微调过程中的闭式更新公式,从而建立了对齐动态的统一框架。通过将对齐更新分解为两种竞争成分:反弹力和驱动力,解释了为何先前的对齐可能被后续微调逆转,以及为何更狭窄的后验结构会增强这种逆转。此外,该框架预测了‘复习强化效应’,即先前的对齐会在重新暴露时留下潜在的后验印记,从而增强驱动力,导致更快的重新对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18287 2026-05-19 cs.CV cs.RO

StableVLA: Towards Robust Vision-Language-Action Models without Extra Data

StableVLA: 向无额外数据的鲁棒视觉-语言-动作模型迈进

Yiyang Fu, Chubin Zhang, Shukai Gong, Yufan Deng, Kaiwei Sun, Qiyang Min, Qibin Hou, Yansong Tang, Jianan Wang, Daquan Zhou

机构 * Peking University(北京大学) Tsinghua University(清华大学) Nanjing University(南京大学) Nankai University(南开大学)

AI总结 本文研究了在未见真实世界视觉扰动下视觉-语言-动作(VLA)模型的鲁棒性问题,提出了一种基于信息理论的轻量级适配模块IB-Adapter,有效提升模型性能,同时保持高效和效果。

Comments Accepted by ICML 2026. Code: https://github.com/DAGroup-PKU/HumanNet. Project website: https://dagroup-pku.github.io/StableVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18191 2026-05-19 cs.AI

Pairwise Preference Reward and Group-Based Diversity Enhancement for Superior Open-Ended Generation

成对偏好奖励与基于群体的多样性增强以实现更优的开放生成

Guining Cao, Jiaxin Peng, Chu Zeng, Yu Zhao, Shuangyong Song, Yongxiang

机构 * Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰AGI实验室,中国电信人工智能技术(北京)有限公司) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Tsinghua University(清华大学)

AI总结 本文提出了一种适用于开放生成任务的强化学习方法PPR-GDE,通过成对偏好奖励和基于群体的多样性增强,解决了传统方法在开放生成任务中存在验证困难、计算成本高以及多样性下降的问题。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18165 2026-05-19 cs.LG

Elastic-dLLM: Position Preserving Context Compression and Augmentation of Diffusion LLMs

Elastic-dLLM: Diffusion LLMs的弹性上下文压缩与增强

Junyi Wu, Tianchen Zhao, Shaoqiu Zhang, Linfeng Zhang, Guohao Dai, Yu Wang

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Infinigence AI

AI总结 本文针对扩散大语言模型中上下文压缩和增强问题,提出了一种位置保持的上下文压缩和终端感知增强方法,以提高解码效率并实现长上下文扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18652 2026-05-19 cs.CR cs.AI

From Craft to Kernel: A Governance-First Execution Architecture and Semantic ISA for Agentic Computers

从手工到内核:一种以治理为导向的执行架构和语义ISA用于代理计算机

Xiangyu Wen, Yuang Zhao, Xiaoyu Xu, Lingjun Chen, Changran Xu, Shu Chi, Jianrong Ding, Zeju Li, Haomin Li, Li Jiang, Fangxin Liu, Qiang Xu

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文提出了一种以治理为导向的执行架构和语义指令集架构(ISA),旨在解决代理计算机中AI从脆弱原型到生产系统的过渡问题,通过引入概率处理单元和确定性神经符号内核,提升系统的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06809 2026-05-19 cs.CV

VA-Adapter: Adapting Ultrasound Foundation Model to Echocardiography Probe Guidance

VA-Adapter:将超声基础模型适应于超声心动图探头引导

Teng Wang, Haojun Jiang, Yuxuan Wang, Zhenguo Sun, Yujiao Deng, Shiji Song, Gao Huang

机构 * Department of Automation, BNRist, Tsinghua University, Beijing, China(自动化系、BNRist、清华大学、北京、中国) School of Computer Science and Technology, Xidian University(计算机科学与技术学院、西安电子科技大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Chinese PLA General Hospital(中国人民解放军总医院)

AI总结 本文提出VA-Adapter,通过将超声基础模型与理解个体三维结构的能力相结合,提高超声心动图探头引导的精度和效率,实验表明其在参数量较少的情况下表现优于现有模型。

Comments MICCAI2026 Early Accept Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18109 2026-05-19 cs.AI cs.CV cs.RO

TaskGround: Structured Executable Task Inference for Full-Scene Household Reasoning

TaskGround:全场景家庭推理的结构化可执行任务推断

ZhiYuan Feng, Yu Deng, Ruichuan An, Zhenhua Liu, Qixiu Li, Keming Wu, Zhiying Du, Weijie Wang, Haoxiao Wang, Shuang Chen, Sicheng Xu, Yaobo Liang, Jiaolong Yang, Baining Guo

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) Fudan University(复旦大学) Zhejiang University(浙江大学)

AI总结 本文提出TaskGround框架,通过结构化任务推断提升全场景家庭推理能力,其核心贡献是引入FullHome评估套件,验证了在家庭场景中执行任务结构推断的重要性,并展示了紧凑本地模型在实际家庭部署中的有效性。

Comments Project page: https://aaronfengzy.github.io/TaskGround/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18074 2026-05-19 cs.RO

4DLidarOpen: An Open 4D FMCW Lidar Dataset for Motion-Aware Autonomous Driving

4DLidarOpen: 一个用于运动感知自动驾驶的开放4D FMCW激光雷达数据集

Kane Qian, Xin Zhao, Yining Shi, Rujun Yan, Zhengqing Pan, Kaojin Zhu, Mengmeng Yang, Kai Sun, Diange Yang, Kun Jiang

机构 * Tsinghua University(清华大学) Hesai Technology Co., Ltd.(海思科技有限公司)

AI总结 本文提出4DLidarOpen数据集,用于自动驾驶,该数据集基于4D频率调制连续波(FMCW)激光雷达传感,包含点径向速度测量、多种激光雷达、环绕摄像头和6自由度车辆姿态数据,通过混合标注策略实现大规模训练和人工精修,用于3D目标检测、鸟瞰图分割和流预测及运动预测基准测试。

Comments 15pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17978 2026-05-19 cs.CL

AutoVecCoder: Teaching LLMs to Generate Explicitly Vectorized Code

AutoVecCoder: 教授大语言模型生成显式向量化代码

Shangzhan Li, Xinyu Yin, Xuanyu Jin, Ye He, Yuxin Zhou, Yuxuan Li, Xu Han, Wanxiang Che, Qi Shi, Ting Liu, Maosong Sun

机构 * Harbin Institute of Technology(哈尔滨工业大学) Xiamen University(厦门大学) Tsinghua University(清华大学)

AI总结 本文提出AutoVecCoder框架,通过VecPrompt和VecRL组件,使大语言模型能够自动进行显式向量化,从而在SimdBench的SSE和AVX子集上达到最先进的性能,超越传统自动向量化的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17923 2026-05-19 cs.DC cs.AI cs.LG

AdaptiveLoad: Towards Efficient Video Diffusion Transformer Training

AdaptiveLoad: 向高效视频扩散变换器训练迈进

Yucheng Guo, Yongjian Guo, Zhong Guan, Haoran Sun, Wen Huang, Wanting Xu, Jing Long, Shuai Di, Junwu Xiong

机构 * Tsinghua University(清华大学) Peking University(北京大学) Tianjin University(天津大学)

AI总结 本文提出AdaptiveLoad框架,通过双约束自适应负载平衡系统和融合LayerNorm-Modulate CUDA内核,解决视频生成模型中大规模视频扩散变换器(如DiT和MMDiT)训练中的计算不平衡问题,实验显示其在Wan 2.1世界模型上提升了计算效率和训练吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17912 2026-05-19 cs.RO cs.CV

WorldArena 2.0: Extending Embodied World Model Benchmarking on Modality, Functionality and Platform

WorldArena 2.0: 扩展模态、功能和平台的具身世界模型基准测试

Yu Shang, Yinzhou Tang, Yiding Ma, Zhuohang Li, Lei Jin, Weikang Su, Xin Jin, Zhaolu Wang, Ziyou Wang, Xin Zhang, Haisheng Su, Weizhen He, Wei Wu, Haoyi Duan, Gordon Wetzstein, Xihui Liu, Dhruv Shah, Zhaoxiang Zhang, Zhibo Chen, Jun Zhu, Yonghong Tian, Tat-Seng Chua, Wenwu Zhu, Chen Gao, Yong Li

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Stanford University(斯坦福大学) The University of Hong Kong(香港大学) Princeton University(普林斯顿大学) Chinese Academy of Sciences(中国科学院) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出WorldArena 2.0,扩展了具身世界模型的评估,涵盖模态、功能和平台三个维度,提供全面的测试平台以评估具身世界模型的进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17583 2026-05-19 cs.CV

AgentSteerTTS: A Multi-Agent Closed-Loop Framework for Composite-Instruction Text-to-Speech

AgentSteerTTS: 一个用于复合指令文本到语音的多智能体闭环框架

Bin Kang, Shaoguo Wen, Yang Fan, Shunlong Wu, Junjie Wang, Yulin Li, Junzhi Zhao, Junle Wang, Zhuotao Tian

机构 * University of Chinese Academy of Sciences(中国科学院大学) Shenzhen Loop Area Institute(深圳河套学院) Tencent Turinglab(腾讯人工智能实验室) Tsinghua University(清华大学) Southwest Jiaotong University(西南交通大学)

AI总结 本文提出AgentSteerTTS,一个多智能体闭环框架,通过引入对抗解耦代理、双流锚定控制器和快速-慢反馈代理,实现了对复合指令的意图忠实表达控制,实验表明其在复合指令基准和公开测试集上显著提升了性能。

Comments Project page: https://kane2kang.github.io/AgentSteerTTS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17580 2026-05-19 cs.AI

ECG-WM: A Physiology-Informed ECG World Model for Clinical Intervention Simulation

ECG-WM: 一种基于生理的ECG世界模型用于临床干预模拟

Zhikang Chen, Yue Wang, Sen Cui, Yu Zhang, Changshui Zhang, Tianling Ren, Tingting Zhu

机构 * University of Oxford(牛津大学) Tsinghua University(清华大学) Southern University of Science and Technology(南方科技大学)

AI总结 本文提出了一种基于ECG的世界模型,用于条件化预测心脏电生理学,通过整合生理学普通微分方程先验知识,提升干预后ECG轨迹的生理合理性,并引入不确定性评估策略以更可靠地评估候选干预方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17575 2026-05-19 cs.LG cs.AI

UniAlign: A Model-Agnostic Framework for Robust Network Traffic Classification under Distribution Shifts

UniAlign:一种用于在分布偏移下鲁棒网络流量分类的模型无关框架

Tongze Wang, Xiaohui Xie, Wenduo Wang, Chuyi Wang, Yong Cui

机构 * Institute for Network Sciences and Cyberspace, Tsinghua University(网络科学与网络空间研究院,清华大学) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

AI总结 本文提出UniAlign,一种模型无关的框架,通过领域对齐微调和稳定模型集成提升深度学习网络流量分类模型在分布偏移下的鲁棒性,实验表明其在准确率和F1分数上均优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17497 2026-05-19 cs.LG

Self-Supervised On-Policy Distillation for Reasoning Language Models

自监督在线策略蒸馏用于推理语言模型

Zhiquan Tan, Yinrong Hong

机构 * Tsinghua University(清华大学) Beihang University(北航大学)

AI总结 本文提出自监督在线策略蒸馏(SSOPD)方法,通过对比正确与错误的完成过程信号,提升推理语言模型的表现,实验表明在多个基准测试中优于GRPO和OPSD基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17447 2026-05-19 cs.CV cs.CL

FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing

FastOCR: 通过KV缓存剪枝实现高效的动态视觉聚焦文档解析

Zihan Tang, Leqi Shen, Hui Chen, Ao Wang, Ben Wan, Yan Feng, Ke Zhang, Sicheng Zhao, Tongxuan Liu, Guiguang Ding

机构 * Tsinghua University(清华大学)

AI总结 本文提出FastOCR,一种无需训练的框架,通过动态视觉聚焦技术解决文档解析中的高效KV缓存剪枝问题,显著提升处理速度和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15735 2026-05-19 cs.CV cs.AI

UAM: A Dual-Stream Perspective on Forgetting in VLA Training

UAM:VL A训练中遗忘的双流视角

Jianke Zhang, Yuanfei Luo, Yucheng Hu, Xiaoyu Chen, Yanjiang Guo, Ziyang Liu, Hongbin Xu, Tian Lan, Jianyu Chen

机构 * Tsinghua University(清华大学)

AI总结 本文提出UAM模型,通过双流架构解决VL A训练中因单一编码器导致的多模态能力下降问题,展示了通过架构分离而非冻结权重或辅助数据可实现语义保留,并在多种任务中取得高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14005 2026-05-19 cs.CL cs.LG

Mistletoe: Stealthy Acceleration-Collapse Attacks on Speculative Decoding

毒藤:针对推测解码的隐秘加速-崩溃攻击

Shuoyang Sun, Chang Dai, Hao Fang, Kuofeng Gao, Xinhao Zhong, Yi Sun, Fan Mo, Shu-Tao Xia, Bin Chen

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) South China University of Technology(华南理工大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Huawei Technology(华为技术)

AI总结 本文提出Mistletoe攻击,通过优化降质目标和语义保留目标,隐秘地降低推测解码的接受长度τ,从而减少加速效果,同时保持输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07111 2026-05-19 cs.CL cs.AI

Beyond LoRA vs. Full Fine-Tuning: Gradient-Guided Optimizer Routing for LLM Adaptation

超越LoRA与全微调:基于梯度的优化器路由用于大语言模型适应

Haozhan Tang, Xiuqi Zhu, Xinyin Zhang, Boxun Li, Virginia Smith, Kevin Kuo

机构 * Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学) Infinigence AI

AI总结 本文提出了一种混合LoRA和全微调(MoLF)框架,通过在优化器层面动态路由更新,实现两种训练模式之间的连续导航,从而提升大语言模型的适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25723 2026-05-19 cs.CL cs.AI

Natural-Language Agent Harnesses

自然语言代理Harness

Linyue Pan, Lexiao Zou, Shuo Guo, Jingchen Ni, Hai-Tao Zheng

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 本文提出自然语言代理Harness(NLAH)作为一种可执行的自然语言对象,用于描述任务运行的Harness策略,并引入Intelligent Harness Runtime(IHR)作为共享运行时,能够将这些文档解释为代理调用、交接、状态更新、验证门和成果合同。实验表明,NLAH在编码、终端使用和计算机使用基准测试中表现与代码和提示实现相当,同时暴露了更短的静态Harness策略。

Comments revise paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00607 2026-05-19 cs.CV cs.AI

IdGlow: Dynamic Identity Modulation for Multi-Subject Generation

IdGlow: 多主体生成中的动态身份调节

Honghao Cai, Xiangyuan Wang, Jing Li, Yunhao Bai, Tianze Zhou, Haohua Chen, Chao Hui, Changhao Qiao, Runqi Wang, Sijie Xu, Yuyang Hao, Zezhou Cui, Yuyuan Yang, Wei Zhu, Yibo Chen, Xu Tang, Yao Hu, Zhen Li

机构 * Xiaohongshu Inc.(小红书公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文提出IdGlow框架,通过任务自适应的时间步调度和视觉语言模型解决多主体生成中的稳定性与可塑性矛盾,提升面部真实感与商业级美学质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23253 2026-05-19 cs.AI

AgroCoT: A Chain-of-Thought Benchmark for Evaluating Reasoning in Vision-Language Models for Agriculture

AgroCoT:用于评估农业中视觉语言模型推理能力的推理链基准

Yibin Wen, Qingmei Li, Zi Ye, Jiarui Zhang, Xiaoya Fan, Zurong Mai, Jing Wu, Shuohong Lou, Yuhang Chen, Henglian Huang, Yang Zhang, Defeng Gu, Lingyuan Zhao, Yutong Lu, Haohuan Fu, Jianxi Huang, Juepeng Zheng

机构 * Sun Yat-sen University(中山大学) Tsinghua University(清华大学) Southwest University(西南大学) HuanTian Wisdom Technology Co., Ltd.(慧天智慧科技有限公司) China Agricultural University(中国农业大学) Southwest Jiaotong University(西南交通大学) National Supercomputing Center in Shenzhen(深圳国家超算中心)

AI总结 本文提出AgroCoT基准,通过整合推理链(CoT)方法,评估视觉语言模型在农业复杂场景中的推理和问题解决能力,发现现有模型在推理能力上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14466 2026-05-19 cs.CL cs.AI

Toward Robust Multilingual Adaptation of LLMs for Low-Resource Languages

迈向低资源语言LLM鲁棒多语言适应

Haolin Li, Haipeng Zhang, Mang Li, Yaohua Wang, Lijie Wen, Yu Zhang, Biqing Huang

机构 * Department of Automation, Tsinghua University, Beijing, China(清华大学自动化系) Alibaba International Digital Commerce Group, Beijing, China(阿里巴巴国际数字 commerce 集团) School of Software, Tsinghua University, Beijing, China(清华大学软件学院)

AI总结 本文提出LiRA框架,通过轻量级微调实现低资源语言LLM的鲁棒多语言适应,结合Arca和LaSR组件提升跨语言语义一致性与表示稳定性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17300 2026-05-19 cs.RO

HCLM: A Hierarchical Framework for Cooperative Loco-Manipulation with Dual Quadrupeds

HCLM:一种用于双四足机器人协同运动操作的分层框架

Qixuan Li, Chen Le, Jincheng Yu, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(深圳国际研究生院,清华大学,深圳,中国) Department of Electronic Engineering, and the Institute for Embodied Intelligence and Robotics, Tsinghua University, Beijing, China(电子工程系,以及 embodied intelligence and robotics 院,清华大学,北京,中国)

AI总结 本文提出HCLM框架,通过分层结构实现双四足机器人在复杂环境中的协同运动操作,核心方法是采用集中式联合扩散策略和混合全身控制器,主要贡献是实现了高鲁棒性的多机器人协作控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17291 2026-05-19 cs.LG

Step-wise Rubric Rewards for LLM Reasoning

分步评分奖励用于大语言模型推理

Weichu Xie, Haozhe Zhao, Wenpu Liu, Yongfu Zhu, Liang Chen, Minghao Ye, Zirong Chen, Yuqi Xu, Shuai Dong, Ziyue Wang, Xinbo Xu, Kean Shi, Ruoyu Wu, Xiaoying Zhang, Wenqi Shao, Baobao Chang, Nan Duan, Jiaqi Wang

机构 * Peking University(北京大学) JD Explore Academy(京东探索学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出一种分步评分奖励方法,通过引入LLM判官对每个评分项进行归因,规范化每步评分,并结合优势估计器提高推理准确性和减少自我纠正循环。

Comments Code available at https://github.com/akarinmoe/SRaR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17262 2026-05-19 cs.CV

EgoIntrospect: An Egocentric Dataset and Benchmark for User-Centric Internal State Reasoning

EgoIntrospect: 一个用于用户中心内部状态推理的注视数据集和基准

Zeyu Wang, Chang Liu, Eduardus Tjitrahardja, Yuntao Wang, Borislav Pavlov, Fangfei Gou, Jose Manuel Davila, Dai Shi, Ran Xu, Yue Pan, Jiayi Tan, Shuting Chang, Qi Wang, Jinzhao Li, Jiacheng Hua, Yifei Huang, Jingwei Sun, Yu Zhang, Liuxin Zhang, Guocai Yao, Jia Jia, Yin Li, Qianying Wang, Yuanchun Shi, Miao Liu

机构 * Tsinghua University(清华大学) Tongji University(同济大学) Renmin University of China(中国人民大学) The University of Tokyo(东京大学) Lenovo Group(联想集团) Peking University(北京大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Shanghai Qi Zhi Institute(上海启智研究院)

AI总结 本文提出EgoIntrospect数据集,用于研究用户中心内部状态推理,通过自注释揭示用户与AI助手的交互意图,评估多模态大语言模型在从注视观察中推理用户内部状态的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17238 2026-05-19 cs.LG stat.ML

Learning in Position-Aware Multinomial Logit Bandits: From Multiplicative to General Position Effects

基于位置感知的多项逻辑带宽学习:从乘法位置效应到一般位置效应

Xi Chen, Shibo Dai, Jiameng Lyu, Yuan Zhou

机构 * Leonard N. Stern School of Business, New York University(纽约大学勒纳商学院) Qiuzhen College, Tsinghua University(清华大学齐臻学院) Department of Management Science, School of Management, Fudan University(复旦大学管理学院管理科学系) Yau Mathematical Sciences Center & Department of Mathematical Sciences, Tsinghua University(清华大学尤数学科学中心及数学科学系)

AI总结 本文研究了动态联合品类选择与排列问题,其中每个产品的吸引力取决于其内在吸引力和显示位置,在多项逻辑(MNL)选择框架下。研究从乘法位置效应模型扩展到一般位置效应模型,为两种模型设计了基于轮次的学习算法,并建立了首个最优后悔分析。此外,这些基于轮次的算法为现代平台提供了必要的实时操作。对于乘法模型,开发了具有截断机制的交叉位置成对最大似然估计器,并证明算法P2MLE-UCB达到$ ilde{O}(\sqrt{NT})$的后悔,匹配下限并弥补了先前基于周期的分析留下的$\sqrt{K}$差距。对于一般模型,建立了最小最大下界并提出了GP2-UCB算法,具有匹配的上界。此外,设计了基于Dinkelbach方法和最大权二分图匹配的高效子程序,用于每轮联合品类和排列优化。在合成数据和Expedia数据集上的数值实验表明,我们的算法在性能上始终优于最先进的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17102 2026-05-19 cs.GR cs.CV

VoxScene: Anchor-Conditioned Voxel Diffusion for Indoor Scene Arrangement

VoxScene: 基于锚点的体素扩散用于室内场景布置

Haotian Mao, Yuhan Huang, Jiatao Lin, Yang Zhao, Hui Wang, Yiheng Zhang, Yuwang Wang, Chenliang Zhou, Yan Zhang, Fangcheng Zhong, Xubo Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) University of Cambridge(剑桥大学) Peking University(北京大学)

AI总结 本文提出VoxScene,一种基于锚点的体素扩散框架,用于3D场景合成。通过引入显式的、以物体为中心的体素表示,解决了现有方法在处理密集环境时的物理碰撞和结构纠缠问题,实现了高保真体素网格的生成,提升了场景布置的物理合理性和形状多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16999 2026-05-19 cs.LG

Ranking-Aware Calibration for Reliable Multimodal Reinforcement Learning

基于排名的校准:可靠多模态强化学习

Peng Cui, Boyao Yang, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, BNRist Center, Tsinghua-Bosch Joint ML Center, THBI Lab, Tsinghua University, Beijing(计算机科学与技术系,人工智能研究院,BNRist中心,清华大学-博世联合机器学习中心,THBI实验室,清华大学,北京) Dept. of Automation, Tsinghua University, Beijing(自动化系,清华大学,北京)

AI总结 本文提出Ranking-Aware Calibration方法,通过利用组内强化学习自然产生的比较信号,提升多模态强化学习的校准能力,从而提高任务准确性和校准效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16979 2026-05-19 cs.RO

NORM-Nav: Zero-Shot Mobile Robot Navigation with Natural Language Behavioral Constraints

NORM-Nav: 通过自然语言行为约束实现零样本移动机器人导航

Dongjie Huo, Junhui Wang, Chao Gao, Yan Qiao, Dong Zhang, Guyue Zhou

机构 * College of Information Science and Technology, Beijing University of Chemical Technology(北京化工大学信息科学与技术学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Institute of Systems Engineering and Collaborative Laboratory for Intelligent Science and Systems, Macau University of Science and Technology(澳门大学系统工程与智能科学与系统联合实验室) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院)

AI总结 本文提出NORM-Nav框架,通过将自然语言行为约束整合到基于成本图的规划中,提升移动机器人在人类环境中导航的社交适应性,实验表明其在任务成功率和轨迹贴近人类参考方面优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏