arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2909
2605.30039 2026-06-01 cs.AI

Domain-Specific Data Synthesis for LLMs via Minimal Sufficient Representation Learning

基于最小充分表示学习的大语言模型领域特定数据合成

Tong Ye, Hang Yu, Tengfei Ma, Xuhong Zhang, Jianguo Li, Peng Di, Peiyu Liu, Jianwei Yin, Wenhai Wang

机构 * vivo AI Lab(vivo人工智能实验室) Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

AI总结 提出DOMINO框架,通过对比解耦学习最小充分领域表示,指导生成领域对齐的合成数据,在隐式领域定义下提升微调性能。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29343 2026-06-01 cs.CL

Draft-OPD: On-Policy Distillation for Speculative Draft Models

Draft-OPD:用于推测草稿模型的在线策略蒸馏

Haodi Lei, Yafu Li, Haoran Zhang, Shunkai Zhang, Qianjia Cheng, Xiaoye Qu, Ganqu Cui, Bowen Zhou, Ning Ding, Yun Luo, Yu Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 针对推测解码中草稿模型因离线训练与在线推理不匹配导致性能瓶颈的问题,提出Draft-OPD方法,通过目标辅助展开和重放验证暴露的错误位置实现在线策略蒸馏,在多种任务上实现超过5倍的无损加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22409 2026-06-01 cs.CV

SpaMEM: Benchmarking Dynamic Spatial Reasoning via Perception-Memory Integration in Embodied Environments

SpaMEM:具身环境中通过感知-记忆集成进行动态空间推理的基准测试

Chih-Ting Liao, Xi Xiao, Chunlei Meng, Zhangquan Chen, Yitong Qiao, Weilin Zhou, Tianyang Wang, Xu Zheng, Xin Cao

机构 * The University of New South Wales(新南威尔士大学) The University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Fudan University(复旦大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) Xinjiang University(新疆大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出SpaMEM基准,通过动作条件场景变换和多模态数据,分层评估多模态大模型在具身环境中的空间信念演化能力,揭示坐标一致性和视觉记忆瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13812 2026-06-01 cs.DB cs.AI cs.MA

DTBench: A Synthetic Benchmark for Document-to-Table Extraction

DTBench:文档到表格提取的合成基准

Yuxiang Guo, Zhuoran Du, Nan Tang, Kezheng Tang, Congcong Ge, Yunjun Gao

机构 * Zhejiang University(浙江大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science(香港科学与技术大学)

AI总结 提出DTBench合成基准,通过反向Table2Doc范式和多智能体合成流程生成文档,系统评估LLM在文档到表格提取中的多种能力。

Comments KDD26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19448 2026-06-01 cs.LG cs.CR

From Internal Diagnosis to External Auditing: A VLM-Driven Paradigm for Data-Free Online Backdoor Defense

从内部诊断到外部审计:一种VLM驱动的数据自由在线后门防御范式

Binyan Xu, Fan Yang, Xilin Dai, Di Tang, Kehuan Zhang

机构 * The Chinese University of Hong Kong, Hong Kong(香港中文大学) Sun Yat-sen University, China(中山大学) Zhejiang University, China(浙江大学)

AI总结 提出一种从内部诊断到外部语义审计的范式转变,利用通用视觉语言模型(VLM)作为外部语义门控,通过PRISM框架(原型精炼与统计监控检查)实现数据自由的在线后门防御,在17个数据集和11种攻击类型上达到最先进性能。

Comments 25 pages, 10 figures, 19 tables. To appear in the Proceedings of the 43 rd International Conference on Machine Learning (ICML '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15859 2026-06-01 cs.CL cs.AI

InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training

InfiMed-ORBIT: 通过基于评分标准的增量训练使大语言模型对齐开放复杂任务

Pengkai Wang, Pengwei Liu, Qi Zuo, Zhijie Sang, Congkai Xie, Hongxia Yang

机构 * Department of Computing, The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学计算机系) Department of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院)

AI总结 提出ORBIT框架,利用动态生成的病例条件评分标准指导增量强化学习,仅用2k样本将Qwen3-4B-Instruct在HealthBench-Hard上的得分从7.0提升至27.5,达到同规模开源模型最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19513 2026-06-01 cs.LG

Row-Stochastic Matrices Can Provably Outperform Doubly Stochastic Matrices in Decentralized Learning

行随机矩阵在去中心化学习中可证明优于双随机矩阵

Bing Liu, Boao Kong, Limin Lu, Kun Yuan, Chengcheng Zhao

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Center for Data Science, Peking University(北京大学数据科学中心) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心)

AI总结 本文通过加权希尔伯特空间框架,严格证明了行随机矩阵相比双随机矩阵在去中心化学习中具有更快的收敛速度,并给出了拓扑条件指导设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17185 2026-06-01 cs.CV

PostCam: Camera-Controllable Novel-View Video Generation with Query-Shared Cross-Attention

PostCam: 基于查询共享交叉注意力的相机可控新视角视频生成

Yipeng Chen, Zhichao Ye, Zhenzhou Fang, Xinyu Chen, Xiaoyu Zhang, Jialing Liu, Nan Wang, Guofeng Zhang, Haomin Liu

机构 * State Key Lab of CAD\&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) Shanghai InSpatio Intelligent Technology Co., Ltd.(上海InSpatio智能技术有限公司)

AI总结 提出PostCam框架,通过查询共享交叉注意力机制对齐6自由度姿态和渲染特征,实现动态场景中高细节保持和精确相机轨迹编辑的新视角视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03876 2026-06-01 cs.CV

Skin Lesion Classification Based on ResNet-50 Enhanced With Adaptive Spatial Feature Fusion

基于自适应空间特征融合增强的ResNet-50皮肤病变分类

Runhao Liu, Fengyi Zha, Fei Ding, Guangzhen Yao, Peng Zhang

机构 * Polytechnic Institute, Zhejiang University, Hangzhou, China(浙江大学杭州Polytechnic学院) Chu Kochen Honors College, Zhejiang University, Hangzhou, China(浙江大学杭州Chu Kochen荣誉学院) Alibaba Group, Chaoyang District, Beijing, China(北京朝阳区阿里巴巴集团) School of Information Science and Technology, Northeast Normal University, Changchun, China(吉林师范大学信息科学与技术学院) School of Mathematical Sciences, Zhejiang University, Hangzhou, China(浙江大学数学科学学院)

AI总结 提出一种结合自适应空间特征融合(ASFF)的改进ResNet-50模型,通过双分支结构融合多尺度语义和细节特征,在ISIC 2020子集上达到93.182%准确率,并有效泛化至ISIC 2019外部验证集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11911 2026-06-01 math.NA cs.LG cs.NA physics.comp-ph

Reduced-order modeling of Hamiltonian dynamics based on symplectic neural networks

基于辛神经网络的哈密顿动力学降阶建模

Yongsheng Chen, Wei Guo, Qi Tang, Xinghui Zhong

机构 * School of Mathematical Sciences, Zhejiang University(浙江大学数学科学学院) Department of Mathematics and Statistics, Texas Tech University(德克萨斯理工大学数学与统计系) School of Computational Science and Engineering, Georgia Institute of Technology(佐治亚理工学院计算科学与工程学院)

AI总结 提出一种数据驱动的辛诱导降阶建模框架,通过统一端到端神经架构同时发现潜空间和学习动力学,确保降阶模型精确保持辛结构,提升长期稳定性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30311 2026-05-29 cs.CV cs.AI

Archon: A Unified Multimodal Model for Holistic Digital Human Generation

Archon:面向整体数字人生成的统一多模态模型

Chong Bao, Shichen Liu, Lijun Yu, David Futschik, Stylianos Moschoglou, Shefali Srivastava, Ziqian Bai, Feitong Tan, Guofeng Zhang, Zhaopeng Cui, Sean Fanello, Yinda Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) Google(谷歌) Google DeepMind(谷歌DeepMind)

AI总结 提出Archon,一个完全预训练的以人为中心的统一多模态模型,通过模态特定分词器、语义视频重参数化和“模态思维”策略,实现文本、音频、动作和视觉等七种模态的整体数字人生成。

Comments Accepted to CVPR 2026. Project Page: https://zju3dv.github.io/archon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30260 2026-05-29 cs.CL cs.AI cs.CV cs.LG

How LoRA Remembers? A Parametric Memory Law for LLM Finetuning

LoRA如何记忆?大语言模型微调的参数记忆定律

Ziwen Xu, Haiwen Hong, Linsong Yu, Benglei Cui, Longtao Huang, Hui Xue, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出参数记忆定律,揭示LoRA在微调中参数与序列长度对损失降低的幂律关系,并基于此设计MemFT优化策略提升记忆保真度与效率。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30251 2026-05-29 cs.CL cs.AI

Same Evidence, Different Answers: Canonical-Context On-Policy Distillation for Multi-Turn Language Models

相同证据,不同答案:面向多轮语言模型的规范上下文在线策略蒸馏

Zizhuo Lin, Quanling Liu, Jinsheng Quan, Chao Zhang, Yifan Zhu, Xing Shi, Jingtao Xu, Zhihui Li, Yawei Luo

机构 * Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出规范上下文在线策略蒸馏(CCOPD)方法,通过教师-学生框架对齐模型在完整提示和逐步揭示信息下的行为,减少自我锚定漂移,在多轮数学对话上训练后,在原始分片任务上平均提升32%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30219 2026-05-29 cs.AI cs.CL cs.LG

When Should Models Change Their Minds? Contextual Belief Management in Large Language Models

模型何时应改变想法?大语言模型中的上下文信念管理

Haoming Xu, Weihong Xu, Zongrui Li, Mengru Wang, Yunzhi Yao, Chiyu Wu, Jin Shang, Yu Gong, Shumin Deng

机构 * Zhejiang University(浙江大学) HomologyAI

AI总结 提出上下文信念管理(CBM)框架,通过引入BeliefTrack基准和信念状态奖励的强化学习,将大语言模型在长程交互中的信念更新失败率平均降低70.9%。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30159 2026-05-29 cs.AI

Meta-Cognitive Memory Policy Optimization for Long-Horizon LLM Agents

元认知记忆策略优化用于长视野LLM智能体

Ziyan Liu, Zhezheng Hao, Yeqiu Chen, Hong Wang, Jingren Hou, Ruiyi Ding, Yongkang Yang, Wence Ji, Wei Xia, Feng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Tencent(腾讯)

AI总结 针对长视野任务中记忆策略训练缺乏中间监督的问题,提出基于信念熵的元认知记忆策略优化(MMPO),通过自监督代理惩罚高认知不确定性摘要,提升长期推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30115 2026-05-29 cs.CV

Large Depth Completion Model from Sparse Observations

来自稀疏观测的大深度补全模型

Zhu Yu, Zhengyi Zhao, Runmin Zhang, Lingteng Qiu, Kejie Qiu, Yisheng He, Siyu Zhu, Zilong Dong, Si-Yuan Cao, Hui-Liang Shen

机构 * Zhejiang University(浙江大学) Tongyi Lab, Alibaba Group(阿里云实验室) Fudan University(复旦大学) Ningbo Innovation Center, Zhejiang University(宁波创新中心,浙江大学) NingboTech University(宁波科技学院) Jinhua Institute of Zhejiang University(金华大学浙大研究院)

AI总结 提出LDCM,利用单目基础模型和基于泊松的深度初始化策略,结合点图头回归3D坐标,实现稀疏观测下的度量准确深度补全。

Comments ICLR 2026. Project webpage: https://pkqbajng.github.io/ldcm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30027 2026-05-29 cs.CV cs.IR

DocRetriever: A Plug-and-Play Framework for Multimodal Document Retrieval with Comprehensive Benchmark

DocRetriever:面向多模态文档检索的即插即用框架与综合基准

Ruofan Hu, Menghui Zhu, Jieming Zhu, Bo Chen, Shengyang Xu, Minjie Hong, Xiaoda Yang, Sashuai Zhou, Li Tang, Tao Jin, Zhou Zhao

机构 * Zhejiang University(浙江大学) Huawei Technologies Co., Ltd(华为技术有限公司)

AI总结 提出DocRetriever即插即用框架,通过布局感知的稀疏嵌入和推理增强的重排序器解决多模态文档检索中语义模糊和泛化瓶颈问题,并构建MultiDocR基准实现更严格评估。

Comments Accepted at KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30011 2026-05-29 cs.CV cs.AI

VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies

VisualThink-VLA:用于高效低延迟视觉-语言-动作策略的视觉中间推理

Mingjian Gao, Wenqiao Zhang, Yuqian Yuan, Yang Dai, Binhe Yu, Zheqi Lv, Haoyu Zheng, Jiaqi Zhu, Zhiqi Ge, Zixuan Wan, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Cornell University(康奈尔大学) National University of Singapore(新加坡国立大学) Xi'an University of Electronic Science and Technology(西安电子科技大学)

AI总结 提出VisualThink-VLA框架,通过视觉中间推理和选择性路由机制,在保持高精度的同时将推理延迟从数秒降至亚秒级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30010 2026-05-29 cs.CV

EarlyTom: Early Token Compression Completes Fast Video Understanding

EarlyTom: 早期令牌压缩实现快速视频理解

Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Alibaba Cloud Computing(阿里云计算)

AI总结 针对视频大语言模型中视觉编码阶段效率低下的问题,提出EarlyTom无训练令牌压缩框架,通过在视觉编码器内部进行早期压缩,显著降低首令牌延迟并提升吞吐量。

Comments Accepted by CVPR 2026. 16 pages, 8 figures, 8 tables. Project page: https://viridisgreen.github.io/EarlyTom

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29940 2026-05-29 cs.AI

Make LLM Learn to Synthesize from Streaming Experiences through Feedback

使大语言模型通过反馈从流式经验中学习合成

Zhenlin Hu, Yan Wang, Zhen Bi, Zihao Xue, Bingyu Zhu, Longtao Huang, Xiongtao Zhang, Zeyu Yang, Zhixuan Chu, Jungang Lou

机构 * Huzhou Normal University(湖州师范学院) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Zhejiang Key Laboratory of Intelligent Education Technology and Application(浙江省智能教育技术与应用重点实验室)

AI总结 提出StreamSynth设置和SynLearner框架,使模型通过任务流积累经验并利用反馈提升合成数据生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29790 2026-05-29 cs.MA cs.AI

Evolve as a Team: Collaborative Self-Evolution for LLM-based Multi-Agent Systems

像团队一样进化:基于LLM的多智能体系统的协作自我进化

Zhezheng Hao, Tianfu Wang, Huanshuo Dong, Ziyan Liu, Hong Wang, Xiankun Lin, Qiang Lin, Can Wang, Hande Dong, Jiawei Chen

机构 * Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科技大学) Tencent(腾讯)

AI总结 提出Meta-Team框架,通过协作自我进化机制,基于执行经验改进多智能体系统的行为、协调和团队组织,在长周期任务中显著优于单智能体、手工MAS及先前进化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29704 2026-05-29 cs.RO

FLIP: Real-Time and Resilient Formation Planning for Large-Scale DIstributed Swarms via Point Cloud Registration

FLIP:通过点云配准实现大规模分布式集群的实时弹性编队规划

Yuan Zhou, Guangtong Xu, Zhenyu Hou, Jialiang Hou, Fei Gao

机构 * Institute of Cyber-Systems and Control, College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院智能系统与控制研究所) Huzhou Institute, Zhejiang University(浙江大学湖州研究院)

AI总结 提出将最优编队位置序列计算转化为时空点云配准问题,利用带离群点剔除的PCR方法实现大规模分布式集群的弹性、高效轨迹规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29685 2026-05-29 cs.AI

NICE: A Theory-Grounded Diagnostic Benchmark for Social Intelligence of LLMs

NICE:一个基于理论的LLM社交智能诊断基准

Yunjin Qi, Zhaojun Jiang, Xuan Wu, Hanxi Pan, Yixuan Wang, Yanfang Liu, Xiang Ji, Churu Yu, Chunyuan Zheng, Yingze Chen, Jie He, Liuqing Chen, Zaifeng Gao

机构 * Department of Psychology and Behavioral Sciences, Zhejiang University(浙江大学心理学与行为科学系) College of Artificial Intelligence, Zhejiang University(浙江大学人工智能学院) Human Machine Interaction Lab, Huawei Technologies Co., Ltd.(华为技术有限公司人机交互实验室) Zhejiang Key Laboratory of Neurocognitive Development and Mental Health(浙江省神经认知发展与心理健康重点实验室)

AI总结 本文通过构建基于社会理论的社交智能框架,提出诊断基准NICE,用于细粒度评估大语言模型在社交交互中的能力弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29670 2026-05-29 cs.CL cs.AI

EviLink: Multi-Path Schema Linking with Uncertainty-Guided Evidence Acquisition for Large-Scale Text-to-SQL

EviLink: 面向大规模Text-to-SQL的基于不确定性引导证据获取的多路径模式链接

Huawei Zheng, Sen Yang, Zhaorui Yang, Yuhui Zhang, Haozhe Feng, Haoxuan Li, Xuan Yi, Chao Hu, Defeng Xie, Chen Hou, Danqing Huang, Wei Chen, Yingcai Wu, Peng Chen, Dazhen Deng

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Tencent TEG(腾讯TEG) School of Mathematical Sciences, Peking University(北京大学数学科学学院)

AI总结 提出EviLink方法,通过多假设模式基础与不确定性引导的证据获取,重新定义模式链接为不确定性感知的模式需求推理,以平衡模式完整性、相关性和令牌成本,提升大规模Text-to-SQL性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29664 2026-05-29 cs.DC cs.LG

AMDP: Asynchronous Multi-Directional Pipeline Parallelism for Large-Scale Models Training

AMDP:面向大规模模型训练的异步多方向流水线并行

Ling Chen, Houming Wu, Wenjie Yu

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University, Hangzhou, China(区块链与数据安全国家重点实验室,浙江大学,杭州,中国) College of Computer Science and Technology, Zhejiang University, Hangzhou, China(计算机科学与技术学院,浙江大学,杭州,中国)

AI总结 针对异步流水线并行中参数不匹配导致收敛退化的问题,提出AMDP方法,通过限制流水线第一阶段处理小批量数量、启动多条并发流水线并自适应调整数量、以及跨小批量累积梯度后单次更新,在保持高利用率的同时加速训练并保证收敛。

Comments Accepted by ICML 2026, 9 pages, and 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29653 2026-05-29 cs.AI

PTCG-Bench: Can LLM Agents Master Pokémon Trading Card Game?

PTCG-Bench:LLM智能体能否掌握宝可梦集换式卡牌游戏?

Dongdong Hua, Yifei Sun, Renhong Huang, Feng Gao, Chunping Wang, Yang Yang

机构 * Zhejiang University(浙江大学) FinVolution Group(FinVolution集团)

AI总结 提出PTCG-Bench基准,通过宝可梦集换式卡牌游戏评估LLM智能体的决策性能和自进化能力,并设计模块化消融实验分析智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29607 2026-05-29 cs.LG

Cluster-Level Attention-Guided Parallel Decoding for Masked Diffusion Language Models

掩码扩散语言模型的簇级注意力引导并行解码

Heqiang Qi, Wei Huang, Mingyuan Bai, Xiangming Meng

机构 * Zhejiang University(浙江大学) RIKEN Center for Advanced Intelligence Project(日本理化学研究院先进智能项目中心) The Institute of Statistical Mathematics(统计数学研究所) Agency for Science, Technology and Research (A ⋆ \star STAR)(科技研究局(A ⋆ STAR))

AI总结 提出CLAD方法,通过将相邻高置信度token聚合成簇,并利用自注意力图估计簇间依赖,实现掩码扩散语言模型的训练无关簇级并行解码,在保持任务精度的同时获得1.77-8.47倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20752 2026-05-29 cs.RO

GaussianDream: A Feed-Forward 3D Gaussian World Model for Robotic Manipulation

GaussianDream:用于机器人操作的前馈3D高斯世界模型

Zijian Zhang, Yuqing Jiang, Qian Cheng, Xiaofan Li, Si Liu, Ding Zhao, Ping Luo, Weitao Zhou, Haibao Yu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

AI总结 提出GaussianDream,一种前馈3D高斯世界模型插件,通过可学习查询编码当前帧3D空间结构和短期未来演化,在训练时用静态重建和未来预测头监督,推理时仅保留查询条件化动作生成,在多个机器人操作基准上达到最先进性能。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18527 2026-05-29 cs.CV cs.AI cs.SD

JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments

JAEGER:模拟物理环境中的联合3D音频-视觉定位与推理

Zhan Liu, Changli Tang, Yuxin Wang, Zhiyuan Zhu, Youjun Chen, Yiwen Shao, Tianzi Wang, Lei Ke, Zengrui Jin, Chao Zhang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Tencent AI Lab(腾讯AI实验室)

AI总结 提出JAEGER框架,通过集成RGB-D观测和多通道一阶环境声学,将音频-视觉大语言模型扩展到3D空间,实现联合空间定位与推理,并引入神经强度向量(Neural IV)提升声源方向估计的鲁棒性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11065 2026-05-29 cs.CL cs.AI

S-MARC: Causal Streaming Reasoning for Full-Duplex Conversational Behavior Modeling

S-MARC:全双工对话行为建模的因果流式推理

Dingkun Zhou, Shuchang Pan, Jiachen Lian, Siddharth Banerjee, Sarika Pasumarthy, Dhruv Hebbar, Siddhant Patel, Zeyi Austin Li, Kan Jen Cheng, Sanay Bordia, Krish Patel, Akshaj Gupta, Tingle Li, Gopala Anumanchipalli

机构 * University of California, Berkeley(加州大学伯克利分校) Zhejiang University(浙江大学) South China University of Technology(华南理工大学)

AI总结 提出S-MARC框架,通过流式因果层次建模意图到动作路径,预测高层交际功能和低层交互行为,并构建高质量语料库,实现全双工对话中的鲁棒行为检测与可解释推理。

详情

展开后加载摘要…

URL PDF HTML 收藏