Alignment Is All You Need For X-to-4D Generation
对齐即一切:X到4D生成
机构 * Zhejiang University(浙江大学)
AI总结 提出Align4D框架,通过物体距离对齐、运动-几何联合对齐和异步优化,实现任意模态输入到4D视频-3D对的生成,在X4D和Consistent4D数据集上达到最先进水平。
高校专区
对齐即一切:X到4D生成
机构 * Zhejiang University(浙江大学)
AI总结 提出Align4D框架,通过物体距离对齐、运动-几何联合对齐和异步优化,实现任意模态输入到4D视频-3D对的生成,在X4D和Consistent4D数据集上达到最先进水平。
EAGLE-360: 360°环境中的具身主动全局到局部探索
机构 * Zhejiang University(浙江大学) ; Central China Normal University(华中师范大学)
AI总结 针对多模态大模型在360°全景主动视觉搜索中因极地畸变和连续拓扑建模不足导致的效率低下问题,提出EAGLE-360框架,通过全局先验引导局部探索,结合RoPE Rolling位置编码和GRPO训练,实现近8倍精度提升。
Comments Preprint
EvoPolicyGym:评估交互环境中的自主策略进化
机构 * University of Science and Technology of China(中国科学技术大学) ; The Chinese University of Hong Kong(香港中文大学) ; University of Macau(澳门大学) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; Soochow University(苏州大学) ; Brown University(布朗大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 提出自主策略进化评估框架,通过EvoPolicyGym基准测试代理在固定交互预算下迭代改进策略的能力,GPT-5.5在16个环境中表现最优,并揭示预算分配与反馈转化机制。
Comments 24 pages
纯化OPSD:在不失去思考能力的情况下进行在线自我蒸馏
机构 * Zhejiang University(浙江大学) ; Tongyi Lab, Alibaba Group(阿里云实验室,阿里巴巴集团) ; Huazhong University of Science and Technology(华中科技大学) ; Jilin University(吉林大学)
AI总结 针对在线自我蒸馏(OPSD)在长链思维推理模型中失效的问题,通过分解教师监督信号,发现参考诱导成分导致死记硬背,提出基于点互信息的参考隔离方法,在保持模型认知行为的同时提升性能。
VLA-Corrector:面向自适应动作视界的轻量级检测与校正推理
机构 * OmniAI Group of ZJU ACES Lab(浙江大学ACES实验室OmniAI组) ; Zhejiang University(浙江大学) ; Alibaba DAMO Academy(阿里巴巴达摩院)
AI总结 提出VLA-Corrector,一种轻量级校正推理框架,通过潜在空间视觉监控和在线梯度引导,实现事件触发的自适应动作视界,在不修改骨干策略权重的情况下,中断复合错误并提升鲁棒性。
Comments 22 pages, 14 figures
MedStreamBench: 面向流式与主动式医疗视频理解的时间感知基准
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系)
AI总结 提出MedStreamBench基准,通过时间受限证据窗口和主动监控设置,评估模型在流式与主动式医疗视频理解中的回答时机与正确性,发现离线识别与时间感知决策间存在显著差距。
Comments 10 Pages, 5 Figures
重新审视带压缩通信的分布式在线凸优化
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) ; State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全全国重点实验室)
AI总结 针对带压缩通信的分布式在线凸优化,首次提出两种基于跟随正则化领导者的算法,在完整信息和赌博机设置下分别匹配或显著改进现有遗憾界与通信成本。
基于消息传递的双时间尺度贝叶斯学习用于联合信道和记忆硬件损伤跟踪
机构 * Zhejiang University(浙江大学) ; National Key Laboratory of Millimeter-Wave and Terahertz Remote Sensing(毫米波与太赫兹遥感全国重点实验室) ; Zhejiang Provincial Key Laboratory of Information Processing, Communication and Networking (IPCAN)(浙江省信息处理、通信与网络重点实验室) ; Zhejiang Provincial Key Laboratory of Multi-Modal Communication Networks and Intelligent Information Processing(浙江省多模态通信网络与智能信息处理重点实验室)
AI总结 提出消息传递双时间尺度贝叶斯深度学习框架,利用残差循环门控单元建模硬件损伤记忆,通过快速时变马尔可夫先验和慢变高斯马尔可夫先验分别处理信道与损伤参数,结合Turbo-OAMP和DAMP实现联合跟踪。
安全且自适应的云修复:使用神经符号世界模型验证LLM生成的恢复计划
机构 * Zhejiang University(浙江大学)
AI总结 提出PASE框架,将LLM作为规划引擎生成恢复计划,通过神经符号世界模型验证可行性,并利用DRL优化提示,实现动态自适应修复,显著降低恢复时间并提高未知故障检测精度。
Comments 13 pages
超越怀疑:用自适应教学警觉框架评估大语言模型的教学意图推理
机构 * Zhejiang University(浙江大学)
AI总结 提出自适应教学警觉(APV)框架,通过贝叶斯教学意图推理引擎建模教学选择与学习者推理,显著提升LLM区分教学与暴露内容的能力,与人类判断高度相关。
Comments 22 pages
SPADER: 面向多答案问答的逐步同伴优势与多样性感知探索奖励
机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) ; School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) ; School of Software Technology, Zhejiang University(浙江大学软件技术学院)
AI总结 提出SPADER强化学习框架,通过逐步同伴优势(SPA)机制和多样性感知探索奖励,解决多答案问答中长程工具使用的细粒度信用分配与持续探索问题,实验表明在多个数据集上提升了召回率和F1分数。
Ophiuchus: 激励工具增强的“图像思考”用于联合医学分割、理解与推理
机构 * Zhejiang University(浙江大学) ; Fudan University(复旦大学) ; Information Hub, HKUST (Guangzhou)(信息枢纽,香港科技大学(广州))
AI总结 提出Ophiuchus框架,通过三阶段训练策略(冷启动SFT、自反思微调、工具强化学习)使MLLM动态聚焦细粒度视觉区域,实现精准医学分割与诊断。
NEARL: 基于正交正则化的交互式查询自适应用于医学视觉-语言理解
机构 * MoE Key Lab of Artificial Intelligence(人工智能MOE实验室) ; AI Institute(人工智能研究院) ; School of Computer Science(计算机科学学院) ; Shanghai Jiao Tong University(上海交通大学) ; Department of Radiology(放射科) ; The First Affiliated Hospital(第一附属医院) ; School of Medicine(医学院) ; Zhejiang University(浙江大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; State Key Laboratory of Infrared Physics(红外物理国家重点实验室) ; Shanghai Institute of Technical Physics(上海技术物理研究所) ; Chinese Academy of Science(中国科学院)
AI总结 提出NEARL框架,通过统一协同嵌入变换器(USEformer)和正交交叉注意力适配器(OCA)实现双向跨模态交互,仅引入1.46M参数,在三个医学影像数据集上取得最先进性能。
从捆绑销售数据中学习消费者偏好
机构 * University of Toronto(多伦多大学) ; McGill University(麦吉尔大学) ; Zhejiang University(浙江大学)
AI总结 提出一种从捆绑销售交易数据中估计消费者对单个产品估值分布的方法,通过定义效用模型并使用EM算法和蒙特卡洛模拟恢复估值分布,扩展至未观测无购买、市场细分和协同效应,并提供可识别性和收敛性理论保证。