arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2909
2604.17931 2026-07-28 cs.AI 版本更新

LiteResearcher: A Scalable Agentic RL Training Framework for Deep Research Agent

LiteResearcher:一种用于深度研究代理的可扩展代理强化学习训练框架

Bince Qu, Wanli Li, Bo Pan, Jianyu Zhang, Zheng Liu, Pan Zhang, Wei Chen, Bo Zhang

机构 * Zhejiang University(浙江大学) Simplex AI The Hong Kong Polytechnic University(香港理工大学)

AI总结 LiteResearcher通过构建轻量虚拟世界提升代理强化学习的可扩展性,使小规模搜索代理在GAIA和Xbench等基准上取得state-of-the-art结果。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29452 2026-07-28 cs.RO 版本更新

CReF: Cross-modal and Recurrent Fusion for Depth-conditioned Humanoid Locomotion

CReF:跨模态与递归融合用于基于深度的人形机器人运动

Yuan Hao, Ruiqi Yu, Shixin Luo, Guoteng Zhang, Jun Wu, Qiuguo Zhu

机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学控制科学与工程学院) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院)

AI总结 本文提出CReF框架,通过直接从原始前方深度数据学习运动相关特征,实现稳定复杂地形行走,改进了传统依赖几何抽象的方法,展示了在模拟和真实环境中鲁棒的地形穿越能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08521 2026-07-28 cs.CV cs.RO eess.IV 版本更新

OccTrack360: 4D Panoptic Occupancy Tracking from Surround-View Fisheye Cameras

OccTrack360: 从环视鱼眼相机实现4D全景占用跟踪

Yongzhi Lin, Kai Luo, Yuanfan Zheng, Hao Shi, Mengfei Duan, Yang Liu, Kailun Yang

机构 * School of Artificial Intelligence and Robotics, Hunan University(人工智能与机器人学院,湖南大学) State Key Laboratory of Extreme Photonics and Instrumentation, Zhejiang University(极端光子学与仪器国家重点实验室,浙江大学) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学)

AI总结 OccTrack360提出新的4D全景占用跟踪基准及FoSOcc框架,解决鱼眼成像中的球面投影和体素定位问题,提升占用跟踪性能。

Comments Accepted to IEEE/RSJ IROS 2026. The benchmark and source code will be made publicly available at https://github.com/YouthZest-Lin/OccTrack360

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03570 2026-07-28 cs.LG 版本更新

Asymmetric Hierarchical Anchoring for Robust Audio-Visual Cross-Modal Generalization

非对称层次锚定用于音频-视觉联合表示:解决信息分配模糊性以实现鲁棒跨模态泛化

Bixing Wu, Yuhong Zhao, Zongli Ye, Jiachen Lian, Xiangyu Yue, Gopala Anumanchipalli

机构 * Zhejiang University, China(浙江大学) University of California, Berkeley, USA(加州大学伯克利分校) MMLab, Chinese University of Hong Kong, China(香港中文大学MMLab)

AI总结 本文提出非对称层次锚定框架,通过结构化语义锚点解决跨模态泛化中的信息分配模糊性,提升语义一致性和表示纯度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22342 2026-07-28 cs.RO 版本更新

VL-LN Bench: Towards Long-horizon Goal-oriented Navigation with Active Dialogs

VL-LN基准:通过主动对话实现长视界目标导向导航

Wensi Huang, Shaohao Zhu, Meng Wei, Siqi Zhang, Jinming Xu, Xihui Liu, Hanqing Wang, Tai Wang, Feng Zhao, Jiangmiao Pang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

AI总结 VL-LN基准通过引入主动对话机制,提升长视界目标导向导航任务的性能和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17492 2026-07-28 cs.AI cs.CL cs.LG 版本更新

PD$^3$: A Project Duplication Detection Framework via Adapted Multi-Agent Debate

PD$^3$:一种通过适应性多智能体辩论的项目重复检测框架

Dezheng Bao, Yueci Yang, Chutian Yu, Xin Chen, Zeguo Fei, Xiang Yuan, Lijun Zhang, Jiangqian Huang, Zhengxuan Jiang, Daoze Zhang, Junru Chen, Yang Yang

机构 * Zhejiang University(浙江大学) State Grid Power Supply Co. Ltd.(国网电力供应有限公司)

AI总结 研究项目重复检测问题,提出PD$^3$框架,通过适应性多智能体辩论,结合局部多智能体辩论与全局循环调度检索项目集,能保证公平比较并产生相关分数和反馈,在真实项目上优于基线,还部署平台节省资金。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22334 2026-07-27 cs.LG cs.AI cs.CL 新提交

Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization

基于字节前缀边缘化的跨分词器策略内蒸馏

Hao Wang, Kun Yuan, Wenlin Zhong, Minglei Zhang, Han Xiao, Ming Sun, Honggang Qi

机构 * University of Chinese Academy of Sciences(中国科学院大学) KwaiKAT Team(快手KwaiKAT团队) Zhejiang University(浙江大学)

AI总结 研究如何通过策略内蒸馏整合不同家族语言模型,提出字节前缀边缘化方法,在共享字节空间重表达教师下一个令牌分布,在数学和编程基准测试中,该方法优于现有跨分词器方法,提升了平均准确率。

Comments Project page: https://bpm-opd.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22302 2026-07-27 cs.CV 新提交

fMRI2Face: A Full-HD fMRI-Video Dataset and Geometry-Guided Neural Decoding Framework for Dynamic Human Face Reconstruction

fMRI2Face:用于动态人脸重建的全高清功能磁共振成像视频数据集和几何引导神经解码框架

Jingyang Huo, Xiangru Huang, Chentao Shen, Yikai Wang, Yun Wang, Jianxiong Gao, Shihao Jin, Yanwei Fu, Jianfeng Feng

机构 * Fudan University(复旦大学) Westlake University(西湖大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Xmov(未提及通用中文名,可音译为艾莫夫)

AI总结 该研究提出fMRI-Face数据集及fMRI2Face框架,用于从大脑活动重建动态人脸。框架从大脑活动中获取两种互补神经控制,经整合实现高保真面部视频重建,实验显示其性能优于基线,为动态面部感知研究提供了新平台和基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22148 2026-07-27 cs.CV cs.AI 新提交

dRAE: Representation Autoencoder with Hyper-Spherical Codes

dRAE:具有超球面码的表示自编码器

Tianren Ma, Lin Long, Chuyan Chen, Mu Zhang, Junbo Zhao, Tong Zhang, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学) Peking University(北京大学) Ant Group(蚂蚁集团)

AI总结 研究旨在解决高维视觉表示离散化难题,提出超球面量化(HSQ),其离散表示自编码器(dRAE)能解耦语义与特征幅度,防止码本坍缩,实现高保真重建,实验证明性能提升、码本利用率高且训练流程简化。

Comments Preprint. Project Page: https://drae-hsq.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22101 2026-07-27 cs.CV 新提交

InnoText: A Unified Model for Visual Text Generation and Editing

InnoText:一种用于视觉文本生成和编辑的统一模型

Haowei Liu, Runze He, Jian Lu, Ao Ma, Run Ling, Ke Cao, Jiasong Feng, Wei Feng, Shuo Lu, Yexing Xu, Yun Wang, Jing Wang, Zhanjie Zhang

机构 * JD.com, Inc.(京东公司) University of Chinese Academy of Sciences(中国科学院大学) Chongqing University of Post and Telecommunications(重庆邮电大学) Beijing University of Technology(北京工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

AI总结 针对视觉文本生成和编辑的挑战,提出基于DiT的统一框架InnoText,通过引入字体大小感知调制模块等策略,构建双语数据集,实现了在单个模型中进行文本生成和编辑,提升了生成精度和编辑质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22098 2026-07-27 cs.AI cs.LG 新提交

Reasoning Denoiser: Denoising Reasoning Traces for Hallucination Detection in Large Reasoning Models

推理去噪器:用于大型推理模型中幻觉检测的推理痕迹去噪

Junlin Fang, Do Nguyen-Thanh, Xiaogang Xu, Zhen Fang, Sean Du

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Zhejiang University(浙江大学) Australian Artificial Intelligence Institute, University of Technology Sydney(悉尼科技大学澳大利亚人工智能研究所)

AI总结 针对大型推理模型中推理痕迹含噪声影响幻觉检测的问题,提出REDE框架,利用最终答案注意力塑造表示空间去噪,经实验验证,该框架能有效提升幻觉检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12291 2026-07-27 cs.RO cs.CV 版本更新

OpenNavMap: Multi-Session Appearance-Based Topometric Mapping for Scalable Visual Navigation

OpenNavMap: 无需结构的拓扑制图通过大规模协作定位

Jianhao Jiao, Changkun Liu, Jingwen Yu, Boyi Liu, Qianyi Zhang, Yue Wang, Dimitrios Kanoulas

机构 * Robot Perception and Learning Lab, Intelligent Robotics, Department of Computer Science, University College London(机器人感知与学习实验室,智能机器人,计算机科学系,伦敦大学学院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) Institute of Robotics and Automatic Information System, Nankai University(机器人与自动信息系统研究所,南开大学) College of control science and engineering, Zhejiang University(控制科学与工程学院,浙江大学) AI Centre, Department of Computer Science, University College London(人工智能中心,计算机科学系,伦敦大学学院)

AI总结 OpenNavMap通过大规模协作定位实现无需结构的拓扑制图,利用3D几何模型进行按需重建,实现高精度的子图对齐和全局一致性。

Comments 21 pages, 20 figures, https://rpl-cs-ucl.github.io/OpenNavMap_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01101 2026-07-27 cs.CV cs.CR 版本更新

Hiding Faces in Plain Sight: Defending DeepFakes by Disrupting Face Detection

在众目睽睽下隐藏面孔:通过干扰面部检测来防御深度伪造

Delong Zhu, Yuezun Li, Baoyuan Wu, Jiaran Zhou, Zhibo Wang, Siwei Lyu

机构 * School of Computer Science and Technology, Ocean University of China(海洋大学计算机科学与技术学院) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) School of Cyber Science and Technology, Zhejiang University(浙江大学网络科学与技术学院) University at Buffalo, SUNY(纽约州立大学布法罗分校)

AI总结 研究针对面部交换深度伪造问题,提出通过干扰面部检测器来防御深度伪造的框架,核心方法是FacePoison及扩展策略VideoFacePoison,经实验验证该方法能有效阻碍深度伪造生成,降低计算开销。

Comments TDSC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21550 2026-07-24 cs.LG 新提交

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment

X³-OPD:通过策略对齐将推理能力提炼到大型音频-语言模型中

Dongjie Fu, Di Cao, Xize Cheng, Zihan Zhang, Wenxu Jia, Yifu Chen, Shengpeng Ji, Yu Zhang, Tao Jin

机构 * Tencent Hunyuan(腾讯混元) Zhejiang University(浙江大学)

AI总结 针对大型音频-语言模型逻辑推理能力不足,提出X³-OPD跨模态策略蒸馏框架,借助教师模型指导与构建的三层对称语料库训练学生模型,实验证明该方法能提升音频推理及思维链质量,还能保留模型域转移下的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21504 2026-07-24 cs.CV 新提交

Texture++: Elevating 3D Asset Texture Resolution with a Region-Aware Diffusion Model

Texture++:使用区域感知扩散模型提升3D资产纹理分辨率

Shuaiwei Wang, Shi Li, Jieting Xu, Yuchi Huo, Qi Wang, Wenting Zheng, Rengan Xie

机构 * State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) North China Electric Power University(华北电力大学)

AI总结 针对3D资产纹理分辨率低问题,提出Texture++框架,通过在UV空间重新表述超分辨率任务,采用自适应视图选择、四叉树纹理区域组织及基于扩散的超分辨率模型,提升纹理分辨率,相比现有方法显著改进了纹理细节与连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21239 2026-07-24 cs.CV 新提交

Stokes-Informed Diffusion for Robust Linear Polarization Estimation

用于稳健线性偏振估计的斯托克斯信息扩散

Yidong Luo, Chenggong Li, Yuchao Feng, Boxin Shi, Junchao Zhang, Xin Yuan

机构 * Zhejiang University(浙江大学) School of Engineering, Westlake University(西湖大学工学院) School of Automation, Central South University(中南大学自动化学院) College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院)

AI总结 研究从单张RGB图像估计线性偏振问题,提出基于穆勒形式主义的GenPolar框架,通过预测斯托克斯分量并结合可观测性感知损失监督偏振角,采用两阶段训练策略,在多数据集实验中性能达先进水平,提升下游应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21072 2026-07-24 cs.CV 新提交

Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

展示而非讲述:在生成像素而非语言模型文本中评估空间认知

Xu Wang, Kaixiang Yao, Miao Pan, Xiaohe Zhou, Xuanyu Liu, Wenqi Zhang, Xuhong Zhang

机构 * Zhejiang University(浙江大学)

AI总结 研究图像生成模型空间认知评估问题,提出ProVisE框架及SpatialGen - Bench基准,通过统一设置评估相关模型,发现图像生成模型在像素空间直接外化答案时有竞争力,文本输出语言模型在组合空间推理中有优势,揭示了两者互补优势并建立测试平台。

Comments 36 pages, 14 figures. Project page: https://zju-omniai.github.io/ProVisE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20924 2026-07-24 cs.CV 新提交

MagicMakeup: A Region-Controllable Diffusion Transformer for High-Fidelity Makeup-Transfer

MagicMakeup:用于高保真妆容转移的区域可控扩散Transformer

Ziyi Wang, Siming Zheng, Yang Yang, Shusong Xu, Hao Zhang, Bo Li, Changqing Zou, Peng-Tao Jiang

机构 * Zhejiang University(浙江大学) State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室) vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司) vivo BlueImage Lab(vivo蓝图像实验室)

AI总结 研究妆容转移中区域可控性等难题,提出MagicMakeup框架,基于空间约束和概念解缠结,用令牌对齐区域门控和跨模态感知指导实现精确编辑与概念澄清,设计数据生成管道并建立基准,提升了多方面性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17521 2026-07-24 cs.RO 版本更新

GeoWorldAD: Geometry World Action Model for Autonomous Driving

GeoWorldAD:用于自动驾驶的几何世界行动模型

Songyan Zhang, Jinyuan Tian, Hanbing Li, Daqi Liu, Hao Chen, Wenhui Huang, Fang Li, Guang Chen, Hangjun Ye, Long Chen, Kuiyuan Yang, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Xiaomi EV(小米汽车) Zhejiang University(浙江大学) Harvard University(哈佛大学)

AI总结 研究自动驾驶中安全高效规划决策问题,提出GeoWorldAD模型,通过在自我对齐3D空间中规划轨迹、用潜在未来几何标记预测场景演变,并逐步聚合多尺度几何线索,实验证明该模型在自动驾驶方面性能先进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12144 2026-07-24 cs.CV cs.RO eess.IV 版本更新

O3N: Omnidirectional Open-Vocabulary Occupancy Prediction for Urban Autonomous Agents

O3N: 全向开放词汇占用预测

Mengfei Duan, Hao Shi, Fei Teng, Guoqiang Zhao, Yuheng Zhang, Zhiyong Li, Kailun Yang

机构 * Hunan University(湖南大学) Zhejiang University(浙江大学)

AI总结 O3N通过全向感知和开放词汇方法,实现三维空间的连续表示和长距离上下文建模,提升具身智能在开放世界中的感知与建模能力。

Comments The source code will be made publicly available at https://github.com/MengfeiD/O3N

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21284 2026-07-24 cs.LG cs.AI cs.ET math.AP 版本更新

PILD: Physics-Informed Learning via Diffusion

PILD:通过扩散进行物理引导学习

Tianyi Zeng, Tianyi Wang, Jiaru Zhang, Zimo Zeng, Feiyang Zhang, Yiming Xu, Sikai Chen, Junfeng Jiao, Christian Claudel, Xinbo Chen

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) The University of Texas at Austin, Austin, TX, USA(德克萨斯大学奥斯汀分校) Zhejiang University, Hangzhou, Zhejiang, China(浙江大学) Tongji University, Shanghai, China(同济大学) University of Wisconsin-Madison, Madison, WI, USA(威斯康星大学麦迪逊分校)

AI总结 PILD通过引入虚拟残差观测和条件嵌入模块,结合物理约束与扩散模型,提升工程和科学任务中生成模型的准确性、稳定性和泛化能力。

Comments 34 pages, 13 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19036 2026-07-22 cs.CV cs.AI 新提交

CoGoal3D: Collaborative 3D Object Detection with 3D-Aware Fusion and Refinement

CoGoal3D:基于3D感知融合与优化的协作式3D目标检测

Zhihao Yang, Zhiyu Xiang, Peng Xu, Tianyu Pu, Kai Wang, Eryun Liu, Dongping Zhang, Yong Ding

机构 * Zhejiang University(浙江大学) Zhejiang Provincial Key Laboratory of Multi-Modal Communication Networks and Intelligent Information Processing(浙江省多模态通信网络与智能信息处理重点实验室) China Jiliang University(中国计量大学)

AI总结 针对V2X协作目标检测中3D检测效果不佳的问题,提出CoGoal3D框架,通过两阶段管道提取和优化3D特征,设计融合模块与辅助任务,还提出数据增强策略,在多数据集上取得新的最优性能。

Comments Accepted to ECCV 2026. 17 pages, 8 figures, 6 tables. Code: https://github.com/Megalo-f/CoGoal3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18979 2026-07-22 cs.AI 新提交

Fishing Out Free Riders: Shapley-Based Reward Attribution for Parallel Reasoning via Reinforcement Learning

揪出搭便车者:基于夏普利值的强化学习并行推理奖励归因

Wentao Zhang, Haoyu Zhang, Xinke Jiang, Yuxuan Cheng, Yuhan Pan, Miao Li, Zhipeng Qiao, Tao Feng, Zhen Tao, Dengji Zhao

机构 * ShanghaiTech University(上海科技大学) City University of Hong Kong(香港城市大学) Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhejiang University(浙江大学)

AI总结 研究大型语言模型多步推理中并行推理路径贡献难区分问题,提出基于夏普利值的强化学习框架并行夏普利值方法,通过量化边际贡献等实现按比例分配奖励,实验证明其优于基线且能改进多路径推理。

Comments 19 pages, 4 figures, 8 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18915 2026-07-22 cs.CL 新提交

Reasoning Error from Known Fact: Step-Level Self-Consistency Group Relative Policy Optimization for LLM

已知事实导致的推理错误:针对大语言模型的步骤级自一致性组相对策略优化

Xiaomeng Hu, Jiaqi Hu, Hao Chen, Qi Zhang, Zhanming Shen, Wentao Ye, Junbo Zhao

机构 * Zhejiang University(浙江大学)

AI总结 针对大语言模型推理中因上下文干扰产生事实错误的问题,提出步骤级自一致性组相对策略优化(SSC - GRPO),通过计算自一致性分数分配步骤级奖励,在数学推理基准和幻觉排行榜上取得领先,为检测和减轻幻觉提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18859 2026-07-22 cs.AI 新提交

PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents

PhoenixRepair:重新思考软件代理中的修复策略探索

Tianyue Jiang, Yanlin Wang, Xin He, Daya Guo, Jiachi Chen, Ming Wen, Ensheng Shi, Xilin Liu, Yuchi Ma, Guanbin Li

机构 * Zhejiang University(浙江大学) Huazhong University of Science and Technology(华中科技大学) Huawei CodeArts Model Team(华为代码艺术模型团队)

AI总结 研究针对现有软件代理修复策略探索不足的问题,提出PhoenixRepair多代理框架,通过多位置采样、迭代反思优化等扩大搜索空间,实验表明该框架在解决率和故障定位精度上有提升,实现了7.8%的相对改进及76.0%的最高解决率Pass@1。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18827 2026-07-22 cs.CV 新提交

Open-Vocabulary Gaze Object Prediction: Benchmark and Method

开放词汇注视对象预测:基准与方法

Binglu Wang, Sensen Niu, Ying Chen, Guangyu Guo

机构 * Xi’an University of Architecture and Technology(西安建筑科技大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Zhejiang University(浙江大学)

AI总结 研究注视对象预测问题,提出基于文本驱动对象发现和注视引导选择模块的框架,并引入梯度信息选择调整,构建含86个自然类别的基准,所提模型在开放和封闭词汇设置中均表现出色。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18716 2026-07-22 cs.CV 新提交

Continual Video-MLLM Adaptation over Evolving Domains

在不断演变的领域上进行连续视频 - MLLM 适应

Rui Cheng, Meixing Shi, Yuxiang Cai, Jingcai Guo, Jianwei Yin, Zhi Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Hong Kong Polytechnic University(香港理工大学) The University of Southern Queensland(南昆士兰大学)

AI总结 研究视频多模态大语言模型对不断演变领域的适应问题,提出分布感知专家路由框架 DAER,通过保持领域隔离的轻量级专家、引入多种路由和优化机制,在域增量基准上评估,结果优于现有方法。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18304 2026-07-22 cs.LG 新提交

TD-DPO: Difference-Aware Preference Optimization for Mitigating Sycophancy in Clinical Autism Intervention Dialogue

TD-DPO:用于减轻临床自闭症干预对话中谄媚行为的差异感知偏好优化

Shuzhong Lai, Junhong Lai, Chenxi Li, Qing Zhou, Haifeng Li, Gang Pan, Lin Yao, Yueming Wang

机构 * Nanhu Brain-Computer Interface Institute(南湖脑机接口研究所) MOE Frontiers Science Center for Brain and Brain-Machine Integration, Zhejiang University(浙江大学脑与脑机融合教育部前沿科学中心) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Children’s Hospital Zhejiang University School of Medicine(浙江大学医学院附属儿童医院) State Key Laboratory of Brain-Machine Intelligence(脑机智能技术国家重点实验室) Department of Neurobiology, Affiliated Mental Health Center and Hangzhou Seventh People’s Hospital, Zhejiang University School of Medicine(浙江大学医学院附属精神卫生中心和杭州市第七人民医院神经生物学系)

AI总结 研究针对大语言模型在自闭症干预对话中的谄媚问题,提出最小编辑数据增强策略及令牌级差异直接偏好优化方法,通过加权差异令牌、降权共享令牌抑制背景漂移,经实验验证该方法能在减轻谄媚与保留干预能力间达较好平衡。

Comments commited to EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18240 2026-07-22 cs.AI 新提交

Calibrated Selective Fact-Checking via Evidence Chain Evaluation

通过证据链评估进行校准的选择性事实核查

Dekun Yang

机构 * Zhejiang University(浙江大学)

AI总结 针对大语言模型事实核查的可靠性问题,提出证据链评估框架ECE,通过网络搜索等收集证据并返回结构化裁决。在ECE - Bench上有较好表现,虽总体校准指标未超最强基线,但实现了选择性预测权衡,弃权可处理弱证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18198 2026-07-21 cs.LG cs.CV 新提交

Three-Body Scattering for Generative Modeling

用于生成建模的三体散射

Peng Sun, Zhenglin Cheng, Deyuan Liu, Jun Xie, Xinyi Shang, Tao Lin

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) University College London(伦敦大学学院)

AI总结 研究提出三体散射建模(TBSM)用于生成,将能量距离转化为特定相互作用,为单步生成器提供监督。通过在线跟踪条件期望减少噪声,在ImageNet-256上训练单步生成器取得良好结果,确立了跟踪散射作为高维单步生成的途径。

Comments 31 pages, 5 figures, and 4 tables. Code: https://github.com/sp12138/TBSM

详情

展开后加载摘要…

URL PDF HTML 收藏