arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2931
2502.01989 2026-02-09 cs.LG

VFScale: Intrinsic Reasoning through Verifier-Free Test-time Scalable Diffusion Model

VFScale: 通过无验证器的测试时可扩展扩散模型实现内在推理

Tao Zhang, Jia-Shu Pan, Ruiqi Feng, Tailin Wu

机构 * Zhejiang University(浙江大学) Department of Artificial Intelligence, School of Engineering, Westlake University(人工智能系,工程学院,西湖大学)

AI总结 VFScale通过无验证器的测试时可扩展扩散模型实现可扩展的内在推理,解决了扩散模型在复杂推理任务中的两大挑战。

Comments ICLR 2026. 30 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05885 2026-02-09 cs.IR cs.AI

An item is worth one token in Multimodal Large Language Models-based Sequential Recommendation

在基于多模态大语言模型的序列推荐中,一个项目相当于一个标记

Qiyong Zhong, Jiajie Su, Ming Yang, Yunshan Ma, Xiaolin Zheng, Chaochao Chen

机构 * Zhejiang University(浙江大学) Singapore Management University(新加坡国立管理学院)

AI总结 Speeder通过多模态表示压缩、模态感知渐进优化和序列位置感知增强,提升多模态大语言模型在序列推荐中的效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05633 2026-02-06 cs.CL

CASTLE: A Comprehensive Benchmark for Evaluating Student-Tailored Personalized Safety in Large Language Models

CASTLE:一个评估大语言模型学生定制个性化安全性的综合基准

Rui Jia, Ruiyi Lan, Fengrui Liu, Zhongxiang Dai, Bo Jiang, Jing Shao, Jingyuan Chen, Guandong Xu, Fei Wu, Min Zhang

机构 * East China Normal University(华东师范大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Education University of Hong Kong(香港教育大学)

AI总结 CASTLE基准通过评估学生定制个性化安全性,揭示大语言模型在不同学生属性下的安全缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05605 2026-02-06 cs.LG cs.AI cs.CV

Shiva-DiT: Residual-Based Differentiable Top-$k$ Selection for Efficient Diffusion Transformers

Shiva-DiT:基于残差的可微Top-k选择用于高效扩散变换器

Jiaji Zhang, Hailiang Zhao, Guoxuan Zhu, Ruichao Sun, Jiaju Wu, Xinkui Zhao, Hanlin Tang, Weiyi Lu, Kan Liu, Tao Lan, Lin Qu, Shuiguang Deng

机构 * AIOS, Alibaba Group(阿里云人工智能实验室,阿里巴巴集团) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Nanyang Technological University(南洋理工大学)

AI总结 Shiva-DiT通过基于残差的可微Top-k选择,在保持端到端可学习性的同时,实现了高效扩散变换器的剪枝,提升了计算效率并减少了硬件开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05429 2026-02-06 cs.AI cs.CV

M$^2$-Miner: Multi-Agent Enhanced MCTS for Mobile GUI Agent Data Mining

M$^2$-Miner: 多智能体增强的MCTS用于移动GUI智能体数据挖掘

Rui Lv, Juncheng Mo, Tianyi Chu, Chen Rao, Hongyi Jing, Jiajie Teng, Jiafu Chen, Shiqi Zhang, Liangzi Ding, Shuo Fang, Huaizhong Lin, Ziqiang Dang, Chenguang Ma, Lei Zhao

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

AI总结 M$^2$-Miner通过多智能体增强MCTS方法,实现了低成本、高效率的移动GUI智能体数据挖掘,提升了数据质量和挖掘效果。

Comments Accepted by ICLR 2026. Supplementary material is included at the end of the main paper (16 pages, 15 figures, 2 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23646 2026-02-06 cs.CV

Active Perception Agent for Omnimodal Audio-Video Understanding

多模态音频视频理解的主动感知代理

Keda Tao, Wenjie Du, Bohan Yu, Weiqiang Wang, Jian Liu, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学)

AI总结 OmniAgent通过动态规划和音频引导感知范式,实现多模态细粒度推理,无需训练即超越现有模型性能。

Comments Website:https://kd-tao.github.io/OmniAgent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03999 2026-02-06 cs.CL

LH-Deception: Simulating and Understanding LLM Deceptive Behaviors in Long-Horizon Interactions

LH-Deception:模拟和理解长周期交互中大语言模型的欺骗行为

Yang Xu, Xuanming Zhang, Samuel Yeh, Jwala Dhamala, Ousmane Dia, Rahul Gupta, Sharon Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Zhejiang University(浙江大学) Amazon AGI(亚马逊人工智能研究院)

AI总结 LH-Deception通过多智能体系统模拟长周期交互中的LLM欺骗行为,揭示欺骗的模型依赖性和对信任的侵蚀,为真实场景下的LLM评估提供基础。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17001 2026-02-06 cs.LG

Should Bias be Eliminated? A General Framework to Use Bias for OOD Generalization

应该消除偏见吗?一种利用偏见进行OOD泛化的通用框架

Yan Li, Yunlong Deng, Zijian Li, Anpeng Wu, Zeyu Tang, Kun Zhang, Guangyi Chen

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学)

AI总结 本文提出了一种通用框架,通过利用偏见来提升OOD泛化的性能,通过生成模型识别偏见因素并构建偏见感知预测器,结合不同环境的预测器以提高鲁棒性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05251 2026-02-06 cs.LG

TADS: Task-Aware Data Selection for Multi-Task Multimodal Pre-Training

TADS: 任务感知的数据选择用于多任务多模态预训练

Guanjie Cheng, Boyi Li, Lingyu Sun, Mengying Zhu, Yangyang Wu, Xinkui Zhao, Shuiguang Deng

机构 * School of Software Technology, Zhejiang University(浙江大学软件技术学院) School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 TADS通过整合内在质量、任务相关性和分布多样性,提升多任务多模态预训练的数据效率,实现更高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04893 2026-02-06 cs.LG cs.AI cs.CR

A Causal Perspective for Enhancing Jailbreak Attack and Defense

从因果视角提升对抗攻击与防御

Licheng Pan, Yunsheng Lu, Jiexi Liu, Jialing Tao, Haozhe Feng, Hui Xue, Zhixuan Chu, Kui Ren

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Alibaba Group(阿里巴巴集团) University of Chicago(芝加哥大学)

AI总结 本文提出Causal Analyst框架,通过因果分析提升大语言模型的对抗攻击与防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11007 2026-02-06 cs.CV cs.AI cs.LG

VisMem: Latent Vision Memory Unlocks Potential of Vision-Language Models

VisMem: 通过潜在视觉记忆解锁视觉-语言模型的潜力

Xinlei Yu, Chengming Xu, Guibin Zhang, Zhangquan Chen, Yudong Zhang, Yongbo He, Peng-Tao Jiang, Jiangning Zhang, Xiaobin Hu, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) vivo

AI总结 VisMem通过引入动态潜在视觉记忆模块,提升视觉-语言模型在复杂视觉任务中的性能,实现感知准确性和语义一致性之间的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04735 2026-02-05 cs.LG cs.AI cs.CL cs.CY cs.IR

From Data to Behavior: Predicting Unintended Model Behaviors Before Training

从数据到行为:在训练前预测未预料的模型行为

Mengru Wang, Zhenqian Xu, Junfeng Fang, Yunzhi Yao, Shumin Deng, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

AI总结 提出MDF方法,通过数据均值表示预测模型预训练阶段的潜在偏见和安全风险,实现高效检测。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04457 2026-02-05 stat.ME cs.LG

Journey to the Centre of Cluster: Harnessing Interior Nodes for A/B Testing under Network Interference

集群中心之旅:利用内部节点在存在网络干扰下的A/B测试

Qianyi Chen, Anpeng Wu, Bo Li, Lu Deng, Yong Wang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Tencent Inc.(腾讯公司)

AI总结 本文提出了一种基于内部节点的A/B测试方法,通过直接平均内部节点来降低方差,并利用反事实预测器调整协变量分布偏移,以提高估计精度。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04441 2026-02-05 cs.CV

SynthVerse: A Large-Scale Diverse Synthetic Dataset for Point Tracking

SynthVerse:一个大规模多样化合成数据集用于点跟踪

Weiguang Zhao, Haoran Xu, Xingyu Miao, Qin Zhao, Rui Zhang, Kaizhu Huang, Ning Gao, Peizhou Cao, Mingze Sun, Mulin Yu, Tao Lu, Linning Xu, Junting Dong, Jiangmiao Pang

机构 * University of Liverpool(利物浦大学) Zhejiang University(浙江大学) Durham University(杜伦大学) Beihang University(北京航空航天大学) Duke Kunshan University(杜克昆山大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Xi’an Jiaotong University(西安交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 SynthVerse通过提供大规模多样化合成数据集,提升点跟踪任务的泛化能力和评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03645 2026-02-04 cs.LG

Reinforcement Fine-Tuning for History-Aware Dense Retriever in RAG

强化微调用于历史感知密集检索器在RAG中

Yicheng Zhang, Zhen Qin, Zhaomin Wu, Wenqi Zhang, Shuiguang Deng

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院) Ningbo Global Innovation Center, Zhejiang University, Ningbo, China(浙江大学宁波全球创新中心) Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系)

AI总结 本文提出通过强化学习优化RAG中的检索器,通过引入随机采样和历史状态缓解状态别名问题,提升检索性能。

Comments On going work. Codes are released at https://github.com/zyc140345/HARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13930 2026-02-04 cs.LG

ME-IGM: Individual-Global-Max in Maximum Entropy Multi-Agent Reinforcement Learning

ME-IGM:最大熵多智能体强化学习中的个体-全局-最大

Wen-Tse Chen, Yuxuan Li, Shiyu Huang, Jiayu Chen, Jeff Schneider

机构 * Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) XPeng Inc.(XPeng公司) The University of Hong Kong(香港大学) INFIFORCE Intelligent Tech. Co., Ltd.(INFIFORCE智能科技有限公司)

AI总结 ME-IGM是一种结合最大熵探索与IGM条件的新型多智能体强化学习算法,通过解决局部策略与联合策略不一致问题,提升探索效率和性能。

Comments Published in the Proceedings of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

Journal ref Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), Paphos, Cyprus, May 25 - 29, 2026, IFAAMAS, 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03485 2026-02-04 cs.CL cs.AI cs.LG

Self-Verification Dilemma: Experience-Driven Suppression of Overused Checking in LLM Reasoning

自我验证困境:经验驱动的过度验证抑制在大语言模型推理中

Quanyu Long, Kai Jie Jiang, Jianda Chen, Xu Guo, Leilei Gan, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

AI总结 本文提出了一种经验驱动的测试时框架,通过抑制过度的自我验证步骤,减少大语言模型推理中的token使用,同时保持或提升准确性。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03373 2026-02-04 cs.CV

Unifying Watermarking via Dimension-Aware Mapping

通过维度感知映射统一水印技术

Jiale Meng, Runyi Hu, Jie Zhang, Zheming Lu, Ivor Tsang, Tianwei Zhang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

AI总结 DiM通过维度感知映射统一水印技术,在视频领域实现不同维度嵌入与提取以提升水印能力。

Comments 29 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03263 2026-02-04 cs.AI

CSR-Bench: A Benchmark for Evaluating the Cross-modal Safety and Reliability of MLLMs

CSR-Bench: 一种评估多模态大语言模型跨模态安全性和可靠性的基准

Yuxuan Liu, Yuntian Shi, Kun Wang, Haoting Shen, Kun Yang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

AI总结 CSR-Bench通过四个压力测试模式评估多模态大语言模型的跨模态安全性和可靠性,发现模型在多模态输入下表现下降,且安全提升可能源于拒绝导向的启发式方法。

Comments 25 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03200 2026-02-04 cs.CV cs.AI

Hand3R: Online 4D Hand-Scene Reconstruction in the Wild

Hand3R: 在线4D手-场景重建

Wendi Hu, Haonan Zhou, Wenhao Hu, Gaoang Wang

机构 * Zhejiang University(浙江大学)

AI总结 Hand3R通过结合预训练手专家和4D场景基础模型,实现了在线4D手-场景重建,无需离线优化,提升了手部和场景的联合重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03130 2026-02-04 cs.CV cs.CE

FinMTM: A Multi-Turn Multimodal Benchmark for Financial Reasoning and Agent Evaluation

FinMTM:面向金融推理和智能体评估的多轮多模态基准

Chenxi Zhang, Ziliang Gan, Liyun Zhu, Youwei Pang, Qing Zhang, Rongjunchen Zhang

机构 * HiThink Research(HiThink研究机构) Wuhan University(武汉大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Shanghai Institute of Technology(上海理工大学)

AI总结 FinMTM提出一个多轮多模态基准,用于评估金融推理和智能体任务,通过多样化数据和任务设计,揭示了VLMs在视觉感知、推理和复杂工作流中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02598 2026-02-04 physics.soc-ph cs.AI cs.CL cs.CY cs.MA

Social Catalysts, Not Moral Agents: The Illusion of Alignment in LLM Societies

社交催化剂,而非道德主体:LLM社会中的对齐幻觉

Yueqing Hu, Yixuan Jiang, Zehua Jiang, Xiao Wen, Tianhong Wang

机构 * Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) School of Philosophy, Anhui University(安徽大学哲学学院) Department of Psychology and Behavioral Sciences, Zhejiang University(浙江大学心理学与行为科学系) Mental Health Education Center, North China Electric Power University(华北电力大学心理健康教育中心)

AI总结 本研究探讨了锚定智能体在促进合作中的作用,发现其效果源于战略合规而非真实价值对齐,揭示了人工社会中行为修改与真实价值对齐之间的差距。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02538 2026-02-04 cs.LG cs.CL cs.CV

Enhancing Post-Training Quantization via Future Activation Awareness

通过未来激活意识增强后训练量化

Zheqi Lv, Zhenxuan Fan, Qi Tian, Wenqiao Zhang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Tencent(腾讯)

AI总结 通过利用未来层激活信息,提出Future-Aware Quantization方法,有效提升后训练量化效果,适用于边缘部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01661 2026-02-04 cs.CV

From Frames to Sequences: Temporally Consistent Human-Centric Dense Prediction

从帧到序列:面向时间一致的人本密集预测

Xingyu Miao, Junting Dong, Qin Zhao, Yuhang Yang, Junhao Chen, Yang Long

机构 * Durham University(杜伦大学) Shanghai AI Lab(上海人工智能实验室) Zhejiang University(浙江大学) USTC(中科大) Tsinghua University(清华大学)

AI总结 本文提出了一种可扩展的合成数据管道,结合静态预训练与动态序列监督,训练出统一的ViT密集预测器,以实现时间一致的人本密集预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00708 2026-02-04 cs.RO

USS-Nav: Unified Spatio-Semantic Scene Graph for Lightweight UAV Zero-Shot Object Navigation

USS-Nav: 一体化空间语义场景图用于轻量级无人机零样本物体导航

Weiqi Gai, Yuman Gao, Yuan Zhou, Yufan Xie, Zhiyang Liu, Yuze Wu, Xin Zhou, Fei Gao, Zhijun Meng

机构 * School of Aeronautic Science and Engineering, Beihang University, Beijing 100191, China(北京航空航天大学航空科学与工程学院) State Key Laboratory of Industrial Control Technology, Zhejiang University, Hangzhou 310027, China(浙江大学工业控制技术状态重点实验室) Differential Robotics, Hangzhou 311121, China(杭州差分机器人)

AI总结 USS-Nav通过构建一体化空间语义场景图,实现轻量级无人机在未知环境中的高效零样本物体导航,提升计算效率和实时更新能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14565 2026-02-04 cs.CV

DiffVL: Diffusion-Based Visual Localization on 2D Maps via BEV-Conditioned GPS Denoising

DiffVL: 基于扩散模型的2D地图视觉定位 via BEV条件化GPS去噪

Li Gao, Hongyang Sun, Liu Liu, Yunhao Li, Yang Cai

机构 * AMAP, Alibaba Group(阿里巴巴集团AMAP) Zhejiang University(浙江大学)

AI总结 DiffVL通过将视觉定位转化为GPS去噪任务,利用扩散模型在不依赖HD地图的情况下实现亚米级精度的可扩展定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11361 2026-02-04 cs.AI

MAPGD: Multi-Agent Prompt Gradient Descent for Collaborative Prompt Optimization

MAPGD:多智能体提示梯度下降用于协作提示优化

Yichen Han, Yuhang Han, Siteng Huang, Guanyu Liu, Zhengpeng Zhou, Bojun Liu, Yujia Zhang, Isaac N Shi, Lewei He, Tianyu Shi

机构 * South China Normal University(华南师范大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) University of Macau(澳门大学) University of Sydney(悉尼大学) Silicon Sapiens LLC University of Alberta(阿尔伯塔大学) University of Toronto(多伦多大学)

AI总结 MAPGD通过多智能体协作机制提升提示优化的鲁棒性和效率,结合梯度融合与动态加权实现高效且可解释的优化方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02486 2026-02-03 cs.CL cs.AI

RE-TRAC: REcursive TRAjectory Compression for Deep Search Agents

RE-TRAC: 递归轨迹压缩用于深度搜索代理

Jialiang Zhu, Gongrui Zhang, Xiaolong Ma, Lin Xu, Miaosen Zhang, Ruiqi Yang, Song Wang, Kai Qiu, Zhirong Wu, Qi Dai, Ruichun Ma, Bei Liu, Yifan Yang, Chong Luo, Zhengyuan Yang, Linjie Li, Lijuan Wang, Weizhu Chen, Xin Geng, Baining Guo

机构 * Southeast University(东南大学) Waseda University(早稻田大学) Tsinghua University(清华大学) Brown University(布朗大学) Zhejiang University(浙江大学) Microsoft(微软)

AI总结 Re-TRAC通过递归轨迹压缩提升深度搜索代理的效率,实现跨轨迹探索与全局规划,显著优于ReAct框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02361 2026-02-03 cs.SE cs.AI

SWE-Universe: Scale Real-World Verifiable Environments to Millions

SWE-Universe: 将现实可验证环境扩展至百万级

Mouxiang Chen, Lei Zhang, Yunlong Feng, Xuwu Wang, Wenting Zhao, Ruisheng Cao, Jiaxi Yang, Jiawei Chen, Mingze Li, Zeyao Ma, Hao Ge, Zongmeng Zhang, Zeyu Cui, Dayiheng Liu, Jingren Zhou, Jianling Sun, Junyang Lin, Binyuan Hui

机构 * Qwen Team, Alibaba Group(通义团队,阿里巴巴集团) Zhejiang University(浙江大学)

AI总结 SWE-Universe通过高效框架构建百万级现实可验证环境,提升编码代理训练效果。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02212 2026-02-03 cs.CV

MAIN-VLA: Modeling Abstraction of Intention and eNvironment for Vision-Language-Action Models

MAIN-VLA: 为视觉语言动作模型建模意图和环境的抽象

Zheyuan Zhou, Liang Du, Zixun Sun, Xiaoyu Zhou, Ruimin Ye, Qihao Chen, Yinda Chen, Lemiao Qiu

机构 * IEG, Tencent(腾讯人工智能实验室) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学)

AI总结 MAIN-VLA通过建模意图和环境的抽象,提升视觉语言动作模型在复杂动态环境中的决策质量、泛化能力和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏