arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2909
2506.19117 2026-05-26 cs.CV

PrITTI: Primitive-based Generation of Controllable and Editable 3D Semantic Urban Scenes

PrITTI: 基于基元的可控可编辑3D语义城市场景生成

Christina Ourania Tze, Daniel Dauner, Yiyi Liao, Dzmitry Tsishkou, Andreas Geiger

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Zhejiang University(浙江大学) Noah’s Ark Lab, Huawei(华为诺亚实验室) KE:SAI - Kyutai ELLIS Scalable Autonomous Intelligence(KE:SAI - 韩国ELLIS可扩展自主智能)

AI总结 提出PrITTI,一种利用矢量化对象基元和栅格化地面表面的混合表示,通过潜在扩散模型实现高质量、可控且可编辑的3D语义城市场景生成。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24497 2026-05-26 cs.AI

Reasoning as an Attack Surface: Adaptive Evolutionary CoT Jailbreaks for LLMs

推理作为攻击面:针对大语言模型的自适应进化思维链越狱方法

Jianan Li, Simeng Qin, Xiaojun Jia, Lionel Z. Wang, Tianhang Zheng, Xiaoshuang Jia, Yang Liu, Xiaochun Cao

机构 * Nanyang Technological University, Singapore(南洋理工大学) The University of Hong Kong, Hong Kong, China(香港大学) The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学) Zhejiang University, Zhejiang, China(浙江大学) Renmin University of China, Beijing, China(中国人民大学) Sun Yat-sen University, Guangdong, China(中山大学) Northeastern University(东北大学) Hebei Key Laboratory of Data Science and Knowledge Management(河北省数据科学与知识管理重点实验室)

AI总结 提出自适应进化思维链越狱框架AE-CoT,通过教师角色扮演重写有害目标、分解推理片段、多代进化搜索及自适应变异率控制,有效生成高破坏性越狱提示,在多个模型和数据集上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24492 2026-05-26 cs.CV

Med-R2: An Adversarial Benchmark for Evidence-Grounded Reasoning in Medical VLMs

Med-R2: 面向医学视觉语言模型中基于证据推理的对抗性基准

Wen Ma, Fucheng Niu, Zhiting Fan, Zikai Xiao, Jiaxiang Liu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Guangdong Institute of Intelligence Science and Technology(广东智能科学技术研究院)

AI总结 提出 Med-R2 Bench,一个分层对抗性基准,通过逐步QA任务和对抗扰动评估医学VLM在临床工作流中的视觉证据推理鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24489 2026-05-26 cs.AI q-bio.BM

TIGER: Text-Informed Generalized Enzyme-Reaction Retrieval

TIGER:文本引导的通用酶-反应检索

Yuhang Zhang, Keyan Ding, Peilin Chen, Han Liu, Can Lin, Ruixi Chen, Shiqi Wang, Qi Song

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

AI总结 提出TIGER框架,利用蛋白质到文本生成模型提取文本语义知识,通过动态门控网络融合序列特征,实现酶与反应的双向检索,显著提升跨任务泛化性和鲁棒性。

Comments Accepted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24433 2026-05-26 cs.RO cs.LG

Smoother Action Chunking Flow Policy via Prior-Corrected Orthogonal Trust-Region Guidance

基于先验校正的正交信任区域引导的平滑动作块流策略

Kai Fang, Hailong Pei, Xuemin Chi

机构 * South China University of Technology(华南理工大学) Zhejiang University(浙江大学)

AI总结 提出POTR方法,通过先验校正权重和正交信任区域约束,改善流匹配机器人策略中动作块推理的边界不连续性和横向扰动,提升成功率和运动平滑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24012 2026-05-26 cs.CV

Deep Learning-Based Automated Quantification of TIMI Myocardial Perfusion Frame Count (DL-TMPFC) from Coronary Angiography: A Novel Framework for Rapid Assessment of Microvascular Dysfunction

基于深度学习的TIMI心肌灌注帧数自动量化(DL-TMPFC):一种快速评估微血管功能障碍的新框架

Si Li, Yuanqing He, Chenkai Hu, Xiaogang Guo, Huay-Cheem Tan, Chieh Yang Koo, Xuan Zhang, Lei He, Jingyuan Zeng, Shan Xiao

机构 * School of Artificial Intelligence and Digital Economy Industry, Guangzhou Institute of Science and Technology(人工智能与数字经济发展学院,广州科学研究院) Department of Cardiology, Second Affiliated Hospital, Jiangxi Medical College, Nanchang University(南华大学江西医学院心内科,第二附属医院) Department of Cardiology, First Affiliated Hospital of Zhejiang University School of Medicine(浙江大学医学院附属第一医院心内科) Department of Cardiology, National University Heart Centre(国立大学心脏中心心内科)

AI总结 提出DL-TMPFC框架,结合狭窄检测网络和区域感知分割网络,从冠状动脉造影中自动计算TIMI心肌灌注帧数,实现微血管功能障碍的客观量化,验证显示与专家手动测量高度一致。

Comments 15 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22984 2026-05-26 cs.AI

Why Your Deep Research Agent Fails? On Hallucination Evaluation in Full Research Trajectory

为什么你的深度研究智能体会失败?关于完整研究轨迹中的幻觉评估

Yuhao Zhan, Tianyu Fan, Linxuan Huang, Zirui Guo, Chao Huang

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

AI总结 针对深度研究智能体(DRA)在完整研究轨迹中累积的幻觉问题,提出从结果评估转向过程感知评估的PING分类法和细粒度评估框架,并构建DeepHalluBench基准,实验揭示系统性的可靠性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23764 2026-05-26 cs.CV cs.CL

MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence

MMSI-Bench:多图像空间智能基准

Sihan Yang, Runsen Xu, Yiman Xie, Sizhe Yang, Mo Li, Jingli Lin, Chenming Zhu, Xiaochen Chen, Haodong Duan, Xiangyu Yue, Dahua Lin, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Shanghai Jiaotong University(上海交通大学) University of Hong Kong(香港大学) Beijing Normal University(北京师范大学)

AI总结 提出MMSI-Bench基准,通过1000道精心设计的VQA问题评估多图像空间推理能力,发现现有模型准确率远低于人类。

Comments ICLR 2026 Camera ready. 38 pages. Project page: https://runsenxu.com/projects/MMSI_Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13878 2026-05-26 cs.LG cs.CL

InfiFPO: Implicit Model Fusion via Preference Optimization in Large Language Models

InfiFPO:通过偏好优化实现大型语言模型的隐式模型融合

Yanggan Gu, Yuanyi Wang, Zhaoyi Yan, Yiming Zhang, Qi Zhou, Fei Wu, Hongxia Yang

机构 * The Hong Kong Polytechnic University (PolyU)(香港理工大学) Zhejiang University(浙江大学) PolyU-Daya Bay Technology and Innovation Research Institute(香港理工大学-大亚湾技术与创新研究院)

AI总结 提出InfiFPO方法,通过将DPO中的参考模型替换为融合源模型,在序列级别合成多源概率,实现隐式模型融合,从而在偏好对齐阶段有效融合多个LLM并提升性能。

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23780 2026-05-25 cs.AI

Beyond Binary Edits Robust Multimodal Knowledge Editing with Adversarial Subspace Alignment

超越二元编辑:基于对抗子空间对齐的鲁棒多模态知识编辑

Haoyuan Wang, Xiaohao Liu, Jiajie Su, Jianmao Xiao, Chaochao Chen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Jiangxi Normal University(江西师范大学)

AI总结 针对多模态大语言模型知识编辑泛化性不足的问题,提出对抗子空间对齐方法(ASAM),通过潜在对抗鲁棒化(LAR)和秩约束子空间学习(RCSL)实现鲁棒的多模态知识编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23672 2026-05-25 cs.CV

RiGS: Rigid-aware 4D Gaussian Splatting from a Single Monocular Video

RiGS: 从单目视频中的刚性感知4D高斯泼溅

Chenyu Wu, Wanhua Li, Zhu-Tian Chen, Hanspeter Pfister

机构 * Harvard University(哈佛大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) University of Minnesota - Twin Cities(明尼苏达大学-双城分校)

AI总结 提出RiGS,通过静态、刚性和瞬态三种高斯原语分别建模不同时间尺度的运动,并利用目标动态掩码和场景流引导实现单目视频动态场景重建,在新视角合成任务上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23201 2026-05-25 cs.SD cs.MM

MixFake: Benchmarking and Enhancing Audio Deepfake Detection in Diverse Real-world Mixed Audio

MixFake: 在多样真实混合音频中基准测试和增强音频深度伪造检测

Qingcao Li, Yipeng Lin, Weichen Lian, Zhongjie Ba, Peng Cheng, Zhichao Lian

机构 * School of Cyber Science and Engineering, Nanjing University of Science and Technology, Nanjing, China(南京理工大学信息科学与工程学院) The State Key Laboratory of Blockchain and Data Security, Zhejiang University, Hangzhou, China(浙江大学区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security, Hangzhou, China(杭州高新技术区(滨江)区块链与数据安全研究院)

AI总结 针对真实场景中语音与背景音乐或噪声混合导致检测困难的问题,提出MixFake基准数据集和多流提示微调框架,通过注入信号级先验有效捕获声学伪影,在复杂背景检测中实现7.72%的绝对提升。

Comments Accepted by ICME2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22272 2026-05-25 cs.RO cs.CV

Imagine2Real: Towards Zero-shot Humanoid-Object Interaction via Video Generative Priors

Imagine2Real: 通过视频生成先验实现零样本人形机器人-物体交互

Jiahe Chen, ZiRui Wang, Feiyu Jia, Xiao Chen, Xiaojie Niu, Weishuai Zeng, Tianfan Xue, Xiaowei Zhou, Jiangmiao Pang, Jingbo Wang

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出Imagine2Real框架,利用视频生成先验和4D点轨迹统一表示,通过稀疏关键点跟踪和行为基础模型潜空间,实现零样本人形机器人-物体交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01018 2026-05-25 cs.CV

WildTableBench: Benchmarking Multimodal Foundation Models on Table Understanding In the Wild

WildTableBench:在真实场景中评估多模态基础模型的表格理解能力

Junzhe Huang, Xiaoxiao Sun, Yan Yang, Yuxuan Hou, Ruotian Zhang, Sirui Li, Hehe Fan, Serena Yeung-Levy, Xin Yu

机构 * The University of Queensland(昆士兰大学) Stanford University(斯坦福大学) The Australian National University(澳大利亚国立大学) Zhejiang University(浙江大学) Murdoch University(莫纳什大学) The University of Adelaide(阿德莱德大学)

AI总结 提出WildTableBench基准,包含402张真实场景表格图像和928个问答对,评估21个前沿多模态模型,仅一个模型准确率超50%,揭示模型在结构感知和推理方面的持续弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13893 2026-05-25 cs.CL

InfiGFusion: Graph-on-Logits Distillation via Efficient Gromov-Wasserstein for Model Fusion

InfiGFusion:通过高效Gromov-Wasserstein进行图对逻辑蒸馏的模型融合

Yuanyi Wang, Zhaoyi Yan, Yiming Zhang, Qi Zhou, Yanggan Gu, Fei Wu, Hongxia Yang

机构 * The Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学) Daya Bay Technology and Innovation Research Institute(大亚湾技术与创新研究院)

AI总结 提出InfiGFusion,一种结构感知的模型融合框架,通过图对逻辑蒸馏损失显式建模词汇维度间的语义依赖,并利用排序闭式近似将Gromov-Wasserstein距离的计算复杂度从O(n^4)降至O(n log n),在多个基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22878 2026-05-25 cs.AI cs.CL cs.IR cs.LG

SciAtlas: A Large-Scale Knowledge Graph for Automated Scientific Research

SciAtlas:面向自动化科学研究的大规模知识图谱

Shuofei Qiao, Yunxiang Wei, Jiazheng Fan, Bin Wu, Busheng Zhang, Mengru Wang, Yuqi Zhu, Ningyu Zhang, Keyan Ding, Qiang Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) University College London(伦敦大学学院)

AI总结 为应对学术信息爆炸和跨学科整合困难,提出包含4300万论文、1.57亿实体和30亿三元组的多学科知识图谱SciAtlas,并开发神经符号检索算法,实现从语义匹配到确定性关联发现的转变,降低推理成本。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22829 2026-05-25 cs.IR cs.AI

LFRAG: Layout-oriented Fine-grained Retrieval-Augmented Generation on Multimodal Document Understanding

LFRAG:面向布局的多模态文档理解中的细粒度检索增强生成

Yifan Zhu, Yu Mi, Yue Lu, Yanchu Guan, Zhixuan Chu

机构 * Zhejiang University(浙江大学) Hangzhou High-Tech Zone (Binjiang) Zhejiang University Institute of Blockchain and Data Security(杭州高新技术区(滨江)浙江大学区块链与数据安全研究院)

AI总结 提出LFRAG框架,通过布局分割和语义-布局融合编码器实现从页面级到块级的细粒度检索,提升多模态文档检索精度并减少生成冗余,在LFDocQA基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22777 2026-05-22 cs.CV

DecQ: Detail-Condensing Queries for Enhanced Reconstruction and Generation in Representation Autoencoders

DecQ:用于增强表示自编码器中重建和生成的细节压缩查询

Tianhang Wang, Yitong Chen, Wei Song, Zuxuan Wu, Min Li, Jiaqi Wang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Westlake University(西湖大学)

AI总结 本文提出DecQ框架,通过引入轻量级细节压缩查询,有效缓解了表示自编码器中重建与生成之间的权衡问题,提升了重建质量和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22645 2026-05-22 cs.AI

AtelierEval: Agentic Evaluation of Humans & LLMs as Text-to-Image Prompters

AtelierEval: 人类与LLM作为文本到图像提示器的代理评估

Hanjun Luo, Zhimu Huang, Sylvia Chung, Yiran Wang, Yingbin Jin, Jialin Li, Jiang Li, Xinfeng Li, Hanan Salam

机构 * New York University Abu Dhabi(纽约大学阿布扎克校区) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出AtelierEval,首个统一基准,通过360个专家设计的任务量化提示能力,引入技能基于的记忆增强代理评估器,实现与人类专家的高相关性,验证了提示器在图像增强方向的优越性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22619 2026-05-22 cs.CV

GLeVE: Graph-Guided Lesion Grounding with Proposal Verification in 3D CT

GLeVE: 在3D CT中基于图的病变接地与提案验证

Shuo Jiang, Yuhao Hong, Chunbo Jiang, Weihong Chen, Huangwei Chen, Shenghao Zhu, Beining Wu, Mingxuan Liu, Zhu Zhu, Feiwei Qin, Min Tan, Yifei Chen

机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission(浙江空间信息感知与传输重点实验室) Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Children's Hospital, Zhejiang University School of Medicine(浙江大学医学院附属儿童医院)

AI总结 本文提出GLeVE框架,通过图引导的病变接地和解剖学先验验证,解决3D CT中自由文本叙述与体积解剖之间的语义-空间差距问题,提升病变定位的准确性。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22446 2026-05-22 cs.CV cs.AI cs.RO

Pre-VLA: Preemptive Runtime Verification for Reliable Vision-Language-Action and World-Model Rollouts

Pre-VLA: 预防性运行时验证用于可靠视觉-语言-动作和世界模型展开

Zhen Sun, Yongjian Guo, Haoran Sun, Luqiao Wang, Wei Lu, Jiachi Ji, Shengzhe Ji, Junwu Xiong, Zhijun Meng

机构 * Beihang University(北京航空航天大学) Tsinghua University(清华大学) Peking University(北京大学) JDT AI Infra Zhejiang University(浙江大学)

AI总结 本文提出Pre-VLA,一种统一的运行时验证架构,用于在物理执行或世界模型想象之前评估动作的有效性,以提高视觉-语言-动作和世界模型展开的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22441 2026-05-22 cs.CR cs.AI

A Constant-Time Implementation Methodology for Activation Functions on Microcontrollers

在微控制器上实现激活函数的常数时间方法

Andrii Tyvodar, Andreas Rechberger, Dirmanto Jap, Shivam Bhasin, Bernhard Jungk, Jakub Breier, Xiaolu Hou

机构 * Faculty of Informatics and Information Technologies, Slovak University of Technology in Bratislava(信息与信息技术学院,布拉格斯拉夫技术大学) State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Temasek Laboratories, Nanyang Technological University(淡马锡实验室,南洋理工大学) Faculty of Computer Science, Albstadt-Sigmaringen University(计算机科学学院,阿尔布斯塔-西格马林根大学) TTControl GmbH

AI总结 本文提出了一种在嵌入式微控制器上实现激活函数的常数时间方法,通过结合无分支选择、固定成本Padé近似、必要的虚拟算术和周期对齐,实现了定时规律的激活函数实现,并验证了其在ReLU、sigmoid、tanh、GELU和Swish函数上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22413 2026-05-22 cs.CV

From Recognition to Reasoning: Benchmarking and Enhancing MLLMs on Real-World Receipt Document Understanding

从识别到推理:在现实世界收据文档理解上对齐和增强MLLMs

Yandi Wang, Libin Zhan, Ziwei Huang, Tiancheng Luo, Yuxuan Jiang, Wang Dong, Leilei Gan, Jun Chen

机构 * Zhejiang University(浙江大学)

AI总结 本文提出ReceiptBench基准,通过四个层次化子任务提升收据信息提取的结构一致性,并提出两阶段训练框架GRPO,通过强化学习信号提升模型性能,实验证明其在复杂推理任务上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22177 2026-05-22 cs.LG cs.CL

Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles

Maestro:通过强化学习协调分层模型-技能集合

Jinyang Wu, Guocheng Zhai, Ruihan Jin, Yuhao Shen, Zhengxi Lu, Fan Zhang, Haoran Luo, Zheng Lian, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学)

AI总结 本文提出Maestro框架,通过强化学习协调多模态任务,利用分层模型-技能集合提升多模态任务性能,实现高效且通用的协调策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22123 2026-05-22 cs.RO

Beyond Pixels: Learning Invariant Rewards for Real-World Robotics From a Few Demonstrations

超越像素:从少量示范中学习不变的奖励以实现实世界机器人学

Tengye Xu, Yangting Sun, Ziju Shen, Guanqi Chen, Zhen Fu, Chen yizhou, Hua Chen, Jia Pan

机构 * School of Computing and Data Science, The University of Hong Kong(计算科学与数据科学学院,香港大学) LimX Dynamics Technology Co., Ltd(LimX动力技术有限公司) Southern University of Science and Technology(南方科技大学) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 本文提出了一种从少量示范中学习不变奖励的方法,以实现实世界机器人学中的泛化能力,通过发现行为不变量来改进奖励函数的设计,从而在多个任务中提升策略学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18507 2026-05-22 cs.CV

Weakly Supervised Cross-Modal Learning for 4D Radar Scene Flow Estimation

弱监督跨模态学习用于4D雷达场景流估计

Jingyun Fu, Zhiyu Xiang, Na Zhao

机构 * Zhejiang University, Hangzhou, Zhejiang, China(浙江大学) Zhejiang Provincial Key Laboratory of Multi-Modal Communication Networks and Intelligent Information Processing(浙江省多模态通信网络与智能信息处理重点实验室) Singapore University of Technology and Design(新加坡科技设计大学)

AI总结 本文提出了一种弱监督的雷达场景流学习框架,利用图像和里程计进行辅助监督,通过实例感知的自监督损失和静态区域的刚性损失,实现了更高效的场景流估计。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08403 2026-05-22 cs.CV

SPIRAL: Self-Evolving Action-Conditioned Video Generation via Reflective Planning Agents

SPIRAL:通过反思规划代理实现自演化动作条件视频生成

Yu Yang, Yue Liao, Jianbiao Mei, Baisen Wang, Xuemeng Yang, Licheng Wen, Jiangning Zhang, Xiangtai Li, Liang Lv, Hanlin Chen, Botian Shi, Yong Liu, Shuicheng Yan, Gim Hee Lee

机构 * Zhejiang University(浙江大学) KnowledgeXLab at Shanghai AI Lab(上海人工智能实验室知识X实验室) National University of Singapore(新加坡国立大学) Chinese Academy of Sciences(中国科学院) Tencent Youtu Lab(腾讯优设实验室) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

AI总结 本文提出SPIRAL框架,通过反思规划代理实现长时域动作条件视频生成,解决传统方法在长时间视频生成中的不足,通过闭环设计和自演化机制提升视频生成的一致性和准确性。

Comments 42 Pages, 21 Figures, Project page at https://yuyang-cloud.github.io/spiral

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23224 2026-05-22 cs.CV

Video-o3: Native Interleaved Clue Seeking for Long Video Multi-Hop Reasoning

Video-o3:长视频多跳推理的原生交错线索搜索

Xiangyu Zeng, Zhiqiu Zhang, Yuhan Zhu, Xinhao Li, Zikang Wang, Changlian Ma, Qingyu Zhang, Zizheng Huang, Kun Ouyang, Tianxiang Jiang, Ziang Yan, Yi Wang, Hongjie Zhang, Yali Wang, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) SIAT, Chinese Academy of Sciences(中国科学院软件研究所)

AI总结 本研究提出Video-o3框架,通过迭代发现显著视觉线索、细粒度检查关键片段以及适应性终止,提升长视频多跳推理能力,实验表明其在MLVU和Video-Holmes上分别达到72.1%和46.5%的准确率。

Comments 27 pages, 15 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04111 2026-05-22 cs.SE cs.AI cs.HC

CentaurEval: Benchmarking Human-in-the-Loop Value in Agentic Coding

CentaurEval: 评估人机协同在编程中的价值

Hanjun Luo, Chiming Ni, Jiaheng Wen, Zhimu Huang, Yiran Wang, Bingduo Liao, Sylvia Chung, Yingbin Jin, Xinfeng Li, Wenyuan Xu, XiaoFeng Wang, Hanan Salam

机构 * New York University Abu Dhabi(纽约大学阿布扎克校区) Nanyang Technological University(南洋理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学) Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) Beijing University of Technology(北京理工大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出CentaurEval基准测试,用于评估人机协同在编程中的价值。该基准测试通过协作必要问题模板,结合人类推理和AI效率,展示了人机协作在编程任务中的显著优势。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21558 2026-05-22 cs.LG cs.CL

From Parameters to Data: A Task-Parameter-Guided Fine-Tuning Pipeline for Efficient LLM Alignment

从参数到数据:一种任务参数引导的微调流水线用于高效的LLM对齐

Hao Chen, Qi Zhang, Liyao Li, Zhanming Shen, Wentao Ye, Lirong Gao, Ningtao Wang, Xing Fu, Xiaoyu Shen, Junbo Zhao

机构 * Zhejiang University(浙江大学) Eastern Institute of Technology(东部技术研究所)

AI总结 本研究提出了一种任务参数引导的微调流水线,通过任务敏感的注意力头作为双指南,实现样本挖掘和结构剪枝,从而提高LLM对齐的效率。

Comments Accepted@ICML26, 28 pages, 11 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏