arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2925
2604.08542 2026-04-10 cs.CV

Scal3R: Scalable Test-Time Training for Large-Scale 3D Reconstruction

Scal3R: 适用于大规模3D重建的可扩展测试时间训练

Tao Xie, Peishan Yang, Yudong Jin, Yingfeng Cai, Wei Yin, Weiqiang Ren, Qian Zhang, Wei Hua, Sida Peng, Xiaoyang Guo, Xiaowei Zhou

机构 * Zhejiang University(浙江大学) Horizon Robotics(地平线机器人) Zhejiang Lab(之江实验室)

AI总结 本文提出Scal3R,通过轻量神经子网络在测试时自监督学习,提升大规模3D重建的精度和一致性,实验证明其在KITTI和Oxford Spires数据集上的优越性能。

Comments Project page: https://zju3dv.github.io/scal3r

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08541 2026-04-10 cs.CV cs.AI cs.CL

Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts

视觉而无思维:多模态混合专家中的路由干扰

Haolei Xu, Haiwen Hong, Hongxing Li, Rui Zhou, Yang Zhang, Longtao Huang, Hui Xue, Yongliang Shen, Weiming Lu, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 研究揭示多模态混合专家模型在视觉输入时路由机制无法有效激活任务相关专家,导致推理失败,提出路由干扰假说并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08455 2026-04-10 cs.AI

KnowU-Bench: Towards Interactive, Proactive, and Personalized Mobile Agent Evaluation

KnowU-Bench: 向交互式、主动式和个性化移动代理评估迈进

Tongbo Chen, Zhengxi Lu, Zhan Xu, Guocheng Shao, Shaohan Zhao, Fei Tang, Yong Du, Kaitao Song, Yizhou Liu, Yuchen Yan, Wenqi Zhang, Xu Tan, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Apple(苹果公司) Tencent(腾讯)

AI总结 KnowU-Bench通过Android仿真环境评估个性化移动代理,涵盖42个通用GUI任务、86个个性化任务和64个主动任务,验证代理在交互中获取用户偏好和主动干预的能力,发现前沿模型在模糊指令下表现下降,揭示偏好获取和干预校准的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08381 2026-04-10 cs.CL cs.AI

A GAN and LLM-Driven Data Augmentation Framework for Dynamic Linguistic Pattern Modeling in Chinese Sarcasm Detection

一种基于GAN和LLM的数据增强框架用于中文讽刺检测中的动态语言模式建模

Wenxian Wang, Xiaohu Luo, Junfeng Hao, Xiaoming Gu, Xingshu Chen, Zhu Wang, Haizhou Wang

机构 * School of Cyber Science and Engineering, Sichuan University(四川大学网络空间安全学院) State Key Laboratory of Fluid Power and Mechatronic Systems, Zhejiang University(浙江大学流体动力与机电系统国家重点实验室) Law School, Sichuan University(四川大学法学院)

AI总结 本文提出基于GAN和LLM的数据增强框架,动态建模用户语言模式以提升中文讽刺检测效果,通过合成SinaSarc数据集并扩展BERT架构,实验表明模型在非讽刺和讽刺类别中均取得最高F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08258 2026-04-10 cs.RO

EvoGymCM: Harnessing Continuous Material Stiffness for Soft Robot Co-Design

EvoGymCM:利用连续材料刚度进行软机器人协同设计

Le Shen, Kangyao Huang, Wentao Zhao, Huaping Liu

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 本文提出EvoGymCM平台,通过将连续材料刚度作为第一类设计变量,解决传统平台对材料维度的离散化限制,提升软机器人性能与协同效应。

Comments 8 pages, 11 figures. Preprint. Under review at IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08211 2026-04-10 cs.CV

SciFigDetect: A Benchmark for AI-Generated Scientific Figure Detection

SciFigDetect:一种用于AI生成科学图表检测的基准测试

You Hu, Chenzhuo Zhao, Changfa Mo, Haotian Liu, Xiaobai Li

机构 * Zhejiang University(浙江大学) Independent Researcher(独立研究员) University of Oulu(奥卢大学)

AI总结 本文提出首个AI生成科学图表检测基准,通过多模态数据管道构建,涵盖多种图表类别和生成源,揭示现有方法在零样本迁移和对抗性攻击下的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08209 2026-04-10 cs.CV

OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering

OmniJigsaw:通过模态协调重排序增强多模态推理

Yiduo Jia, Muzhi Zhu, Hao Zhong, Mingyu Liu, Yuling Xi, Hao Chen, Bin Qin, Yongjie Yang, Zhenbo Luo, Chunhua Shen

机构 * Zhejiang University(浙江大学) Xiaomi Inc.(小米公司)

AI总结 OmniJigsaw通过模态协调重排序任务提升多模态推理能力,采用三重策略实现跨模态整合,并通过两级数据过滤提升模型适应性,验证了其在多模态自监督学习中的有效性。

Comments Project page: https://aim-uofa.github.io/OmniJigsaw/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08203 2026-04-10 cs.CV cs.AI

MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning

MedVR:通过代理强化学习实现无标注的医学视觉推理

Zheng Jiang, Heng Guo, Chengyu Fang, Changchen Xiao, Xinyang Hu, Lifeng Sun, Minfeng Xu

机构 * Tsinghua University(清华大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Key Laboratory of Pervasive Computing, Ministry of Education(教育部普适计算重点实验室) Zhejiang University(浙江大学)

AI总结 MedVR通过代理强化学习实现无标注的医学视觉推理,利用熵引导的视觉重定位和基于共识的信用分配机制,在多个公开医学VQA基准上取得最佳性能,提升医疗AI的鲁棒性和透明度。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28618 2026-04-10 cs.AI

Seeing with You: Perception-Reasoning Coevolution for Multimodal Reasoning

与你共见:多模态推理中的感知-推理共进化

Ziqi Miao, Haonan Jia, Lijun Li, Chen Qian, Yuan Xiong, Wenting Yan, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Zhejiang University(浙江大学)

AI总结 本文提出PRCO框架,通过分离的奖励信号提升多模态推理的感知与推理能力,在八个基准测试中平均提升7个百分点。

Comments 21 pages, 15 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19173 2026-04-10 cs.CL cs.CV

CycleChart: A Unified Consistency-Based Learning Framework for Bidirectional Chart Understanding and Generation

CycleChart:一种基于一致性的统一学习框架,用于双向图表理解和生成

Dazhen Deng, Sen Yang, Yuchen He, Yuan Tian, Yingcai Wu

机构 * Zhejiang University(浙江大学)

AI总结 CycleChart通过实例生命周期设计,实现图表生成与解析的一致性学习,提升跨任务泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09928 2026-04-10 cs.RO

HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models

HiF-VLA:通过运动表示实现视觉-语言-动作模型的回顾、洞察与前瞻性

Minghui Lin, Pengxiang Ding, Shu Wang, Zifeng Zhuang, Yang Liu, Xinyang Tong, Wenxuan Song, Shangke Lyu, Siteng Huang, Donglin Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) HKUST(GZ)(香港科技大学(广州)) Nanjing University(南京大学) Westlake Robotics(西湖机器人)

AI总结 HiF-VLA通过运动表示提升视觉-语言-动作模型的时序推理能力,采用回顾、洞察和前瞻性机制,在长时域任务中表现优异,且推理延迟低。

Comments CVPR 2026, Project page: https://hifvla.github.io, Github: https://github.com/OpenHelix-Team/HiF-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13551 2026-04-10 cs.CL cs.AI

Towards Hierarchical Multi-Step Reward Models for Enhanced Reasoning in Large Language Models

面向增强大语言模型推理能力的分层多步奖励模型

Teng Wang, Zhangyi Jiang, Zhenqi He, Shenyang Tong, Wenhan Yang, Yanan Zheng, Zeyu Li, Zifan He, Hailei Gong, Zewen Ye, Shengjie Ma, Jianping Zhang

机构 * the University of Hong Kong(香港大学) Tsinghua University(清华大学) Georgia Institute of Technology(佐治亚理工学院) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) Renmin University of China(中国人民大学) the Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出分层奖励模型和轻量数据增强策略,解决大语言模型推理中奖励黑客问题,提升多步推理评估的稳定性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07958 2026-04-10 cs.CV

ImVideoEdit: Image-learning Video Editing via 2D Spatial Difference Attention Blocks

ImVideoEdit:通过2D空间差异注意力块实现图像学习的视频编辑

Jiayang Xu, Fan Zhuo, Majun Zhang, Changhao Pan, Zehan Wang, Siyu Chen, Xiaoda Yang, Tao Jin, Zhou Zhao

机构 * Zhejiang University(浙江大学)

AI总结 本文提出ImVideoEdit框架,通过图像对学习视频编辑能力,利用2D空间差异注意力模块实现高效视频编辑,无需昂贵配对视频数据,保持时间动态并实现精确空间修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07955 2026-04-10 cs.LG

Rethinking Residual Errors in Compensation-based LLM Quantization

重新思考基于补偿的LLM量化中的残差误差

Shuaiting Li, Juncan Deng, Kedong Xu, Rongtao Deng, Hong Gu, Minghan Jiang, Haibin Shen, Kejie Huang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

AI总结 本文重新审视残差误差的定义,指出现有方法的校准目标存在次优问题,并引入补偿感知误差以提升LLM量化性能。

Comments ICLR'26 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07888 2026-04-10 cs.LG

Bit-by-Bit: Progressive QAT Strategy with Outlier Channel Splitting for Stable Low-Bit LLMs

逐位训练:带有异常通道分割的渐进式QAT策略以稳定低比特LLM

Binxing Xu, Hao Gu, Lujun Li, Hao Wang, Bei Liu, Jiacheng Liu, Qiyuan Zhu, Xintong Yang, Chao Li, Sirui Han, Yike Guo

机构 * Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科技大学) City University of Hong Kong(香港城市大学)

AI总结 本文提出Bit-by-Bit方法,通过渐进式QAT策略和异常通道分割,解决低比特LLM训练中的收敛不稳定和训练成本问题,实现多比特宽支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07853 2026-04-10 cs.LG cs.AI

QaRL: Rollout-Aligned Quantization-Aware RL for Fast and Stable Training under Training--Inference Mismatch

QaRL:基于回放对齐的量化感知强化学习用于在训练-推理不匹配下的快速稳定训练

Hao Gu, Hao Wang, Jiacheng Liu, Lujun Li, Qiyuan Zhu, Bei Liu, Binxing Xu, Lei Wang, Xintong Yang, Sida Lin, Sirui Han, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

AI总结 本文提出QaRL,通过对齐训练和回放的量化过程,解决训练-推理不匹配问题,提升训练效率和稳定性,同时保持低比特吞吐量优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07835 2026-04-10 cs.AI

Silencing the Guardrails: Inference-Time Jailbreaking via Dynamic Contextual Representation Ablation

消除守护栏:通过动态上下文表示消解进行推理时的劫持

Wenpeng Xing, Moran Fang, Guangtai Wang, Changting Lin, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院)

AI总结 本文提出CRA框架,通过动态抑制模型守护栏来提升推理时的劫持防御能力,实验显示其在多个开源LLM上表现优异,揭示了当前对齐机制的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07775 2026-04-10 cs.AI cs.CL cs.CR

ACIArena: Toward Unified Evaluation for Agent Cascading Injection

ACIArena:迈向多智能体系统统一评估

Hengyu An, Minxi Li, Jinghuai Zhang, Naen Xu, Chunyi Zhou, Changjiang Li, Xiaogang Xu, Tianyu Du, Shouling Ji

机构 * Zhejiang University(浙江大学) State Key Laboratory of Internet Architecture, Tsinghua University(清华大学网络架构国家重点实验室) University of California, Los Angeles(加州大学洛杉矶分校) Palo Alto Networks Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心)

AI总结 本文提出ACIArena框架,用于评估多智能体系统(MAS)的鲁棒性,通过多攻击面和目标的系统化测试,揭示单纯依赖拓扑结构评估不足,强调需通过角色设计和受控交互提升系统安全性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07737 2026-04-10 cs.CL

SepSeq: A Training-Free Framework for Long Numerical Sequence Processing in LLMs

SepSeq:一种无需训练的长数值序列处理框架

Jie Sun, Yu Liu, Lu Han, Qiwen Deng, Xiang Shu, Yang Xiao, Xingyu Lu, Jun Zhou, Pengfei Liu, Lintao Ma, Jiancan Wu, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Nanjing University(南京大学) University of Edinburgh(爱丁堡大学) East China Normal University(华东师范大学) Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学) Ocean University of China(中国海洋大学)

AI总结 针对LLM处理长数值序列性能下降问题,提出SepSeq框架通过插入分隔符令牌缓解注意力分散,提升准确率并减少推理令牌消耗。

Comments 16 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07409 2026-04-10 cs.LG eess.IV

GAN-based Domain Adaptation for Image-aware Layout Generation in Advertising Poster Design

基于GAN的领域适应用于广告海报设计中的图像感知布局生成

Chenchen Xu, Min Zhou, Tiezheng Ge, Weiwei Xu

机构 * Anhui Normal University(安徽师范大学) Zhejiang University(浙江大学) Shenzhen Bay Laboratory(深圳湾实验室) Alibaba Group(阿里巴巴集团)

AI总结 本文提出基于GAN的模型,利用图像生成广告海报布局,引入CGL数据集并设计PDA-GAN模型以提升图像感知布局生成效果。

Comments arXiv admin note: text overlap with arXiv:2303.14377

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01236 2026-04-10 cs.CV

PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards

PSR: 通过成对主体一致性奖励实现多主体个性化图像生成的扩展

Shulei Wang, Longhui Wei, Xin He, Jianbo Ouyang, Hui Lu, Zhou Zhao, Qi Tian

机构 * Zhejiang University(浙江大学) Huawei Inc.(华为技术有限公司)

AI总结 本文提出PSR框架,通过多主体数据生成管道和强化学习策略,提升多主体个性化图像生成的性能和一致性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09640 2026-04-10 cs.GR cs.CV

Physically Plausible Human-Object Rendering from Sparse Views via 3D Gaussian Splatting

基于稀疏视角的物理合理人类-物体渲染:通过3D高斯点云

Weiquan Wang, Jun Xiao, Yi Yang, Yueting Zhuang, Long Chen

机构 * College of Computer Science, Zhejiang University(浙江大学计算机科学与技术学院) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

AI总结 本文提出HOGS框架,通过3D高斯点云实现高效且物理合理的稀疏视角人类-物体渲染,解决高渲染质量、物理合理性与计算效率的平衡问题。

Comments 16 pages, 14 figures, accepted by IEEE Transactions on Image Processing (TIP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02537 2026-04-10 cs.CV cs.AI

RectifiedHR: Enable Efficient High-Resolution Synthesis via Energy Rectification

RectifiedHR: 通过能量 rectification 实现高效高分辨率合成

Zhen Yang, Guibao Shen, Minyang Li, Liang Hou, Mushui Liu, Luozhou Wang, Xin Tao, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) Kuaishou Technology(快手科技) HKUST(香港科技大学) Zhejiang University(浙江大学)

AI总结 本文提出RectifiedHR,一种无需训练的高效高分辨率合成方法,通过噪声刷新策略提升效率,并首次发现能量衰减现象,通过调整引导超参数改善生成质量,兼容多种扩散模型技术。

Comments Project Page: https://zhenyangcs.github.io/RectifiedHR-Diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12009 2026-04-10 cs.CL

FinTruthQA: A Benchmark for AI-Driven Financial Disclosure Quality Assessment in Investor -- Firm Interactions

FinTruthQA:投资者与企业互动中人工智能驱动的财务披露质量评估基准

Peilin Zhou, Ziyue Xu, Xinyu Shi, Jiageng Wu, Yikang Jiang, Dading Chong, Wang Dong, Jun Chen, Bin Ke, Jie Yang

机构 * Zhejiang University(浙江大学)

AI总结 FinTruthQA通过6000个真实财务问答数据,评估投资者与企业互动中的财务披露质量,发现现有模型在回答可读性和相关性上表现较弱,预训练语言模型在复杂任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.03890 2026-04-10 cs.CV cs.AI cs.GR cs.MM

A Survey on 3D Gaussian Splatting

3D高斯散射的综述

Guikun Chen, Wenguan Wang

机构 * The State Key Lab of Brain-Machine Intelligence, Zhejiang University(浙江大学脑机智能全国重点实验室)

AI总结 本文综述了3D高斯散射的原理、应用及最新进展,分析其在3D重建中的潜力与挑战,为研究者提供参考。

Comments Accepted by ACM Computing Surveys; Paper list: https://github.com/guikunchen/Awesome3DGS ; Benchmark: https://github.com/guikunchen/3DGS-Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06966 2026-04-09 cs.CV

MAR-GRPO: Stabilized GRPO for AR-diffusion Hybrid Image Generation

MAR-GRPO:用于AR-扩散混合图像生成的稳定GRPO

Xiaoxiao Ma, Jiachen Lei, Tianfei Ren, Jie Huang, Siming Fu, Aiming Hao, Jiahong Wu, Xiangxiang Chu, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) AMAP, Alibaba Group(阿里巴巴集团高德地图) Zhejiang University(浙江大学)

AI总结 本文提出稳定RL框架用于MAR,通过多轨迹期望减少梯度噪声,结合不确定性估计和一致性aware的token选择策略,提升图像生成质量与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06882 2026-04-09 cs.RO cs.SY eess.SP eess.SY

Telecom World Models: Unifying Digital Twins, Foundation Models, and Predictive Planning for 6G

电信世界模型:统一数字孪生、基础模型和预测规划用于6G

Hang Zou, Yuzhi Yang, Lina Bariah, Yu Tian, Yuhuan Lu, Bohao Wang, Anis Bara, Brahim Mefgouda, Hao Liu, Yiwei Tao, Sergy Petrov, Salma Cheour, Nassim Sehad, Sumudu Samarakoon, Chongwen Huang, Samson Lasaulce, Mehdi Bennis, Mérouane Debbah

机构 * Research Institute for Digital Future, Khalifa University(哈利法大学数字未来研究所) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息与电子工程学院) University of Oulu(奥卢大学) Aalto University(阿尔托大学) Université de Lorraine, CNRS, CRAN(洛林大学,法国国家科学研究中心,CRAN)

AI总结 本文提出电信世界模型(TWM),结合数字孪生与基础模型,解决6G网络中动态建模、不确定性处理和多层控制规划问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06870 2026-04-09 cs.CV

RefineAnything: Multimodal Region-Specific Refinement for Perfect Local Details

RefineAnything: 多模态区域特定细化以实现完美局部细节

Dewei Zhou, You Li, Zongxin Yang, Yi Yang

机构 * RELER, CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室、人工智能研究所) DBMI, HMS, Harvard University(哈佛大学医学院生物医学信息学系)

AI总结 本文提出区域特定图像细化方法,通过多模态扩散模型实现局部细节恢复,同时保持非编辑区域不变,引入边界一致性损失和Focus-and-Refine策略提升效果。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06834 2026-04-09 cs.CL cs.AI

On the Step Length Confounding in LLM Reasoning Data Selection

在LLM推理数据选择中的步长混淆问题

Bing Wang, Rui Miao, Chen Shen, Shaotian Yan, Kaiyuan Liu, Ximing Li, Xiaosong Yuan, Sinan Fan, Jun Zhang, Jieping Ye

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering, MoE, Jilin University(吉林大学符号计算与知识工程教育部重点实验室) Alibaba Cloud Computing(阿里云) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Department of Mathematics, University of Michigan(密歇根大学数学系) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能研究中心)

AI总结 本文分析了自然性基于的数据选择方法在LLM推理数据中系统性偏好长推理步骤的问题,并提出ASLEC-DROP和ASLEC-CASL方法以缓解此混淆。

Comments Accepted by Findings of ACL 2026. 15 pages, 9 figures. Code: https://github.com/wangbing1416/ASLEC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06777 2026-04-09 cs.CV

Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization

行走与言说:通过多模态代理策略优化弥合图像推理与行动之间的差距

Wenhao Yang, Yu Xia, Jinlong Huang, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Yuchen Zhou, Xiaobo Xia, Yuanyu Wan, Lijun Zhang, Tat-Seng Chua

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) AI Business, Alibaba Group(阿里巴巴集团智能计算研究院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, China(上海交通大学自动化与智能感知学院) School of Intelligent Systems Engineering, Sun Yat-sen University, Shenzhen, China(中山大学智能工程学院(深圳)) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院) School of Software Technology, Zhejiang University, China(浙江大学软件学院) School of Computing, National University of Singapore, Singapore, Singapore(新加坡国立大学计算机学院)

AI总结 本文提出MAPO方法,通过强制生成视觉内容的显式文本描述,结合语义对齐与任务奖励,提升多模态推理能力,实验表明其在多个视觉推理基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏