arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-21 至 2026-04-21 共收录 803 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 152 篇

2510.07745 2026-04-21 cs.CL cs.AI cs.LG 75%

Parallel Test-Time Scaling for Latent Reasoning Models

潜在推理模型的并行测试时缩放

Runyang You, Yongqi Li, Meng Liu, Wenjie Wang, Liqiang Nie, Wenjie Li

机构 * Hong Kong Polytechnic University(香港理工大学) Shandong Jianzhu University(山东建筑大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过改进采样和聚合方法,使潜在推理模型能有效利用并行测试时缩放,提升连续空间中的推理能力。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00861 2026-04-21 cs.CL cs.AI cs.IR 73%

Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs

擦除以提升:用于搜索增强大语言模型的可擦除强化学习

Ziliang Wang, Kang An, Xuhui Zheng, Faqiang Qian, Weikun Zhang, Cijun Ouyang, Jialu Cai, Yuhang Wang, Yichao Wu

机构 * SenseAuto Shenzhen University(深圳大学) Nanjing University(南京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Erasable Reinforcement Learning框架,通过识别并擦除推理中的错误步骤,提升搜索增强大语言模型在多步推理中的鲁棒性,实验表明其在多个基准测试中取得显著提升。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08539 2026-04-21 cs.CV cs.AI cs.CL 73%

OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks

OpenVLThinkerV2: 一个多领域视觉任务的通用多模态推理模型

Wenbo Hu, Xin Chen, Yan Gao-Tian, Yihe Deng, Nanyun Peng, Kai-Wei Chang

机构 * University of California, Los Angeles (UCLA)(加州大学洛杉矶分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出G$^2$RPO训练目标,通过非线性分布匹配解决多视觉任务中的奖励拓扑差异和感知与推理平衡问题,构建了鲁棒的OpenVLThinkerV2模型,在18个基准测试中表现优异。

Comments code at: https://github.com/uclanlp/openvlthinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19880 2026-04-21 cs.LG cs.AI 73%

What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time

如果共识是谎言呢?测试时的选择性互补强化学习

Dong Yan, Jian Liang, Yanbo Wang, Shuo Lu, Ran He, Tieniu Tan

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SCRL框架,通过选择性正伪标签和熵门控负伪标签减少标签噪声影响,提升测试时强化学习的鲁棒性和泛化能力。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16881 2026-04-21 cs.CL cs.AI 73%

Incentivizing Parametric Knowledge via Reinforcement Learning with Verifiable Rewards for Cross-Cultural Entity Translation

通过可验证奖励的强化学习激励参数知识用于跨文化实体翻译

Jiang Zhou, Xiaohu Zhao, Xinwei Wu, Tianyu Dong, Hao Wang, Yangyang Liu, Heng Liu, Linlong Xu, Longyue Wang, Weihua Luo, Deyi Xiong

机构 * TJUNLP Lab, Tianjin University, China(天津大学TJUNLP实验室) Alibaba Group, China(阿里巴巴集团)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EA-RLVR框架,通过可验证奖励信号优化跨文化实体翻译,提升模型在实体翻译准确性和领域外泛化能力,实验表明在7k样本训练下模型性能显著提升。

Comments 23 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14975 2026-04-21 cs.AI cs.CL cs.CY cs.MA 73%

Why Agents Compromise Safety Under Pressure

为何智能体在压力下妥协安全

Hengle Jiang, Ke Tang

机构 * Guangdong Provincial Key Laboratory of Brain-inspired Intelligent Computation, Department of Computer Science and Engineering, Southern University of Science and Technology(广东省脑启发智能计算重点实验室,计算机科学与工程系,南方科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了智能体在复杂环境中为追求目标而妥协安全的问题,揭示了'智能体压力'概念,并提出通过压力隔离等策略缓解这一现象。

Comments Accepted by ACL 2026 Findings; 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18493 2026-04-21 cs.LG 70%

Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data

过于正确而无法学习:在饱和推理数据上进行强化学习

Zhenwen Liang, Yujun Zhou, Sidi Lu, Xiangliang Zhang, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Notre Dame(诺丁汉大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出CUTS策略,通过约束均匀Top-K采样增强探索,结合Mixed-CUTS框架提升推理多样性,实验显示在AIME25基准上Pass@1准确率提升15.1%。

Comments ACL 2026 Main Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18176 2026-04-21 cs.AI quant-ph 70%

QuantumQA: Enhancing Scientific Reasoning via Physics-Consistent Dataset and Verification-Aware Reinforcement Learning

量子QA:通过物理一致的数据集和验证意识强化学习增强科学推理

Songxin Qu, Tai-Ping Sun, Yun-Jie Wang, Huan-Yu Liu, Cheng Xue, Xiao-Fan Xu, Han Fang, Yang Yang, Yu-Chun Wu, Guo-Ping Guo, Zhao-Yun Chen

机构 * Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) School of Physics, University of Science and Technology of China(中国科学技术大学物理学院) School of Electronics and Information Engineering, Anhui University(安徽大学电子与信息工程学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出量子QA数据集和验证意识奖励模型,通过物理一致的数据集和强化学习提升科学推理能力,实验证明其在科学领域表现优异。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18122 2026-04-21 cs.CL 70%

Decisive: Guiding User Decisions with Optimal Preference Elicitation from Unstructured Documents

Decisive: 通过从非结构化文档中最优偏好引导用户决策

Akriti Jain, Anish Mulay, Divyansh Verma, Aishani Pandey, Pritika Ramu, Aparna Garimella

机构 * Adobe Research, India(Adobe印度研究实验室) IIT Madras(印度理工学院马德拉斯分校) IIT Roorkee(印度理工学院罗尔基分校) IIIT Hyderabad(Hyderabad印度理工学院) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Decisive结合文档基础推理与贝叶斯偏好推断,通过主动引导用户回答成对权衡问题,提高决策准确性,实验表明其在多个领域优于传统方法和大语言模型。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17957 2026-04-21 cs.CL 70%

Process Reward Models Meet Planning: Generating Precise and Scalable Datasets for Step-Level Rewards

过程奖励模型与规划:生成精确且可扩展的步骤级奖励数据集

Raffaele Pisano, Roberto Navigli

机构 * Babelscape Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于规划逻辑问题生成过程奖励模型数据集的方法,通过PDDL领域定义语言生成百万级推理步骤,提升数学和非数学推理能力。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10693 2026-04-21 cs.AI 70%

FACT-E: Causality-Inspired Evaluation for Trustworthy Chain-of-Thought Reasoning

FACT-E:基于因果的可信推理链评估

Yuxi Sun, Aoqi Zuo, Haotian Xie, Wei Gao, Mingming Gong, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) The University of Melbourne(墨尔本大学) Singapore Management University(新加坡管理大学)

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 FACT-E通过因果方法评估推理链的可信度,结合内部一致性与推理-答案一致性,提升推理轨迹选择质量并增强噪声下的鲁棒性。

Comments Accepted to Association for Computational Linguistics Findings (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04809 2026-04-21 cs.AI 70%

SCALER:Synthetic Scalable Adaptive Learning Environment for Reasoning

SCALER:合成可扩展自适应学习环境用于推理

Caijun Xu, Changyi Xiao, Zhongyuan Peng, Xinrun Wang, Yixin Cao

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Singapore Management University(新加坡国立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SCALER通过自适应环境设计维持有效学习信号,解决RL训练中任务难度与模型能力不匹配及训练模式狭窄的问题,提升推理能力。

Comments 22 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03154 2026-04-21 cs.CL 70%

Decoupling the Effect of Chain-of-Thought Reasoning: A Human Label Variation Perspective

解耦链式推理的影响:从人类标签变异视角出发

Beiduo Chen, Tiancheng Hu, Caiqi Zhang, Robert Litschko, Anna Korhonen, Barbara Plank

机构 * MaiNLP Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) LMU Munich, Germany(慕尼黑大学,德国) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),慕尼黑,德国) Language Technology Lab, University of Cambridge, United Kingdom(语言技术实验室,剑桥大学,英国)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文通过系统解耦实验探讨了链式推理对分布任务的影响,发现推理内容对最终准确性贡献大,而模型先验对分布排名起主导作用。

Comments Accepted by ACL 2026 Findings, 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21064 2026-04-21 cs.AI cs.CV 70%

OVOD-Agent: A Markov-Bandit Framework for Proactive Visual Reasoning and Self-Evolving Detection

OVOD-Agent:一种用于主动视觉推理和自进化检测的马尔可夫-多臂框架

Chujie Wang, Jianyu Lu, Zhiyuan Luo, Xi Chen, Chu He

机构 * Wuhan University(武汉大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出OVOD-Agent框架,通过将文本优化扩展为可解释的视觉CoT,结合弱马尔可夫决策过程和多臂模块,实现主动视觉推理和自进化检测,提升稀有类别检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09741 2026-04-21 cs.CV cs.LG 70%

Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping

构造性失真:通过注意力引导的图像扭曲改进MLLMs

Dwip Dalal, Gautam Vashishtha, Utkarsh Mishra, Jeonghwan Kim, Madhav Kanda, Hyeonjeong Ha, Svetlana Lazebnik, Heng Ji, Unnat Jain

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Skan AI Texas A&M University(德克萨斯大学阿姆斯特朗分校) University of California, Irvine(加州大学 Irvine 分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出AttWarp方法,通过注意力引导的图像扭曲增强MLLMs对细节和空间关系的感知能力,提升准确性和推理能力。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07761 2026-04-21 cs.CL 70%

Test-Time Reasoners Are Strategic Multiple-Choice Test-Takers

测试时推理器是战略性的多选题答题者

Nishant Balepur, Atrey Desai, Rachel Rudinger

机构 * University of Maryland(马里兰大学) New York University(纽约大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了测试时推理器在多选题回答中的策略性表现,发现其在全输入和仅选项输入下均能提升准确性,挑战了部分输入成功总是缺陷的观点。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15586 2026-04-21 cs.CL 70%

Learning to Extract Rational Evidence via Reinforcement Learning for Retrieval-Augmented Generation

通过强化学习学习提取理性证据以增强检索增强生成

Xinping Zhao, Shouzheng Huang, Yan Zhong, Xinshuo Hu, Meishan Zhang, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Peking University(北京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EviOmni,通过推理先提取证据,结合证据推理与提取,利用强化学习优化生成质量,实验表明其在多个基准数据集上表现优异,提升下游任务准确率。

Comments 23 pages, 8 Figures, 18 Tables; Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17654 2026-04-21 cs.AI 70%

Poly-EPO: Training Exploratory Reasoning Models

Poly-EPO:训练探索性推理模型

Ifdita Hasan Orney, Jubayer Ibn Hamid, Shreya S Ramanujam, Shirley Wu, Hengyuan Hu, Noah Goodman, Dorsa Sadigh, Chelsea Finn

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出Poly-EPO框架,通过集强化学习提升语言模型的探索与利用协同,增强推理能力与泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17353 2026-04-21 cs.AI cs.DC 70%

Hive: A Multi-Agent Infrastructure for Algorithm- and Task-Level Scaling

Hive:一种用于算法和任务级扩展的多智能体基础设施

Zizhang Luo, Yuhao Luo, Youwei Xiao, Yansong Xu, Runlin Guo, Yun Liang

机构 * Peking University(北京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Hive通过算法和任务级扩展提升智能体系统性能,通过Logits Cache减少冗余计算并提升采样速度,Agent-Aware Scheduling优化资源分配,降低热点缺失率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17319 2026-04-21 cs.CV cs.CL 70%

E2E-GMNER: End-to-End Generative Grounded Multimodal Named Entity Recognition

E2E-GMNER:端到端生成式 grounded 多模态命名实体识别

Meng Zhang, Jinzhong Ning, Xiaolong Wu, Hongfei Lin, Yijia Zhang

机构 * Dalian Maritime University(大连海事大学) Dalian University of Technology(大连理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出E2E-GMNER,通过端到端生成框架统一实体识别、语义类型预测和视觉定位,采用链式推理和GRBP提升鲁棒性,实验证明其在多模态命名实体识别任务中表现优异。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17295 2026-04-21 cs.AI 70%

LLaTiSA: Towards Difficulty-Stratified Time Series Reasoning from Visual Perception to Semantics

LLaTiSA:从视觉感知到语义的难度分层时间序列推理

Yueyang Ding, HaoPeng Zhang, Rui Dai, Yi Wang, Tianyu Zong, Kaikui Liu, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团) Amap(高德)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LLaTiSA,通过四层分类体系提升时间序列推理能力,结合可视化模式与精确校准的数值表格增强视觉语言模型的时序感知,实现跨多样任务和现实场景的鲁棒泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17274 2026-04-21 cs.CV cs.AI 70%

Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models

本能与反思:统一令牌和 verbalized 自信在多模态大模型中

Yunkai Dang, Yifan Jiang, Yizhu Jiang, Anqi Chen, Wenbin Li, Yang Gao

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究多模态大模型响应自信估计的本能-反思不一致问题,提出融合框架和均值对齐方法,提升校准和失败预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14738 2026-04-21 cs.CL 70%

AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning

AutoRubric: 基于评分标准的生成奖励用于忠实的多模态推理

Mengzhao Jia, Zhihan Zhang, Ignacio Cases, Zheyuan Liu, Meng Jiang, Peng Qi

机构 * University of Notre Dame(内布拉斯加大学) Uniphore

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AutoRubric通过整合可验证奖励学习与过程级监督,利用自动收集的评分标准生成奖励,实现多模态推理的高保真性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09354 2026-04-21 cs.CL 70%

Logit Arithmetic Elicits Long Reasoning Capabilities Without Training

逻辑运算激发长推理能力而不需训练

Yunxiang Zhang, Muhammad Khalifa, Lechen Zhang, Xin Liu, Ayoung Lee, Xinliang Frederick Zhang, Farima Fatahi Bayat, Lu Wang

机构 * University of Michigan(密歇根大学)

专题命中 推理与问题求解 :post-training(abstract);preference optimization(abstract);分类 cs.CL

AI总结 本文提出ThinkLogit方法,通过逻辑运算将小型推理引导器的能力转移至大模型,无需训练即可提升推理性能,实验显示在六个基准测试中实现21.5%-24.2%的提升。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12782 2026-04-21 cs.AI 70%

HeroBench: A Benchmark for Long-Horizon Planning and Structured Reasoning in Virtual Worlds

HeroBench:一个用于虚拟世界中长horizon规划和结构化推理的基准测试

Petr Anokhin, Roman Khalikov, Stefan Rebrikov, Viktor Volkov, Artyom Sorokin, Vincent Bissonnette

机构 * Artyom Sorokin(AXXX) Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) Higher School of Economics(高等经济学院) Kurchatov Institute(库尔斯克研究所) Independent Researcher(独立研究者)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出HeroBench,用于评估在复杂RPG-inspired虚拟世界中长horizon分层规划和结构化推理的能力,通过模拟评估可执行计划,揭示了现有大型语言模型在长horizon自主规划中的性能差异和挑战。

Comments Code is available at https://github.com/stefanrer/HeroBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02506 2026-04-21 cs.IR cs.AI 70%

R3A: Reinforced Reasoning for Relevance Assessment for RAG in User-Generated Content Platforms

R3A:强化推理用于用户生成内容平台中的RAG相关性评估

Xiaowei Yuan, Lei Jin, Haoxin Zhang, Ziyang Huang, Yan Gao, Yi Wu, Yao Hu, Jun Zhao, Kang Liu

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(复杂系统认知与决策智能重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Xiaohongshu Inc.(小红书公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 R3A通过意图推理和证据定位解决UGC平台中相关性评估的挑战,提升模型在稀疏反馈和非对称相关性中的表现。

Comments Accepted by ACL Industry 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17112 2026-04-21 cs.AI 70%

Complementing Self-Consistency with Cross-Model Disagreement for Uncertainty Quantification

通过跨模型分歧补充自一致性以进行不确定性量化

Kimia Hamidieh, Veronika Thost, Walter Gerych, Mikhail Yurochkin, Marzyeh Ghassemi

机构 * MIT(麻省理工学院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) WPI(伍斯特理工学院) IFM MBZUAI(MBZUAI人工智能研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过引入epistemic不确定性项,改进了自一致性估计的不确定性量化,提升了模型在低不确定性下的选择性回避性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17054 2026-04-21 cs.CV cs.AI 70%

mEOL: Training-Free Instruction-Guided Multimodal Embedder for Vector Graphics and Image Retrieval

mEOL:无需训练的指令引导多模态嵌入器用于矢量图形和图像检索

Kyeong Seon Kim, Baek Seong-Eun, Lee Jung-Mok, Tae-Hyun Oh

机构 * KAIST(韩国科学技术院) POSTECH

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出无需训练的指令引导多模态嵌入框架,通过多模态大语言模型将文本、位图和SVG代码映射到对齐的嵌入空间,利用模态特定指令和结构化SVG提示实现嵌入方向控制,构建首个文本到SVG检索基准,展示出优于传统基线的性能。

Comments Round 1 early acceptance to WACV 2026, Project page: https://scene-the-ella.github.io/meol

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16972 2026-04-21 cs.AI 70%

MCPO: Mastery-Consolidated Policy Optimization for Large Reasoning Models

MCPO:面向大推理模型的 mastery-consolidated 策略优化

Zhaokang Liao, Yingguo Gao, Yi Yang, Yongheng Hu, Jingting Ding

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出 MCPO 算法,通过引入 hinge-KL 正则化和优先机制,解决高准确度提示下的策略漂移和巩固问题,提升大模型推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16931 2026-04-21 cs.AI 70%

Playing Psychic: Using Thought Trees to Predict Reasoning Models Accuracy on Coding Tasks

读心术:利用思维树预测推理模型在编码任务上的准确性

Jiaxin Fang, Runyuan He, Sahil Bhatia, Neel Gajare, Alvin Cheung

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过系统研究前沿推理模型在真实世界编码基准上的表现,提出利用结构化思维树来表示推理轨迹,并通过轻量级分类器预测轨迹正确性,从而提升编码任务的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏