arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-25 至 2026-06-25 共收录 35 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 35 篇

2512.02080 2026-06-25 cs.AI cs.FL cs.LG cs.SE 版本更新 92%

The 4/$δ$ Bound: Designing Predictable LLM-Verifier Systems for Formal Method Guarantee

4/δ 界:设计具有形式方法保证的可预测 LLM-验证器系统

Pierre Dantas, Lucas Cordeiro, Youcheng Sun, Waldir Junior

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出 LLM-验证器收敛定理,将多阶段验证建模为顺序吸收马尔可夫链,证明成功概率 δ>0 时系统几乎必然验证,并导出精确延迟上界 4/δ,经 90000+ 试验验证。

Comments 36 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25489 2026-06-25 cs.HC 新提交 91%

When LLM Rationales Become User-Facing: Effects on Trust Perception, Decision-Making, and Gaze Behaviors

当LLM推理理由面向用户时:对信任感知、决策和注视行为的影响

Xin Sun, Ting Pan, Yajing Wang, Shu Wei, Jos A. Bosch, Isao Echizen, Abdallah El Ali, Saku Sugawara

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 研究通过两项实验(在线和眼动追踪)探讨LLM推理理由的呈现方式、正确性和确定性框架对用户信任、决策和注视行为的影响,发现不正确理由降低信任并增加认知负荷,挑战了“更多推理更好”的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07306 2026-06-25 cs.HC 版本更新 91%

Seeing the Reasoning: How LLM Rationales Influence User Trust and Decision-Making in Factual Verification Tasks

看见推理:LLM 推理如何影响用户在事实核查任务中的信任与决策

Xin Sun, Shu Wei, Jos A Bosch, Isao Echizen, Saku Sugawara, Abdallah El Ali

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 通过在线实验(N=68)操纵LLM推理的呈现格式、正确性和确定性框架,发现正确推理和确定性线索提升信任与决策采纳,不确定性线索降低,而呈现格式无显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24902 2026-06-25 cs.DL cs.AI 新提交 91%

Failure Modes of Large Language Models on Research-Level Mathematics: A Taxonomy and an Empirical Characterisation

大语言模型在研究级数学问题上的失败模式:分类与实证刻画

Arnesh Banerjee, Ayushi Bhattacharjee

机构 * Dept. of CSE (Data Science) Heritage Institute of Technology(计算机科学与工程系(数据科学)哈里特技术学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文通过分析“First Proof”基准测试中LLM的错误,识别出四种失败模式(F1-F4),并审计Gemini 2.5 Flash生成的证明,发现前提走私(F2)普遍存在且无法被引文验证检测,提出应构建推理时管道预防而非事后检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25356 2026-06-25 cs.CR cs.SE 新提交 90%

Representation Matters: An Empirical Study of Program Representations for LLM Vulnerability Reasoning

表示至关重要:LLM 漏洞推理中程序表示的实证研究

Andrew Stoltman, Johnathan Tang, Haipeng Cai

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过 RepBench 基准比较原始源码与基于静态分析的程序表示,发现 AST+PDG 组合准确率达 83.2%,远超原始源码的 53.5%,表明精心选择的结构化表示能提供更优的准确率-开销权衡。

Comments 34 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14274 2026-06-25 cs.LG cs.AI cs.LO 版本更新 90%

Discovering New Theorems via LLMs with In-Context Proof Learning in Lean

通过基于 Lean 的上下文证明学习利用 LLM 发现新定理

Kazumi Kasaura, Naoto Onda, Yuta Oriike, Masaya Taniguchi, Akiyoshi Sannai, Sho Sonoda

机构 * OMRON SINIC X Corporation(OMRON SINIC X公司) RIKEN AIP NexaScience CyberAgent Kyoto University(京都大学) RIKEN AGIS Shiga University(大坂大学) NII NISTEP

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出猜想-证明循环(CPL)框架,利用 LLM 在 Lean 4 中迭代生成数学猜想并尝试证明,通过上下文学习重用先前定理的证明策略,提高难证定理的发现率。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25497 2026-06-25 cs.RO 新提交 89%

SAGE-Nav: Leveraging LLM Planning and Alignment Fusion for Hierarchical Scene Graph-Guided Navigation

SAGE-Nav:利用LLM规划与对齐融合的分层场景图引导导航

Hao Su, Yuehao Huang, Yukai Ma, Yong Liu, Jiajun Lv

机构 * Zhejiang University(浙江大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出SAGE-Nav分层框架,结合大语言模型与动态场景图,通过解耦全局语义规划与高频反应控制,实现高效目标导航,在i-THOR和RoboTHOR中达到最优性能。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25388 2026-06-25 cs.DB 新提交 89%

TabClean: Reusable LLM-Synthesized Programs for Tabular Data Cleaning

TabClean: 用于表格数据清洗的可复用LLM合成程序

Yibo Wang, Riteng Zhang, Yinghao He, Yongye Su, Bharat Bhargava, Chunwei Liu

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出TabClean系统,通过将LLM推理编译为可复用的带守卫修复程序,实现无模型训练的表格数据清洗,在五个基准数据集上F1优于基线,并大幅降低重复运行成本。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26079 2026-06-25 cs.CL cs.CV cs.LG 新提交 88%

Same Evidence, Different Answer: Auditing Order Sensitivity in Multimodal Large Language Models

相同证据,不同答案:多模态大语言模型中的顺序敏感性审计

Akshay Paruchuri, Sanmi Koyejo, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出Facet-Probe审计框架,评估18个多模态大语言模型在五种顺序扰动下的答案翻转率,发现所有模型均非顺序不变,最佳模型仍有13.4%翻转率,提示仅靠提示级缓解难以实现通用顺序鲁棒性。

Comments 22 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10187 2026-06-25 cs.LG 版本更新 87%

MINIF2F-DAFNY: LLM-Guided Mathematical Theorem Proving via Auto-Active Verification

MINIF2F-DAFNY: 通过自动主动验证的LLM引导数学定理证明

Mantas Baksys, Stefan Zetzsche, Olivier Bouissou, Sean B. Holden

机构 * University of Cambridge, Cambridge, UK(剑桥大学) Amazon Web Services, London, UK(亚马逊网络服务(伦敦)) Amazon Web Services, Boston, USA(亚马逊网络服务(波士顿))

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.LG

AI总结 提出首个将数学基准miniF2F翻译到自动主动验证器Dafny的数据集,评估8个LLM的证明生成能力,最佳模型Claude Opus 4.6达到62.7%的累积通过率,比空证明基线提升23.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22485 2026-06-25 cs.AI cs.CL cs.DB cs.LO 新提交 87%

VADAOrchestra: Neurosymbolic Orchestration of Adaptive Reasoning Workflows

VADAOrchestra:自适应推理工作流的神经符号编排

Teodoro Baldazzi, Luigi Bellomarini, Andrea Coletta, Michela Iezzi, Carsten Maple, Alessandro Pesare, Emanuel Sallinger

机构 * TU Wien(维也纳工业大学) Banca d’Italia(意大利央行) University of Warwick(华威大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出VADAOrchestra框架,结合LLM灵活性与Datalog+/-符号推理,实现可审计、可扩展的自适应工作流编排,在金融场景中验证了忠实性、可扩展性和可解释性。

Comments Accepted at KR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25484 2026-06-25 cs.CY econ.GN q-fin.EC stat.AP 新提交 86%

From Causal Discovery to Implementation: An Agentic AI Framework for E-Scooter Mobility Hub Planning Across 29 German Cities

从因果发现到实施:面向29个德国城市的电动滑板车出行枢纽规划的智能体AI框架

Meng Jin, Melanie Handrich, Simone Martinenz, Nicholas Hoeser, Ziyue Li

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出一个三阶段智能体AI框架,利用29个德国城市的公共GBFS数据构建因果模板库,通过LLM驱动的因果发现揭示城市类型与集群类型对热点需求的因果驱动差异,并在海尔布隆指导两个枢纽站点建设。

Comments 32 Pages, Submitted to Transportation Research Part D: Transport and Environment. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25404 2026-06-25 cs.RO 新提交 86%

HEART: Coordination of Heterogeneous Expert Agents for Physically Grounded Robotic Task Planning

HEART: 异构专家智能体协调实现物理接地机器人任务规划

Junho Lee, Seabin Lee, Wonjong Lee, Nayoung Kim, Moonjeong Kang, Changjoo Nam

机构 * Sogang University(西江大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出异构多LLM框架HEART,将指令分解为原子推理任务分配给角色专家,通过约束驱动规划合成,提升机器人任务规划的物理可行性和效率。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26041 2026-06-25 cs.CV cs.CL 新提交 85%

How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations

OCR推理有多鲁棒?评估视觉语言模型在视觉扰动下的OCR推理鲁棒性

Yuxing Cheng, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动人机智能工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出OCR-Robust基准,通过5种扰动类型和3种严重程度评估18个VLM在OCR推理任务上的鲁棒性,发现高干净精度不保证强鲁棒性,图表比文档更脆弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25568 2026-06-25 cs.CL 新提交 84%

Riazi-8B: An Urdu Large Language Model for Mathematical Reasoning

Riazi-8B:用于数学推理的乌尔都语大语言模型

Azher Ali, Ibtsam Haider, Raja Khurram Shahzad, Seemab Latif, Mehwish Fatima

机构 * School of Electrical Engineering and Computer Science (SEECS)(电气工程与计算机科学学院) National University of Sciences and Technology (NUST)(国家科学与技术大学) Department of Communication, Quality Management and Information Systems(通信、质量管理与信息系统系) Mid Sweden University(中瑞典大学)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL

AI总结 针对乌尔都语数学推理资源匮乏的问题,提出Riazi-8B模型,通过乌尔都语维基百科继续预训练和GSM8K链式思维数据微调,在MGSM-乌尔都语基准上显著提升答案正确性和推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23129 2026-06-25 cs.LG 版本更新 84%

Polaris: A Gödel Agent Framework for Small Language Models through Experience-Abstracted Policy Repair

Polaris:通过经验抽象策略修复实现小型语言模型的Gödel代理框架

Aditya Kakade, Vivek Srivastava, Shirish Karande

机构 * TCS Research, India(印度TCS研究)

专题命中 推理与问题求解 :language model(title);small language model(title);分类 cs.LG

AI总结 Polaris通过经验抽象策略修复实现小型语言模型的Gödel代理框架,通过分析、策略形成、抽象和最小代码修补实现策略更新,提升模型在多个基准测试中的表现。

Comments Accepted to ACL 2026 (Findings). 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24889 2026-06-25 cs.CL cs.SD 新提交 81%

Graph-Based Phonetic Error Correction of Noisy ASR

基于图的噪声ASR语音错误纠正

Pratik Rakesh Singh, Mohammadi Zaki, Aneesh Mukkamala, Pankaj Wasnik

机构 * Sony Research India(索尼印度研究院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出G-SPIN框架,结合图神经网络构建音近候选集,并用掩码语言模型和指令调优大语言模型进行上下文重排序,以纠正ASR中结构化的音近错误。

Comments Accepted at ACL Industry Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25588 2026-06-25 cs.SE 新提交 80%

IntentTester: Intent-Driven Multi-agent Framework for Cross-Library Test Migration

IntentTester:面向意图驱动的跨库测试迁移多智能体框架

Yi Gao, Ziyuan Zhang, Xing Hu, Xiaohu Yang, Xin Xia

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 提出IntentTester多智能体框架,通过将测试抽象为语言无关的测试描述语言(TDL),结合知识图谱对齐语义实体,并利用LLM推理与迭代验证生成可执行测试,实现跨库跨语言测试迁移,在9个开源项目上生成2776个测试,正确率85%,有效性74%,并发现多处隐藏缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25066 2026-06-25 cs.AI cs.CV 新提交 79%

Do vision-language models search like humans? Reasoning tokens as a reaction-time analog in classic visual-search paradigms

视觉-语言模型的搜索方式与人类相似吗?经典视觉搜索范式中推理标记作为反应时间类似物

Farahnaz Wick

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 研究视觉-语言模型(VLM)在经典视觉搜索任务中是否表现出类似人类的行为模式,通过推理标记数量作为搜索努力度的指标,发现模型复现了部分人类特征但也存在关键差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22497 2026-06-25 cs.CV 新提交 78%

Benchmarking Vision-Language Models for Microscopic Plant Image Understanding

用于植物显微图像理解的视觉语言模型基准测试

Tianqi Wei, Xin Yu, Zhi Chen, Scott Chapman, Zi Huang

机构 * The University of Queensland(昆士兰大学) Adelaide University(阿德莱德大学) University of Southern Queensland(南昆士兰大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 提出PlantMicro基准,包含5000+图像和9000+VQA对,评估视觉语言模型在植物显微图像理解上的能力,发现现有模型在细粒度识别和生物学推理上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26029 2026-06-25 cs.CV cs.AI 新提交 77%

TriViewBench: Controlled Complexity Scaling for Multi-View Structural Reasoning in MLLMs

TriViewBench: 多视图结构推理中受控复杂度缩放

Yu-Yang Chen, Lan-Zhe Guo

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 提出TriViewBench基准,通过合成3D场景控制物体数量和遮挡,评估18个多模态大模型在多视图推理中的能力层次和性能退化,发现跨视图空间表示是瓶颈。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25552 2026-06-25 cs.CL cs.AI 新提交 73%

SFL-MTSC: Leveraging Semantic Frame-Level Multi-Task Self-Consistency for Robust Multi-Intent Spoken Language Understanding

SFL-MTSC:利用语义框架级多任务自一致性实现鲁棒的多意图口语理解

Po-Yen Chen, Berlin Chen

机构 * National Taiwan Normal University(国立台湾师范大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出语义框架级多任务自一致性(SFL-MTSC)框架,通过将预测分解为意图特定框架、进行域-意图分组和槽级聚类,并利用路径支持评分评估聚类可靠性,有效缓解多意图场景下基于提示的口语理解中的意图-槽结构不一致问题,在MAC-SLU基准上提升了槽F1和整体准确率。

Comments Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16518 2026-06-25 cs.CV cs.CL cs.LG 版本更新 73%

SyncLoop: A Multimodal Dual-Loop Framework for Self-Improving Mathematical Reasoning

SyncLoop: 一种用于自我改进数学推理的多模态双循环框架

Xiuwei Chen, Wentao Hu, Hanhui Li, Yongxin Wang Jun Zhou, Zisheng Chen, Meng Cao, Yihan Zeng, Kui Zhang, Yu-Jie Yuan, Jianhua Han, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) The Hong Kong Polytechnic University(香港理工大学) MBZUAI Huawei Noah’s Ark Lab(华为诺亚实验室) Yinwang Intelligent Technology Co. Ltd(依文智科有限公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出SyncLoop多模态双循环框架,通过跨模态数据演化循环和数据-模型演化循环联合进化训练数据和模型能力,解决数据复杂度不匹配和演化分离问题,在数学推理基准上持续提升性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25757 2026-06-25 cs.CL 新提交 70%

OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning

OPERA: 通过基于客观困惑度的强化学习对齐开放式推理

Wenxuan Jiang, Zining Fan, Zijian Zhang, Xuecheng Wu, Hongming Tan, Haoyang Dai, Xiaoyu Li, Xuezhi Cao, Ninghao Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) Meituan Longcat Team(美团龙猫团队) Peking University(北京大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出OPERA方法,利用困惑度动态作为内在奖励信号,结合冷启动数据合成和困惑度优先的推理轨迹选择,实现开放式任务中对齐,在Qwen3-8B上达到开源模型最优。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25338 2026-06-25 cs.CL 新提交 70%

Hybrid-IR: Dual-Path Hybrid Retrieval with Iterative Reasoning for Complex Medical Question Answering

Hybrid-IR: 面向复杂医学问答的双路径混合检索与迭代推理

Sheng Wan, Jiahui Zhang, Zicheng Zhao, Shougang Ren

机构 * College of Artificial Intelligence, Nanjing Agricultural University(南京农业大学人工智能学院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Hybrid-IR框架,结合图检索与稠密检索的双路径检索机制,并通过迭代检索-推理循环逐步优化推理轨迹,有效解决复杂医学问答中知识碎片化和静态检索不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25363 2026-06-25 cs.IR cs.AI math.HO 新提交 70%

TheoremGraph: Bridging Formal and Informal Mathematics

TheoremGraph:连接形式化与非形式化数学

Simon Kurgan, Evan Wang, Eric Leonen, Sophie Szeto, Luke Alexander, Artemii Remizov, Jarod Alper, Giovanni Inchiostro, Vasily Ilin

机构 * University of Washington Math AI Lab(华盛顿大学数学人工智能实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出TheoremGraph,构建统一语句级依赖图,连接非形式化(arXiv论文)和形式化(Lean)数学,通过嵌入自然语言标语实现跨域链接,并验证了检索性能。

Comments 31 pages, 9 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25319 2026-06-25 cs.CV 新提交 67%

V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning

V-Zero: 无答案标签的在线策略蒸馏与对比证据门控用于细粒度视觉推理

Haoxiang Sun, Zhihang Yi, Langxuan Deng, Yuhao Zhou, Peiqi Jia, Jian Zhao, Li Yuan, Jiancheng Lv, Tao Wang

机构 * SCU(四川大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出V-Zero框架,通过对比证据门控评估学生采样轨迹,无需答案标签即可实现细粒度视觉推理的在线策略蒸馏,训练速度比监督微调快5倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24538 2026-06-25 cs.CV 新提交 67%

ForensicsTok: Forensics-Guided Tokenized Modeling for Image Tampering Localization

ForensicsTok: 面向图像篡改定位的法医引导分词建模

Lei Xu, Haowei Wang, Shen Chen, Taiping Yao, Bin Li, Changsheng Chen

机构 * Shenzhen University(深圳大学) Tencent Youtu Lab(腾讯优图实验室) Shenzhen MSU-BIT University(深圳北理莫斯科大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出ForensicsTok,将图像篡改定位重构为自回归序列生成任务,通过Token Splatting解码器和分层专家融合模块,直接生成空间定位的令牌序列,避免中间监督,在六个基准上超越现有MLLM方法并略优于强法医基线。

Comments 16 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25000 2026-06-25 cs.LG cs.AI physics.geo-ph 新提交 62%

Geo-Strat-RL: Learning Geological Event Reasoning from Verifiable Tasks

Geo-Strat-RL:从可验证任务中学习地质事件推理

Lukas Mosser

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Geo-Strat-RL合成环境,通过可验证奖励的强化学习(RLVR)训练视觉语言模型进行地质事件重建,并证明从地层图学到的推理可迁移至合成地震数据。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06566 2026-06-25 cs.CV cs.AI cs.CL 版本更新 62%

SPARC: Separating Perception And Reasoning Circuits for Test-time Scaling of VLMs

SPARC: 分离感知与推理回路以实现VLM的测试时扩展

Niccolo Avogaro, Nayanika Debnath, Li Mi, Thomas Frick, Junling Wang, Zexue He, Hang Hua, Konrad Schindler, Mattia Rigotti

机构 * ETH Zürich(苏黎世联邦理工学院) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SPARC框架,通过显式分离视觉感知与推理,实现测试时动态扩展和不对称计算分配,在视觉推理任务中优于基线方法。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏