arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-15 至 2026-04-15 共收录 328 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 74 篇

2601.19917 2026-04-15 cs.CL 88%

PILOT: Planning via Internalized Latent Optimization Trajectories for Large Language Models

PILOT:通过内部化潜在优化轨迹进行大语言模型的规划

Haoyu Zheng, Yun Zhu, Yuqian Yuan, Bo Yuan, Wenqiao Zhang, Siliang Tang, Jun Xiao

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 PILOT通过内部化潜在优化轨迹,帮助大语言模型克服长周期任务中的推理不稳定问题,实验显示其在数学和编码基准测试中性能优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12262 2026-04-15 cs.CL cs.AI 88%

CascadeDebate: Multi-Agent Deliberation for Cost-Aware LLM Cascades

级联辩论:面向成本感知的LLM级联的多智能体辩论

Raeyoung Chang, Dongwook Kwon, Jisoo Lee, Nikhil Verma

机构 * Sogang University(首尔大学) Kwangwoon University(匡明大学) Seoul National University(首尔国立大学) LG Electronics, Toronto AI Lab(LG电子,多伦多人工智能实验室)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出CascadeDebate,通过在每个层级的升级边界插入多智能体辩论,解决单模型层级在模糊查询中易引发升级的问题,提升准确性和成本效率。

Comments 12 pages, 6 figures, 4 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12487 2026-04-15 cs.CL cs.AI 87%

KG-Reasoner: A Reinforced Model for End-to-End Multi-Hop Knowledge Graph Reasoning

KG-Reasoner: 一种用于端到端多跳知识图谱推理的强化模型

Shuai Wang, Yinan Yu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KG-Reasoner,通过强化学习整合多步推理至LLM的'思考'阶段,实现动态探索推理路径,实验表明其在多跳和知识密集型推理任务中表现优异。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10291 2026-04-15 cs.AI 86%

TimeSeriesExamAgent: Creating Time Series Reasoning Benchmarks at Scale

时间序列考试代理:大规模创建时间序列推理基准测试

Malgorzata Gwiazda, Yifu Cai, Mononito Goswami, Arjun Choudhry, Artur Dubrawski

机构 * Technical University of Munich(慕尼黑技术大学) Auton Lab, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机学院自主实验室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出TimeSeriesExamAgent,通过模板灵活性与LLM代理创造力结合,创建涵盖医疗、金融和天气领域的综合性时间序列推理基准测试,验证LLM在时间序列理解上的能力与局限。

Journal ref Proc. Int. Conf. Learn. Representations ICLR (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12066 2026-04-15 cs.AI cs.CY 86%

Mathematics Teachers Interactions with a Multi-Agent System for Personalized Problem Generation

数学教师与多智能体系统在个性化问题生成中的互动

Candace Walkington, Theodora Beauchamp, Fareya Ikram, Merve Koçyiğit Gürbüz, Fangli Xia, Margan Lee, Andrew Lan

机构 * Southern Methodist University(南方 Methodist 大学) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Worchester Polytechnic Institute(沃斯顿理工学院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了多智能体教师闭环系统在中学数学问题个性化中的应用,通过教师输入基础问题和主题,由LLM生成问题,再由四个AI代理评估问题的数学准确性、真实性、可读性和现实性。

Comments Paper accepted to AIED 2026 - South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00919 2026-04-15 cs.CL cs.AI 86%

Benchmarking Foundation Models with Retrieval-Augmented Generation in Olympic-Level Physics Problem Solving

基于检索增强生成在奥林匹克级物理问题求解中的基础模型评估

Shunfeng Zheng, Yudi Zhang, Meng Fang, Zihan Zhang, Zhitan Wu, Mykola Pechenizkiy, Ling Chen

机构 * AAII, University of Technology Sydney, New South Wales, Australia(AAII,悉尼大学,新南威尔士州,澳大利亚) Eindhoven University of Technology, Eindhoven, The Netherlands(埃因霍温理工大学,埃因霍温,荷兰) University of Liverpool, Liverpool, United Kingdom(利物浦大学,利物浦,英国) University of New South Wales, New South Wales, Australia(新南威尔士大学,新南威尔士州,澳大利亚)

专题命中 推理与问题求解 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过PhoPile多模态数据集评估检索增强生成在奥林匹克级物理问题求解中的表现,探讨了基础模型结合检索与物理语料对性能提升的影响及存在的挑战。

Comments Accepted to EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12881 2026-04-15 cs.SE 86%

Evaluating LLMs Code Reasoning Under Real-World Context

评估大语言模型在现实世界上下文中的代码推理能力

Changshu Liu

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出R2Eval1基准测试,包含135个来自十个广泛使用的Python项目的代码推理问题,通过序列化复合和自定义类型,更真实地评估LLM的通用性。

Comments Accepted by ICES SRC (ACM Student Research Competition)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11327 2026-04-15 cs.MA 86%

Can Small Agents Collaborate to Beat a Single Large Language Model?

小型智能体能否协同击败单一大型语言模型?

Agata Żywot, Xinyi Chen, Yifei Yuan, Anders Søgaard, Maarten de Rijke

专题命中 推理与问题求解 :language model(title,abstract);large language model(title)

AI总结 研究通过对比小型多智能体系统与大型单智能体模型,发现多智能体协作在多步骤推理和工具使用任务中表现更优,尤其 orchestrator 的能力主导整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21990 2026-04-15 cs.CE cs.AI 85%

ChemDFM-R: A Chemical Reasoning LLM Enhanced with Atomized Chemical Knowledge

ChemDFM-R: 一种增强原子化化学知识的化学推理大语言模型

Zihan Zhao, Ziping Wan, Lu Chen, Xuanze Lin, Shiyang Yu, Situo Zhang, Da Ma, Zichen Zhu, Danyang Zhang, Huayang Wang, Zhongyang Dai, Liyang Wen, Bo Chen, Xin Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(X-LANCE实验室、计算机科学学院、上海交通大学、上海、中国) Suzhou Laboratory, Suzhou, China(苏州实验室、苏州、中国) Shanghai Innovation Institution, Shanghai, China(上海创新研究院、上海、中国) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室、苏州、中国) School of Chemistry and Chemical Engineering, Shanghai Jiao Tong University, Shanghai, China(化学与化工学院、上海交通大学、上海、中国)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ChemDFM-R,通过构建原子化化学知识库ChemFG并采用混合源蒸馏方法,提升模型对化学原理和反应逻辑的理解,实现优于通用和领域大模型的化学推理能力。

Comments 20 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12651 2026-04-15 cs.CL cs.AI 85%

Learning Chain Of Thoughts Prompts for Predicting Entities, Relations, and even Literals on Knowledge Graphs

学习链式思维提示以预测知识图谱中的实体、关系以及甚至字面量

Alkid Baci, Luke Friedrichs, Caglar Demir, N'Dah Jean Kouagou, Axel-Cyrille Ngonga Ngomo

机构 * Department of Computer Science(计算机科学系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出RALP方法,通过学习基于字符串的链式思维提示作为评分函数,提升知识图谱链接预测的性能,实验表明其在多个基准测试中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14264 2026-04-15 cs.LG cs.CL 85%

AAPO: Enhancing the Reasoning Capabilities of LLMs with Advantage Margin

AAPO: 通过优势边际增强大语言模型的推理能力

Jian Xiong, Jingbo Zhou, Jingyong Ye, Qiang Huang, Dejing Dou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Frontier Research Department, Baidu Inc.(百度公司前沿研究部)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 AAPO通过引入基于边际的估计方案优化交叉熵损失,有效解决传统分组相对优势估计方法的训练效率问题,在数学推理基准上表现出色。

Comments Accepted to ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05643 2026-04-15 cs.CL 84%

Graph-Based Chain-of-Thought Pruning for Reducing Redundant Reflections in Reasoning LLMs

基于图的链式推理剪枝:减少推理LLM中冗余反射

Hongyuan Yuan, Xinran He, Run Shao, Bolei He, Xianwei Xue, Mengke Chen, Qiutong Pan, Haiwei Wang, Haifeng Li

机构 * School of Geosciences and Info-Physics, Central South University(地质科学与信息物理学院,中南大学) Baidu Inc.(百度公司)

专题命中 推理与问题求解 :LLM(title_cn,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出基于图的链式推理优化框架,通过剪枝策略减少推理过程中冗余反射,提升效率与准确性。

Comments Accepted by ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12491 2026-04-15 cs.CL 84%

Calibrated Confidence Estimation for Tabular Question Answering

表格问答中的校准置信度估计

Lukas Voss

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文比较了五种置信度估计方法在五个前沿LLM和两个表格问答基准上的表现,发现自评方法在AUROC上低于扰动方法,提出MFA方法以更低的API成本估计置信度,并结合采样方法提升性能。

Comments 27 pages, 9 figures, 17 tables (8-page main body + appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12627 2026-04-15 cs.AI 83%

KnowRL: Boosting LLM Reasoning via Reinforcement Learning with Minimal-Sufficient Knowledge Guidance

KnowRL: 通过最小充分知识引导的强化学习提升大语言模型推理

Linhao Yu, Tianmeng Yang, Siyu Ding, Renren Jin, Naibin Gu, Xiangzhao Hao, Shuaiyi Nie, Deyi Xiong, Weichong Yin, Yu Sun, Hua Wu

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院TJUNLP实验室) Baidu Inc.(百度公司) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 KnowRL通过最小充分知识引导的强化学习框架提升大语言模型推理能力,通过分解知识点并优化子集选择,在八个基准测试中超越现有基线,达到70.08的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12461 2026-04-15 cs.AI 83%

CIA: Inferring the Communication Topology from LLM-based Multi-Agent Systems

CIA:从基于大语言模型的多智能体系统推断通信拓扑

Yongxuan Wu, Xixun Lin, He Zhang, Nan Sun, Kun Wang, Chuan Zhou, Shirui Pan, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Griffith University(格里菲斯大学) Nanyang Technological University(南洋理工大学) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 研究探讨了基于大语言模型的多智能体系统通信拓扑在黑盒环境下被推断的隐私风险,提出CIA攻击方法,通过构建对抗性查询和全局偏差解耦技术,验证了攻击的有效性。

Comments ACL 2026, Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12185 2026-04-15 cs.CL 83%

Knowledge Is Not Static: Order-Aware Hypergraph RAG for Language Models

知识并非静态:面向语言模型的顺序感知超图RAG

Keshu Wu, Chenchen Kuai, Zihao Li, Jiwan Jiang, Shiyu Shen, Shian Wang, Chan-Wei Hu, Zhengzhong Tu, Yang Zhou

机构 * Texas A&M University(德克萨斯大学A&M分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The University of Kansas(堪萨斯大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出顺序感知超图RAG(OKH-RAG),通过将顺序作为结构属性,改进传统RAG方法,提升对顺序敏感任务的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11957 2026-04-15 cond-mat.mtrl-sci cs.LG 83%

Agentic LLM Reasoning in a Self-Driving Laboratory for Air-Sensitive Lithium Halide Spinel Conductors

具有自主推理能力的LLM在空气敏感性锂卤化物尖晶石导体自驱动实验室中的应用

Yuxing Fei, Bernardus Rendy, Xiaochen Yang, Junhee Woo, Xu Huang, Chang Li, Shilong Wang, David Milsted, Yan Zeng, Gerbrand Ceder

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出A-Lab GPSS平台,通过整合代理AI框架,实现对空气敏感性材料的自主实验设计,探索锂卤化物尖晶石固态离子导体的广阔化学空间,提升离子导电性和相纯度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01045 2026-04-15 cs.MA cs.AI 83%

Silo-Bench: A Scalable Environment for Evaluating Distributed Coordination in Multi-Agent LLM Systems

Silo-Bench:一种用于评估多智能体大语言模型分布式协调的可扩展环境

Yuzhe Zhang, Feiran Liu, Yi Shan, Xinyi Huang, Xin Yang, Yueqi Zhu, Xuxin Cheng, Cao Liu, Ke Zeng, Terry Jingchen Zhang, Wenyuan Jiang

机构 * Beijing University of Technology(北京理工大学) Zhejiang University(浙江大学) ETH Zürich(苏黎世联邦理工学院) Meituan LongCat Interaction Team(美团LongCat交互团队) Vector Institute for Artificial Intelligence(人工智能向量研究所)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Silo-Bench通过30种算法任务和三个通信复杂度级别评估多智能体系统分布式协调,揭示了通信与推理之间的差距,证明单纯增加智能体数量无法克服上下文限制。

Comments 20 pages, 7 figures, Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21440 2026-04-15 cs.CL cs.AI 82%

KG-Hopper: Empowering Compact Open LLMs with Knowledge Graph Reasoning via Reinforcement Learning

KG-Hopper:通过强化学习赋能紧凑型开放式大语言模型进行知识图谱推理

Shuai Wang, Yinan Yu

机构 * Department of Computer Science(计算机科学系) Engineering Chalmers University of Technology(工程学院查尔姆斯理工大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 KG-Hopper通过强化学习框架,使紧凑型开放式大语言模型能够在一个推理回合内完成多跳知识图谱推理,优于更大系统并达到与专有模型相当的性能。

Comments Accepted to IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12630 2026-04-15 cs.CV cs.CL 81%

GeoAlign: Geometric Feature Realignment for MLLM Spatial Reasoning

GeoAlign:用于MLLM空间推理的几何特征重定位

Zhaochen Liu, Limeng Qiao, Guanglu Wan, Tingting Jiang

机构 * National Engineering Research Center of Visual Technology, National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(视觉技术国家工程研究中心、多媒体信息处理国家重点实验室、计算机学院、北京大学) Meituan Inc.(美团公司) National Biomedical Imaging Center, Peking University(生物医学成像国家中心、北京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 本文提出GeoAlign框架,通过动态聚合多层几何特征以解决MLLM在空间推理中的任务对齐偏差问题,实验表明其紧凑模型在多个基准测试中达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12610 2026-04-15 cs.CL 81%

Transforming External Knowledge into Triplets for Enhanced Retrieval in RAG of LLMs

将外部知识转化为三元组以增强LLM中RAG的检索

Xudong Wang, Chaoning Zhang, Qigan Sun, Zhenzhen Huang, Chang Lu, Sheng Zheng, Zeyu Ma, Caiyan Qin, Yang Yang, Hengtao Shen

机构 * School of Computing, Kyung Hee University(韩国庆熙大学计算机学院) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) School of Robotics and Advanced Manufacture, Harbin Institute of Technology(哈尔滨工业大学机器人与先进制造学院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 推理与问题求解 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Tri-RAG通过结构化三元组构建提升检索效率,减少冗余信息,提高生成质量与资源利用率。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28325 2026-04-15 cs.CE cs.AI 81%

Building evidence-based knowledge bases from full-text literature for disease-specific biomedical reasoning

从全文文献构建基于证据的知识库以支持疾病特定的生物医学推理

Chang Zong, Sicheng Lv, Si-tu Xue, Huilin Zheng, Jian Wan, Lei Zhang

机构 * School of Computer Science and Technology, Zhejiang University of Science and Technology(浙江理工大学计算机科学与技术学院) Institute of Medicinal Biotechnology, Chinese Academy of Medical Sciences & Peking Union Medical College(中国医学科学院药物生物技术研究所) Zhejiang Key Laboratory of Biomedical Intelligent Computing Technology(浙江省生物医学智能计算技术重点实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出EvidenceNet,一个基于全文文献构建的疾病特定知识库,通过大语言模型提取实验支持的结构化证据记录,用于生物医学推理任务。

Comments 30 pages, 5 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12228 2026-04-15 cs.CR 80%

From IOCs to Regex: Automating CTI Operationalization for SOC with LLMs

从IOCs到正则表达式:利用LLMs自动化SOC中的CTI操作化

Pei-Yu Tseng, Lan Zhang, ZihDwo Yeh, Xiaoyan Sun, Xushu Dai, Peng Liu

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出IOCRegex-gen系统,利用LLMs自动生成正则表达式,解决CTI操作化中的手动转换问题,通过分组机制和多阶段验证流程提升准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12172 2026-04-15 cs.CR cs.LO 80%

COBALT-TLA: A Neuro-Symbolic Verification Loop for Cross-Chain Bridge Vulnerability Discovery

COBALT-TLA:一种用于跨链桥漏洞发现的神经符号验证循环

Dominik Blain

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 COBALT-TLA结合LLM与TLA+模型检查器,通过自动REPL循环发现跨链桥漏洞,首次自主识别Optimistic Relay Attack漏洞类。

Comments 4 pages, 1 table. Submitted to FMBC 2026 (Formal Methods for Blockchains)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14512 2026-04-15 cs.CV 80%

SIRI-Bench: Challenging VLMs' Spatial Intelligence through Complex Reasoning Tasks

SIRI-Bench: 通过复杂推理任务挑战VLMs的空间智能

Zijian Song, Xiaoxin Lin, Qiuming Huang, Sihan Qin, Guangrun Wang, Liang Lin

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 SIRI-Bench通过空间接地推理任务评估VLMs的空间结构智能,包含9000个视频问题答案三元组,实验表明先进VLMs在结构空间推理上面临挑战。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12896 2026-04-15 cs.CV cs.LG 79%

Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs

不要显示像素,显示提示:通过感知程序解锁语言模型中的视觉工具推理

Muhammad Kamran Janjua, Hugo Silva, Di Niu, Bahador Rashidi

机构 * Huawei Technologies, Canada(华为技术(加拿大)) University of Alberta, Canada(阿尔伯塔大学(加拿大))

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.LG

AI总结 本文提出感知程序(P²),通过将视觉工具输出转换为结构化摘要,提升语言模型的视觉推理能力,在六个任务中均取得显著提升。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12537 2026-04-15 cs.CV cs.AI 79%

MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models

MODIX:一种无需训练的多模态信息驱动的位置索引缩放

Ruoxiang Huang, Zhen Yuan

机构 * Peking University(北京大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 MODIX通过动态调整位置步长,基于模态特定贡献优化多模态模型的位置编码,提升多模态推理能力。

Comments Accepted by CVPR 2026 (Highlight). 10 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00710 2026-04-15 cs.AI 79%

Does RLVR Extend Reasoning Boundaries? Investigating Capability Expansion in Vision-Language Models

RLVR能否扩展推理边界?探究视觉-语言模型中的能力扩展

Minghe Shen, Zhuo Zhi, Chonghan Liu, Shuo Xing, Zhengzhong Tu, Che Liu

机构 * University College London(伦敦大学学院) Samsung R&D Institute UK(三星英国研发院) University of California, Los Angeles(加州大学洛杉矶分校) Texas A&M University(德克萨斯农工大学) Imperial College London(伦敦帝国学院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文通过Ariadne框架研究RLVR对视觉-语言模型空间推理能力的影响,证明其能扩展推理边界,并在真实导航任务中取得提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16154 2026-04-15 cs.CL cs.AI 79%

AdaMCoT: Rethinking Cross-Lingual Factual Reasoning through Adaptive Multilingual Chain-of-Thought

AdaMCoT:通过自适应多语言链式思考重新思考跨语言事实推理

Weihua Zheng, Xin Huang, Zhengyuan Liu, Tarun Kumar Vangani, Bowei Zou, Xiyan Tao, Yuhao Wu, Ai Ti Aw, Nancy F. Chen, Roy Ka-Wei Lee

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AdaMCOT框架,通过动态路由中间'思考语言'中的推理过程提升多语言事实推理能力,实验表明在低资源语言中表现显著提升。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12833 2026-04-15 cs.CV 78%

Challenging Vision-Language Models with Physically Deployable Multimodal Semantic Lighting Attacks

用可部署的多模态语义照明攻击挑战视觉-语言模型

Yingying Zhao, Chengyin Hu, Qike Zhang, Xin Li, Xin Wang, Yiwei Wei, Jiujiang Guo, Jiahuan Long, Tingsong Jiang, Wen Yao

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出MSLA攻击框架,通过可控对抗性照明攻击视觉-语言模型的多模态语义理解,揭示其在现实世界中的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏