arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11496 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1648 篇

2607.03591 2026-07-07 cs.CV cs.AI cs.CY 新提交 89%

Responsibility Distribution Estimation in Ego-View Accident Videos with Multimodal Large Language Models

基于多模态大语言模型的第一视角事故视频中的责任分配估计

Ryosei Tamura, Andrew Shin

机构 * Keio University(庆应大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究第一视角事故视频中责任分配估计新任务,构建大语言模型辅助的责任标注管道并在多输入设置下微调模型,实验证明多模态大语言模型能有效执行该任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22126 2026-06-23 cs.CL 新提交 89%

From Recognition to Understanding: Unlocking Cognitive Time Series Reasoning with LLMs

从识别到理解:利用LLM解锁认知时间序列推理

Xin Qiu, Junlong Tong, Yao Zhang, Yunpu Ma, Wei Zhang, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(东方理工数字孪生研究所) Zhejiang University(浙江大学) Munich Center for Machine Learning, LMU(慕尼黑机器学习中心,慕尼黑大学)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有时间序列任务与LLM能力不匹配的问题,提出多模态基准TSCognition和统一框架TSAlign,通过认知推理任务和语义对齐提升LLM的时间序列推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20227 2026-06-19 cs.AI cs.SE 新提交 89%

QMFOL: Benchmarking Large Language Model Reasoning via Quantifiable Monadic First-Order Logic Test Case Generation

QMFOL:通过可量化的一元一阶逻辑测试用例生成来基准测试大语言模型推理

Xinyi Zheng, Ling Shi, Tianlong Yu, Yongxin Zhao, Lorenz Goette, Kailong Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学) Hubei University(湖北大学) East China Normal University(华东师范大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 提出QMFOL框架,通过可控制复杂度的合取/析取模式生成一元一阶逻辑推理任务,并构建包含2880个实例的基准QMFOLBench,评估显示逻辑复杂度增加导致性能下降和计算开销上升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17459 2026-06-17 cs.AI 新提交 89%

Can LLMs Be CEOs? Benchmarking Strategic Resource Reallocation with Multi-Role Agent Simulation

LLM 能当 CEO 吗?基于多角色智能体模拟的战略资源重新配置基准测试

Yuyang Dai, Xueqing Peng, Lingfei Qian, Zhuohan Xie

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Yale University(耶鲁大学)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出 CEO-Bench,一个多智能体基准,评估 LLM 在约束丰富的组织环境中进行多轮战略资源重新配置的能力,发现模型在结构有效性上表现良好,但在战略校准上存在系统性失败模式。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13567 2026-08-17 cs.AI cs.CL cs.LG 新提交 89%

Modular Cognitive Architecture Emerges in Large Language Models

大型语言模型中出现的模块化认知架构

Pengrui Han, Jacob Andreas, Evelina Fedorenko, Andrea Gregor de Varda

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG;LLM(comments)

AI总结 该研究探究大型语言模型是否会出现类似人类大脑的模块化认知架构,经对4个认知领域46项任务的回路分析,发现其会形成相似模块化架构,表明模块化可能是智能系统的基本属性。

Comments https://pengrui-han.github.io/LLM_Modularity_Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18591 2026-08-20 cs.AI cs.CL 新提交 89%

Can a Lightweight Multimodal Model Estimate LLM Reasoning Performance? A Study for Compute-Optimal Document Inference

轻量级多模态模型能否评估LLM的推理性能?一项面向计算最优文档推理的研究

Zishan Ahmad, Vishal Vaddina

机构 * Phi Labs(菲实验室) Quantiphi(宽梯斐科技)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本研究提出轻量级多模态模型DRB,基于新基准BudgetDoc实现文档任务中LLM推理预算的动态分配,在降低成本的同时多数情况下达到或优于固定最大预算的性能,具备跨模型泛化潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09432 2026-08-11 cs.CL cs.AI 新提交 89%

ZetaGPT: A Reference Implementation of Positional--Encoding--Free State--Space--Attention Language Models

ZetaGPT:无位置编码的状态空间注意力语言模型的参考实现

Róisín Luo

专题命中 推理与问题求解 :language model(title,abstract);RLHF(abstract,abstract_cn);small language model(abstract);pretraining(abstract)

AI总结 ZetaGPT是首款无显式位置编码的开源小型语言模型,它将因果状态空间方程与自注意力结合,提供全开源训练流水线,为无位置编码语言模型的研究提供紧凑可复现的参考实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01078 2026-08-04 cs.CL cs.AI 新提交 89%

Attend to Your Own Thoughts: Breaking the Barrier for Post-Training Quantization of Reasoning LLMs through the Lens of 1.58-Bit Quantization

关注自身思维:通过1.58比特量化视角打破推理型大语言模型的后训练量化障碍

Shigeng Wang, Chao Li, Yangyuxuan Kang, Jiawei Fan, Anbang Yao

机构 * Intel Labs China(英特尔中国实验室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);post-training(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出ScaleQ-1.58三值后训练量化框架,通过集成AYOT校准方法,提升推理型LLM量化性能,该框架可扩展且泛化性强,仅需少量校准token即可实现优异效果。

Comments This research work was completed and submitted for publication in early May 2026. The project page: https://github.com/IntelChina-AI/BitTern

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14165 2026-07-17 cs.SE cs.AI cs.AR cs.LG 新提交 89%

Towards Reliable AI-Assisted Analog Design: Template-Constrained LLM Agents for SAR ADC Generation

迈向可靠的人工智能辅助模拟设计:用于逐次逼近寄存器型模数转换器生成的模板约束大语言模型智能体

Dimple Vijay Kochar, Hae-Seung Lee, Anantha P. Chandrakasan

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对大语言模型在模拟电子设计自动化应用的瓶颈,提出端到端多步骤的ATLAS框架,利用专家知识结合模板约束生成,能生成成功通过仿真验证的SAR ADC,为集成LLMs到可靠模拟设计方法奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26698 2026-06-26 cs.CL cs.AI 新提交 89%

Beyond Logical Forms: LLM-Extracted Patterns for Fallacy Classification

超越逻辑形式:LLM提取的谬误分类模式

Eleni Papadopulos, Firoj Alam, Giovanni Da San Martino

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出利用大语言模型从谬误示例中归纳提取抽象逻辑结构与上下文线索的模式,用于谬误分类,在多个实验设置中显著优于零样本基线并跨数据集验证泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13125 2026-06-12 cs.LG cs.AI 新提交 89%

Select and Improve: Understanding the Mechanics of Post-Training for Reasoning

选择与改进:理解推理后训练的机制

Akshay Krishnamurthy, Audrey Huang, Nived Rajaraman

机构 * Microsoft Research NYC(微软研究院纽约) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :SFT(summary_cn,abstract);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 通过控制实验揭示强化学习后训练通过策略选择和策略改进两种机制提升推理能力,并指出SFT数据和RL数据的不同作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07548 2026-06-09 cs.IR cs.AI cs.CL 新提交 89%

Evaluating Advanced Prompting on Gemini Flash for Multi-Hop Biomedical QA

评估 Gemini Flash 上的高级提示工程用于多跳生物医学问答

Ahmed Bajaber, Mohammed Alliheedi

机构 * Saudi Med AI Lab (SMAIL)(沙特医学人工智能实验室(SMAIL)) Prince Sultan University(普森国王大学) Al-Baha University(阿勒巴哈大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);prompting(title);large language model(abstract);language model(abstract)

AI总结 本研究通过设计多组件提示(角色扮演、多步思维链示例和格式规则),在 Gemini 2.0 Flash 上实现概念级得分0.720,显著优于基线0.565,并接近下一代模型性能,证明高级提示设计对释放LLM推理能力至关重要。

Comments 8 pages, proceedings of the BioCreative IX Challenge and Workshop (BC9) at IJCAI 2025

Journal ref Proc. BioCreative IX Workshop (BC9), IJCAI 2025, Montreal, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18581 2026-08-20 cs.CL cs.AI cs.LG 新提交 89%

From Storage to Access: Verifiable Activation of Parametric Knowledge in LLMs via Explicit Priming and Implicit Reasoning

从存储到访问:通过显式预激活与隐式推理实现大语言模型中参数化知识的可验证激活

Zuocheng Ying, Yang Yang, Yumou Wu, Chuanbo Zhu, Jiarui Wang, Ziqi Wu, Jingming Cai, Junqing Yu, Zikai Song

机构 * ByteDance(字节跳动) Huazhong University of Science and Technology(华中科技大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究提出VAKE框架,通过两阶段强化学习将LLM的显式知识提取能力迁移至隐式推理,可激活参数化知识,在多基准上优于基线且具备跨数据集迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13239 2026-08-14 cs.CV 新提交 89%

Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?

社会视听问答的推理:我们处于什么阶段?

Koen P. de Vries, Xavier Alameda-Pineda, Estefanía Talavera, Stéphane Lathuilière

机构 * Inria(法国国家信息与自动化研究所) Univ. Grenoble Alpes(格勒诺布尔大学) CNRS(法国国家科学研究中心) University of Twente(特文特大学)

专题命中 推理与问题求解 :SFT(summary_cn,abstract);large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本文针对社会视听问答研究,发现IntentBench存在高噪声,Vanilla SFT基线性能优于现有推理方法,仅用文本模态即可实现与视频相当的性能,并发布了IntentBench-Prime等资源。

Comments Accepted at HCMIW ECCV workshop. Code available here: https://github.com/koenv759/VanillaSFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21090 2026-07-24 cs.LG cs.AI cs.CL 新提交 89%

Training Large Language Models for Self-Explanation Faithfulness

训练用于自解释忠实性的大语言模型

Yeoktatt Cheah, María Pérez-Ortiz, Noah Y. Siegel, Oana-Maria Camburu

机构 * Imperial College London(帝国理工学院)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

AI总结 提出强化学习方法,将忠实性度量改为训练目标,研究模型能否检测及优化影响决策因素以提高自解释忠实性。实验用随机词和用户偏差插入,微调模型在忠实性度量上显著改进,交叉干预泛化有模型依赖等情况,为减少不忠实推理提供路径。

Comments To appear at the ICLR 2026 Workshop on Representational Alignment (Re-Align), 10 pages (long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18319 2026-07-22 physics.soc-ph 新提交 89%

Mapping the Narrow Corridor with Large Language Models

用大语言模型绘制狭窄走廊

Ebrahim M Songhori

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究探讨大语言模型能否将国家历史在二维空间路径的框架付诸实践,引入可重现流程,制作12国轨迹图集并比较四个模型,评估与专家指数的一致性及模型间一致性,还讨论了大语言模型注释器和人类专家偏差差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10438 2026-07-14 cs.RO cs.NI 新提交 89%

Large Language Model Enhanced Differentiable Trajectory Planning for IoT-Enabled Autonomous Driving

用于物联网支持的自动驾驶的大语言模型增强可微轨迹规划

Shihao Zhang, Jing Yang, Ziyu Song, Zheng Lin, Sunil Prajapat, Zhaochen Xia, Hemant Ghayvat, Haitao Ding, Lip Yee Por, Ashok Kumar Das

机构 * State Key Laboratory of Automotive Simulation and Control, Jilin University(吉林大学汽车仿真与控制国家重点实验室) Center of Research for Cyber Security and Network (CSNET), Faculty of Computer Science and Information Technology, Universiti Malaya(马来西亚大学计算机科学与信息技术学院网络安全与网络研究中心) Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg(卢森堡大学安全、可靠性与信任跨学科中心) IMT, Department of Humanities and Technology, Roskilde University(罗斯基勒大学人文与技术系IMT) Center for Security, Theory and Algorithmic Research, International Institute of Information Technology(国际信息技术研究所安全、理论与算法研究中心) Department of Computer Science and Engineering, College of Informatics, Korea University(韩国大学信息学院计算机科学与工程系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 针对物联网支持的自动驾驶规划问题,提出大语言模型增强可微轨迹规划框架。通过以周围智能体为中心的数据增强、复杂度感知的语义增强模块及可微优化模块,提升规划效果,在相关基准测试中取得高分,验证了在线部署和实时闭环执行能力。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06004 2026-07-08 cs.SE 新提交 89%

Large Language Models Have Unreliable Understanding of Software Engineering Terminology

大语言模型对软件工程术语的理解不可靠

Huzaifa Ejaz, Fabian C. Peña, Steffen Herbold

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究大语言模型对软件工程术语的理解程度,通过用正确及伪造定义提示,测量分类准确率与推理令牌合理性,发现多数模型虽能检测伪造定义,但存在拒绝正确定义的偏差,明确推理未持续改善结果,揭示了LLMs在术语理解上的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01148 2026-07-08 cs.SI cs.SY eess.SY 新提交 89%

Emergence of Preferential Attachment and Glass-Ceiling Effects in Autonomous Networks of LLMs

LLM自主网络中优先连接与玻璃天花板效应的涌现

Yiming Zhang, Vikram Krishnamurthy

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究LLM代理自主选择合作者时网络结构的涌现,发现优先连接和类型依赖的玻璃天花板效应,通过平均场模型证明中心性收敛,实验验证了网络动态对集体性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03766 2026-07-07 cs.SE 新提交 89%

Semantic-aware and Self-improving Program Reduction via Agentic Large Language Models

通过智能大语言模型实现语义感知和自我改进的程序简化

Xintong Zhou, Hongxu Xu, Chunhao Liao, Puzhuo Liu, Yongqiang Tian, Chengnian Sun

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究将程序简化作为由智能大语言模型驱动的自主推理任务,方法是让模型分析语义、提出假设并迭代改进,还能提炼经验,PROJ框架实现该方法,实验表明其优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19750 2026-06-19 cs.LG cs.AI cs.CL 新提交 89%

Manifold Bandits: Bayesian Curriculum Learning over the Latent Geometry of Large Language Models

流形赌博机:大语言模型潜在几何上的贝叶斯课程学习

Darrien McKenzie, Nicklas Hansen, Xiaolong Wang

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出贝叶斯流形课程(BMC)框架,将问题采样建模为流形结构赌博机问题,通过层次任务树和贝叶斯学习引导采样,平衡学习信号、多样性和实用性。

Comments Webpage: https://darrienmckenzie.com/manifold-bandits/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11211 2026-06-11 cs.CL cs.AI cs.LG 新提交 89%

Calibration Drift Under Reasoning: How Chain-of-Thought Budgets Induce Overconfidence in Large Language Models

推理下的校准漂移:思维链预算如何导致大型语言模型过度自信

Prakul Sunil Hiremath, Harshit R. Hiremath

机构 * Department of Computer Science and Engineering, Visvesvaraya Technological University, Belagavi(维斯瓦拉亚科技大学计算机科学与工程系,贝拉加维) Department of Computer Science and Business System, SG Balekundri Institute of Technology, Belagavi(SG巴莱昆德里理工学院计算机科学与商业系统系,贝拉加维)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现,增加思维链推理预算超过任务特定阈值会导致模型对错误答案过度自信,提出校准漂移现象并引入CABStop停止规则。

Comments 31 pages, 4 figures, 3 tables. Introduces Calibration Drift Under Reasoning (CDUR) with theoretical analysis and preliminary experiments; includes CABStop; code and data available

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09131 2026-06-09 cs.AI cs.CL cs.CV cs.LG 新提交 89%

Late-Layer Fusion is Enough: Dual-Path Vision Token Routing for Multimodal Large Language Models under Visual Saturation

晚期融合足矣:面向视觉饱和的多模态大语言模型的双路径视觉令牌路由

Siyuan Liu, Jinyang Wu

机构 * School of Mechanics and Engineering Science, Peking University(北京大学力学与工程科学学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对多模态大语言模型中视觉令牌在深层饱和的问题,提出双路径视觉令牌路由(DPVR-LF),在饱和点将视觉令牌路由至单层可训练分支,仅最后层融合,以约3%可训练参数保持性能并减少计算。

Comments 18 pages, 4 figures. Submitted to Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07529 2026-06-09 cs.CL cs.AI cs.CV cs.LG cs.MM 新提交 89%

CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models

CAPruner: 概念相邻场景图剪枝器以增强大语言模型的3D空间推理

Shengli Zhou, Xiangchen Wang, Guanhua Chen, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) SpatialTemporal AI(时空人工智能)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出概念相邻场景图剪枝器(CAPruner),通过融合模糊语义相关性和空间邻近性估计关系重要性,在任务特定上下文中选择关键关系,避免关系级标注,显著提升大语言模型在3D视觉语言任务上的空间推理性能。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12679 2026-08-14 cs.AI cs.NE 新提交 89%

Beyond the Best Guess: Improving LLM Solution Coverage with Evolution Strategies

超越最佳猜测:用进化策略提升大语言模型的解决方案覆盖率

Conor F. Hayes, Elliot Meyerson, Kajetan Schweighofer, Roberto Dailey, Babak Hodjat, Risto Miikkulainen, Xin Qiu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cognizant AI Lab(高知特人工智能实验室)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 该研究针对LLM后训练中RL导致pass@k受限、解决方案覆盖率不足的问题,采用进化策略(ES)方法,提升了pass@k与解决方案覆盖率,在数学基准上取得更好结果,为相关领域后训练提供了更好基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08477 2026-08-11 cs.CL 新提交 89%

VectraYX-Vision-1B: A Sub-2B Spanish/LATAM Cybersecurity Vision-Language Model with Structured Visual Reasoning and Native Tool Use

VectraYX-Vision-1B:一款具备结构化视觉推理与原生工具使用能力的20亿参数以下西班牙语/拉丁美洲网络安全多模态模型

Juan S. Santillana

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本研究推出VectraYX-Vision-1B,一款20亿参数以下西班牙语/拉丁美洲网络安全多模态模型,支持结构化推理与工具调用,针对网络UI优化,同时报告了其视觉定位的负面结果及相关修复方案,开源了模型与数据。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21196 2026-07-24 cs.LO cs.AI 新提交 89%

Case study: solving P-99 with LPTP and an LLM

案例研究:使用LPTP和语言模型解决P-99问题

Fred Mesnard, Thierry Marianne, Étienne Payet, Wim Vanhoof

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究以九十九个Prolog问题(P-99)为对象,借助向语言模型Claude提问,生成Prolog代码及测试文件,再用LPTP进行验证,完成了前三十三个问题的解决,介绍了具体过程与细节,为他人重现实验提供便利。

Comments In Proceedings ICLP 2026, arXiv:2607.17707

Journal ref EPTCS 450, 2026, pp. 209-222

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19588 2026-06-19 cs.AI cs.CR cs.LO 新提交 89%

Analyzing the Narration Gap in LLM-Solver Loops

分析大语言模型-求解器循环中的叙述差距

Zunchen Huang, Songgaojun Deng

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);language model(abstract);分类 cs.AI

AI总结 研究LLM与SAT/SMT求解器混合推理中,将求解器输出转化为用户答案的叙述步骤存在的安全漏洞,通过形式化建模和实验评估发现证书门控可保证求解结果正确,但对抗攻击可反转结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14037 2026-06-15 cs.CL 新提交 89%

Right or Wrong, Models Comply: Directional Blindness in LLM Moral Judgment

对或错,模型都顺从:LLM 道德判断中的方向盲从

Jihye Kim, Jeffrey Flanigan

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出顺从不对称性(A = BCR/HCR)双向诊断指标,发现大语言模型在事实判断中更顺从有益提示(A=1.58),但在道德判断中几乎同等顺从有益和误导提示(A=1.04),揭示了方向盲从这一对齐失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11745 2026-06-11 cs.CV cs.AI 新提交 89%

From Prompts to Tokens: Internalizing Causal Supervision in Vision-Language Model for Multi-Image Causal Reasoning

从提示到标记:将因果监督内化到视觉-语言模型中进行多图像因果推理

Haoping Yu, Yuanxi Li, Jing Ma

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出BridgeVLM,通过从多图像输入诱导因果图并转换为因果标记,注入LLM解码器进行因果消息传递,显著提升多图像因果推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏