arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-29 至 2026-06-29 共收录 31 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 31 篇

2606.27757 2026-06-29 cs.AI 新提交 92%

Towards Reliable and Robust LLM Planning: Symbolic Feedback-Driven Iterative Self-Refinement Framework

迈向可靠稳健的LLM规划:符号反馈驱动的迭代自我精炼框架

Jiajing Zhang, Jiamei Jiang, Chenyang Zhang, Feifei Mo, Linjing Li, Daniel Zeng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出符号反馈驱动的迭代自我精炼框架,通过自然语言提示、符号验证器和计划识别器增强LLM在长时域规划中的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27409 2026-06-29 cs.MA cs.CL cs.LG cs.SY eess.SY 新提交 92%

Delayed Verification Destabilizes Multi-Agent LLM Belief: Instability Thresholds and Optimal Corrector Placement

延迟验证破坏多智能体LLM信念:不稳定性阈值与最优校正器放置

Igor Itkin

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究多智能体LLM系统中延迟验证导致信念不稳定的问题,通过图论和谱分解推导出验证剂量的稳定性阈值,并提出贪心近似算法优化校正器放置。

Comments 20 pages, 5 figures, 1 table. Code and data: https://github.com/YehudaItkin/delayed-verification-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27684 2026-06-29 cs.IR 新提交 91%

Intuition-Guided Latent Reasoning for LLM-Based Recommendation

直觉引导的潜在推理用于基于LLM的推荐

Chang Liu, Yimeng Bai, Xiaoyan Zhao, Yang Zhang, Qifan Wang, Fuli Feng, Wenge Rong

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出IntuRec框架,通过提取用户历史生成候选集作为直觉,注入偏好对齐的直觉嵌入初始化潜在推理起点,提升LLM推荐推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27731 2026-06-29 cs.CL cs.AI cs.CE cs.LG 新提交 90%

Enhancing Numerical Prediction in LLMs via Smooth MMD Alignment

通过平滑MMD对齐增强LLM中的数值预测

Zhuo Zuo, Li Yue, Wenhao Zheng, Chenpeng Wang, Xianggen Liu

机构 * College of Computer Science, Sichuan University, Chengdu, China(四川大学计算机学院,成都,中国)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM在数值预测任务中精度不足的问题,提出平滑最大均值差异(SMMD)方法,通过数值令牌的距离核和图平滑对齐预测分布,在数学推理等任务中显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28011 2026-06-29 eess.SY cs.LG cs.SY 新提交 90%

From Detection to Action: Using LLM Agents for Fault-Tolerant Control

从检测到行动:使用LLM智能体进行容错控制

Javal Vyas, Milapji Singh Gill, Artan Markaj, Felix Gehlhoff, Mehmet Mercangöz

机构 * Imperial College London(帝国理工学院伦敦校区) Helmut Schmidt University(海德堡-施密特大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出基于大语言模型智能体的主动容错控制框架,通过多智能体协作、数字孪生和知识图谱增强检索,生成并验证最小风险恢复路径,在离散和连续过程控制中实现从故障检测到有效纠正行动的闭环。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27416 2026-06-29 cs.MA cs.SE 新提交 89%

Glite ARF: Verifier-Driven Research with Parallel LLM Coding Agents

Glite ARF:基于验证器的并行LLM编码代理研究

Vassili Philippov, Pavel Katunin, Dmitry Andreev, Igor Ostanin, Anton Nikolaev

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出Glite ARF框架,通过确定性验证器脚本强制执行任务隔离和不可变性,实现并行LLM编码代理的可重复研究,在BEA 2026词汇难度共享任务中取得领先结果。

Comments 13 pages, 6 figures, 7 tables. Open-source framework (Apache-2.0) and a public demo project at https://github.com/GliteTech/glite-arf and https://github.com/GliteTech/research-ace-cefr

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04806 2026-06-29 cs.SE 版本更新 89%

MIRAGE: Online LLM Simulation for Microservice Dependency Testing

MIRAGE:微服务依赖测试的在线LLM模拟

XinRan Zhang

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 MIRAGE通过在线LLM模拟动态响应微服务依赖请求,提升测试场景的覆盖率和准确性,尤其在错误处理和代码推理方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26530 2026-06-29 cs.CL cs.AI 新提交 88%

DiARC: Distinguishing Positive and Negative Samples Helps Improving ARC-like Reasoning Ability of Large Language Models

DiARC:区分正负样本有助于提升大型语言模型的类ARC推理能力

Yuxuan Yang, Feiyang Li, Yile Wang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出DiARC方法,通过构建偏好对(正负样本)来提升大型语言模型在类ARC任务上的推理能力,实验表明该方法在多个基准上持续改进基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30719 2026-06-29 cs.LG cs.AI 版本更新 88%

When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?

何时LLMs足以作为序列RL任务的策略优化器?

Stephane Hatgis-Kessell, Emma Brunskill

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出PromptPO方法,利用LLM通过Python描述状态空间、动作空间和奖励函数,基于rollout反馈迭代生成和优化可执行策略,在多种环境中匹配或超越标准RL基线,但在细粒度连续控制任务中表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23387 2026-06-29 cs.CL 新提交 87%

Self-Stigma Is Not a Monolith, but Generic Empathy Is: Persona-Conditioned LLM Support for People Who Use Drugs

自我污名并非单一概念,但通用共情是:面向吸毒者的人物条件化LLM支持

Layla Bouzoubaa, Rezvaneh Rezapour

机构 * Department of Information Science(信息科学系)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 针对吸毒者自我污名表达异质性问题,提出基于潜在剖面分析的四人物类型学,并用序列贝叶斯和循环神经网络从有限发帖历史中恢复人物类型,发现人物匹配响应虽能实现行为转变,但临床专家更偏好通用共情。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17524 2026-06-29 cs.LG 新提交 87%

Learning to Refine Hidden States for Reliable LLM Reasoning

学习精炼隐藏状态以实现可靠的LLM推理

Chia-Hsuan Hsu, Jui-Ming Yao

机构 * Tongyu0924

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出ReLAR框架,通过强化学习引导的潜在状态精炼,自适应调整推理步数和方向,提升复杂多步推理的准确性和稳定性,降低推理开销。

Comments Code is available at tongyu0924/Learning-to-Refine-Hidden-States

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03269 2026-06-29 cs.AI 版本更新 86%

Distilling Answer-Set Programming Rules from LLMs for Neurosymbolic Visual Question Answering

从LLM中蒸馏答案集编程规则用于神经符号视觉问答

Thomas Eiter, Nelson Higuera Ruiz, Johannes Oetsch

机构 * Vienna University of Technology ( TU Wien )(维也纳技术大学) Jönköping University(约克灵厄普大学)

专题命中 推理与问题求解 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出从大语言模型中蒸馏答案集编程规则的方法,以可解释的方式扩展视觉问答系统的推理能力,仅需少量示例即可生成正确规则。

Comments Under consideration in Theory and Practice of Logic Programming (TPLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20328 2026-06-29 cs.CV 版本更新 86%

HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization

混合潜在推理与解耦策略优化

Tao Cheng, Shi-Zhe Chen, Hao Zhang, Yixin Qin, Jinwen Luo, Zheng Wei

机构 * Tencent PCG(腾讯PCG) Tencent CSIG(腾讯CSIG)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出HyLaR框架,通过结合离散文本生成与连续视觉潜在表示,提升多模态大语言模型在细粒度感知和通用多模态理解中的性能。

Comments Accepted to ECCV 2026

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27909 2026-06-29 cs.CL cs.AI cs.GT cs.MA 新提交 82%

Triadic Werewolf: A Jester Role for Multi-Hop Theory of Mind in LLMs

三狼人杀:大型语言模型中多跳心智理论的丑角角色

Avni Mittal

专题命中 推理与问题求解 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过引入第三阵营“丑角”(Jester),将狼人杀游戏扩展为三方博弈,测试LLM的多跳心智理论能力。实验表明,模型常做出自毁行为,而自我学习能帮助部分模型学会微妙策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27397 2026-06-29 cs.MA cs.AI cs.GT 新提交 81%

SidConArena: An Environment Evaluating Agents in Open-Ended,Positive-Sum Bargaining Game

SidConArena:一个在开放、正和博弈中评估智能体的环境

Yeqi Feng, Yuxin Chen, Tianxing He

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出SidConArena基准框架,通过三阶段部分可观测随机博弈评估LLM智能体在开放、正和谈判中的经济决策能力,发现前沿模型虽表现更好但仍存在资源误估、谈判被动和长期规划不足。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21233 2026-06-29 cs.AI 版本更新 81%

Just Ask: Curious Code Agents Reveal System Prompts in Frontier LLMs

Just Ask: 好奇的代码代理揭示前沿大语言模型中的系统提示

Xiang Zheng, Yutao Wu, Hanxun Huang, Yige Li, Xingjun Ma, Bo Li, Yu-Gang Jiang, Cong Wang

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出JustAsk框架,利用代码代理的自主交互能力,通过在线探索策略自动提取大语言模型的隐藏系统提示,揭示了系统提示作为新兴安全漏洞。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27505 2026-06-29 cs.CV 新提交 80%

TruEye: Fine-Grained Detection of AI-Generated Human Subjects in Images

TruEye:图像中AI生成人物的细粒度检测

Jay Barot, Dan Lin

机构 * Vanderbilt University(范德堡大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出TruEye模型,通过掩码条件双流Transformer区分五种合成内容类别,实现AI生成或篡改人物与场景的细粒度检测和定位,无需大型语言模型,速度提升百倍。

Comments 18 Pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22873 2026-06-29 cs.CV cs.CL 新提交 79%

SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning

SingGuard: 一种策略自适应的多模态大语言模型护栏,具有动态推理能力

SingGuard Team

机构 * AI Security Lab, Ant Group(蚂蚁集团AI安全实验室)

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.CL

AI总结 提出SingGuard,一种策略自适应的多模态护栏模型,通过将策略作为运行时输入,支持快速、混合和慢速推理模式,实现动态规则下的安全评估,在多个基准上取得最优F1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28294 2026-06-29 cs.LG cs.MA 新提交 77%

Democratic ICAI: Debating Our Way to Steering Principles from Preferences

民主ICAI:通过辩论从偏好中推导指导原则

Kevin Kingslin, Anish Natekar, Ashutosh Ranjan, Vivek Srivastava, Savita Bhat, Shirish Karande

机构 * TCS Research(TCS研究)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.LG

AI总结 提出Democratic ICAI方法,通过结构化角色辩论收集多元理由,从偏好中提取更全面的指导原则,提升偏好预测准确性。

Comments Accepeted to the ICLR 2026 HCAIR Workshop, 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27644 2026-06-29 cs.CV 新提交 75%

CascadeOcc: Rethinking 3D Occupancy World Models with Cascaded VQ Representations

CascadeOcc: 用级联VQ表示重新思考3D占用世界模型

Kyumin Hwang, Wonhyeok Choi, Jaeyeul Kim, Jihun Park, Daehee Park, Sunghoon Im

机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出CascadeOcc,一种通过级联向量量化机制在自回归框架中利用占用表示内在结构层次,实现从粗到细的3D场景预测和运动规划,在4D占用预测和运动规划基准上取得优越性能。

Comments Accepted to IEEE Signal Processing Letters (SPL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13544 2026-06-29 eess.AS cs.AI cs.CL 新提交 73%

Adaptive Turn-Taking for Real-time Multi-Party Voice Agents

自适应轮流发言:面向实时多方语音代理

Soumyajit Mitra, Prabhat Pandey, Abhinav Jain, Shanmukha Sahith, K V Vijay Girish

机构 * Amazon AGI(亚马逊人工智能研究院) IIT Kharagpur, India(印度克里ш格布尔理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出ModeratorLM,一种基于角色条件的语音大模型,通过分块流式处理和链式推理,在多方对话中实现自适应轮流发言,显著提升轮流精度和召回率。

Comments Accepted for publication at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09731 2026-06-29 cs.CV cs.AI cs.CL 版本更新 73%

EXPLORE-Bench: Egocentric Scene Prediction with Long-Horizon Reasoning

EXPLORE-Bench:具有长视距推理的自我中心场景预测

Chengjun Yu, Xuhan Zhu, Chaoqun Du, Pengfei Yu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Foundation Model Team, Li Auto Inc.(蔚来汽车基础模型团队) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出EXPLORE-Bench基准,通过初始场景图像和动作序列预测最终场景,评估多模态大模型在自我中心长视距推理中的能力,发现与人类存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28166 2026-06-29 cs.AI 新提交 70%

Tandem Reinforcement Learning with Verifiable Rewards

具有可验证奖励的串联强化学习

Difan Jiao, Raghav Singhal, Robert West, Ashton Anderson

机构 * University of Toronto(多伦多大学) EPFL(瑞士联邦理工学院洛桑分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出串联强化学习(TRL),通过强弱模型交替生成推理链并共同奖励,在保持独立推理能力的同时提升模型间兼容性和可读性。

Comments 21 pages,7 figures,8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27736 2026-06-29 cs.AI cs.CR 新提交 70%

ToE: A Hierarchical and Explainable Claim Verification Framework with Dynamic Multi-source Evidence Retrieval and Aggregation

ToE:一种具有动态多源证据检索与聚合的分层可解释声明验证框架

Zhaoqi Wang, Zijian Zhang, Kun Zheng, Zhen Li, Xin Li, Chunlei Li, Jiamou Liu

机构 * School of Cyberspace Science and Technology, Beijing Institute of Technology(北京理工大学信息科学与技术学院) TravelSky Technology Limited(TravelSky技术有限公司) School of Computer Science, University of Auckland(奥克兰大学计算机科学学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出Tree of Evidence (ToE)框架,通过强化学习驱动的多源检索、证据评估和参数树聚合,实现可解释的自动事实核查,在多个数据集上提升4-24个百分点,尤其对抗性毒化输入效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03401 2026-06-29 cs.HC cs.AI cs.CV 版本更新 70%

Can LLMs Reason About Attention? Towards Zero-Shot Analysis of Multimodal Classroom Behavior

LLMs能否进行注意力推理?多模态课堂行为的零样本分析

Nolan Platt, Sehrish Nizamani, Alp Tural, Elif Tural, Saad Nizamani, Andrew Katz, Yoonje Lee, Nada Basit

机构 * Virginia Tech(弗吉尼亚理工大学) University of Virginia(弗吉尼亚大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一个隐私保护的分析流程,利用OpenPose和Gaze-LLE提取学生注意力信息,并通过QwQ-32B-Reasoning进行零样本分析,探讨LLMs在多模态行为理解中的潜力与局限。

Comments 8 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27947 2026-06-29 cs.CV 新提交 67%

Understanding How MLLMs Describe Artworks Using Token Activation Maps

理解多模态大语言模型如何通过Token激活图描述艺术品

Nicola Fanelli, Pasquale De Marinis, Raffaele Scaringi, Eva Cetinic, Gennaro Vessio, Giovanna Castellano

机构 * University of Bari Aldo Moro(巴里阿尔多莫罗大学) University of Zurich(苏黎世大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 使用Token激活图(TAM)分析MLLMs在描述艺术品时对视觉区域的依赖,发现不同语义类别的token在视觉基础上有显著差异,并比较了TAM与SAM~3开放词汇分割。

Comments Accepted at PRESTIGE workshop at ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27617 2026-06-29 cs.CL cs.LG 新提交 62%

Masked Language Flow Models

掩码语言流模型

Iskander Azangulov, Kianoosh Ashouritaklimi, Leo Zhang, Simon Vary, Patrick Rebeschini

机构 * CC BY 4.0(知识共享署名4.0国际许可)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出掩码语言流模型(MLFM),通过连续随机插值将掩码机制融入流语言模型,实现并行生成与多步推理的平衡,首次将流模型扩展到推理和指令跟随任务。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27596 2026-06-29 cs.CV cs.AI 新提交 57%

Dismantling Pathological Shortcuts: A Causal Framework for Faithful LVLM Decoding

拆除病理性捷径:忠实LVLM解码的因果框架

Liu Yu, Can Chen, Ping Kuang, Zhikun Feng, Fan Zhou, Gillian Dobbie

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 提出Fox框架,通过视觉注意力熵探针定位风险中介头,利用数值logit饱和进行因果干预,并结合冲突门控协同解码,消除视觉语言模型中的对象幻觉,实现忠实解码。

Comments 29 pages, 25 figures. Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04996 2026-06-29 cs.CY cs.CE cs.CL cs.HC cs.RO 57%

Agentic Vehicles for Human-Centered Mobility: Definition, Prospects, and Synergistic Co-Development with Vehicle Autonomy

面向人类中心的移动性:定义、前景以及与车辆自主性的协同发展

Jiangbo Yu, Raphael Frank, Luis Miranda-Moreno, Sasan Jafarnejad, Jonatas Augusto Manzolli, Fuqiang Liu, Jiyao Wang, Pavel Chernakov, Ali Eslami

机构 * Interdisciplinary Centre for Security, Reliability and Trust(跨学科安全、可靠与信任中心) University of Luxembourg(卢森堡大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 本文探讨了面向人类中心的移动性,提出了代理车辆的概念,指出自主性和代理性是相互关联但概念上不同的维度,并强调了协同发展的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28060 2026-06-29 cs.CV 新提交 50%

ReScene: Structured Indoor Scene Reconstruction from Multi-View Captures

ReScene: 基于多视角图像的结构化室内场景重建

Haoran Xu, Lechao Zhang, Daoguo Dong, Yan Gao, Xin Tan

机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 提出ReScene框架,通过层级视图选择和关系感知组装,解决多视角场景重建中跨视角关系融合与物理一致性难题,在ScanNet上实现几何、渲染和感知质量的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏