arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-07 至 2026-04-07 共收录 396 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 69 篇

2602.13218 2026-04-07 cs.AI cs.CL cs.LG cs.LO 67%

Scaling the Scaling Logic: Agentic Meta-Synthesis of Logic Reasoning

扩展扩展逻辑:代理元合成逻辑推理

Bowen Liu, Zhi Wu, Runquan Xie, Zhanhui Kang, Jia Li

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SSLogic框架,通过代理迭代生成和优化可执行的生成器-验证器对,生成具有新规则和难度梯度的任务家族,提升训练效率。

Comments 41 pages, 8 figures, 5 tables in the main body. Project page: https://github.com/AdAstraAbyssoque/Scaling-the-Scaling-Logic, typos corrected, claims cleared

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04081 2026-04-07 physics.comp-ph physics.ed-ph physics.soc-ph quant-ph 67%

Co-Authoring with AI: How I Wrote a Physics Paper About AI, Using AI

与AI共同撰写:我如何用AI写了一篇关于AI的物理学论文

Yi Zhou

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文探讨AI在科学写作中的作用,强调人类在保持物理逻辑和学术规范中的关键责任,提出必须发表完整的AI交互记录以确保科学记录的完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04009 2026-04-07 cs.SE 67%

Benchmarking and Evaluating VLMs for Software Architecture Diagram Understanding

对软件架构图理解的VLMs基准测试与评估

Shuyin Ouyang, Jie M. Zhang, Jingzhi Gong, Gunel Jahangirova, Mohammad Reza Mousavi, Jack Johns, Beum Seuk Lee, Adam Ziolkowski, Botond Virginas, Joost Noppen

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出SADU基准,评估VLMs在理解软件架构图作为结构化软件工程制品上的能力,揭示当前模型在图表推理和视觉关系定位方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03995 2026-04-07 cs.CV cs.SD 67%

A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning

多模态字体攻击在音频视觉推理中的系统研究

Tianle Chen, Deepti Ghadiyaram

机构 * Boston University(波士顿大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文研究多模态字体攻击对多模态大语言模型的影响,发现跨模态攻击比单模态攻击更有效,揭示了多模态推理中的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03877 2026-04-07 cs.CL cs.AI cs.LG 67%

When Models Know More Than They Say: Probing Analogical Reasoning in LLMs

当模型知道更多 than 它说:探测类比推理在 LLMs 中

Hope McGovern, Caroline Craig, Thomas Lippincott, Hale Sirin

机构 * Cambridge University(剑桥大学) Northeastern University(东北大学) Athenahealth Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了LLMs在类比推理任务中的表现,发现探测内部表示比提示性能更优,揭示了任务依赖性和提示机制的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03860 2026-04-07 cs.CR 67%

LiquiLM: Bridging the Semantic Gap in Liquidity Flaw Audit via DCN and LLMs

LiquiLM: 通过DCN和LLMs弥合流动性缺陷审计中的语义鸿沟

Zekai Liu, Xiaoqi Li, Wenkai Li, Zongwei Li

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出LiquiLM框架,结合LLMs和DCN,通过动态交互流动性关键合同与缺陷描述,弥合代码实现与高阶流动性意图间的语义鸿沟,有效检测流动性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03697 2026-04-07 cs.CV 67%

SGTA: Scene-Graph Based Multi-Modal Traffic Agent for Video Understanding

基于场景图的多模态交通代理:视频理解的模块化框架

Xingcheng Zhou, Mingyu Liu, Walter Zimmer, Jiajie Zhang, Alois Knoll

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 SGTA结合结构化场景图与多模态推理,通过检测、跟踪和车道提取构建交通场景图,并利用ReAct处理大语言模型的推理轨迹,实现复杂视频问题的可解释决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03696 2026-04-07 cs.CV 67%

FunFact: Building Probabilistic Functional 3D Scene Graphs via Factor-Graph Reasoning

FunFact:通过因子图推理构建概率性功能3D场景图

Zhengyu Fu, René Zurbrügg, Kaixian Qu, Marc Pollefeys, Marco Hutter, Hermann Blum, Zuria Bauer

机构 * ETH Zürich(苏黎世联邦理工学院) Microsoft(微软) University of Bonn & Lamarr Institute(波恩大学与拉马尔研究所)

专题命中 推理与问题求解 :LLM(abstract);foundation model(abstract)

AI总结 FunFact通过因子图推理构建概率性功能3D场景图,结合语义和几何先验,提升场景功能理解的鲁棒性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00318 2026-04-07 cs.CV 67%

Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning

链式帧:通过帧感知推理推进多模态大语言模型的视频理解

Sara Ghazanfari, Francesco Croce, Nicolas Flammarion, Prashanth Krishnamurthy, Farshad Khorrami, Siddharth Garg

机构 * New York University(纽约大学) EPFL(瑞士联邦理工学院洛桑分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出一种单阶段视频LLM,通过显式引用相关帧减少推理中的时间不一致性,利用COF-DATA数据集提升视频理解性能,发现合成数据显著提升模型准确率。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04386 2026-04-07 cs.AI 65%

Automatically Generating Hard Math Problems from Hypothesis-Driven Error Analysis

从假设驱动的错误分析自动生成难题

Jiayu Fu, Mourad Heddaya, Chenhao Tan

机构 * University of Chicago(芝加哥大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI;large language model(comments);language model(comments)

AI总结 本文提出了一种新的数学基准生成流程,利用AI生成的假设识别LLM在特定数学概念上的弱点,并生成针对性难题。实验表明,假设准确性与生成难题难度正相关,且该流程可扩展至其他领域。

Comments 8 pages (without reference and appendix), 4 figures, 1 table, accepted by ICLR 2026 Workshop of Logical Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20814 2026-04-07 cs.CV cs.AI cs.LG 62%

SPHINX: A Synthetic Environment for Visual Perception and Reasoning

SPHINX:一个用于视觉感知与推理的合成环境

Md Tanvirul Alam, Saksham Aggarwal, Justin Yang Chae, Nidhi Rastogi

机构 * Rochester Institute of Technology(罗彻斯特理工学院) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 SPHINX通过生成具有可验证解的谜题,评估视觉感知与推理能力,发现大模型表现不足,RLVR方法显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13998 2026-04-07 cs.RO cs.AI cs.LG 62%

Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation

Embodied-R1:强化的具身推理用于通用机器人操作

Yifu Yuan, Haiqin Cui, Yaoting Huang, Yibin Chen, Fei Ni, Zibin Dong, Pengyi Li, Yan Zheng, Hongyao Tang, Jianye Hao

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Embodied-R1,通过引入指向作为统一的中间表示,结合强化微调方法,实现通用机器人操作中的具身推理,展示了在多个基准测试中的卓越性能和零样本泛化能力。

Comments Embodied-R1 technical report v2; Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08548 2026-04-07 cs.RO cs.AI cs.LG 62%

From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation

从感知到行动:弥合推理与决策以实现机器人操作

Yifu Yuan, Haiqin Cui, Yibin Chen, Zibin Dong, Fei Ni, Longxin Kou, Jinyi Liu, Pengyi Li, Yan Zheng, Jianye Hao

机构 * Tianjin University(天津大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FSD模型,通过空间关系推理生成中间表示,提升机器人操作的泛化能力,在8个基准测试中表现优异,且在零样本任务中实现显著性能提升。

Comments Published as a conference paper at ICLR 2026. Our project homepage: https://embodied-fsd.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04908 2026-04-07 cs.LG 57%

HI-MoE: Hierarchical Instance-Conditioned Mixture-of-Experts for Object Detection

HI-MoE:基于实例的混合专家架构用于目标检测

Vadim Vashkelis, Natalia Trukhina

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 HI-MoE提出一种分层实例条件混合专家架构,通过两级路由机制提升目标检测效率,尤其在小目标检测上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04895 2026-04-07 cs.MA cs.AI 57%

Agentic Federated Learning: The Future of Distributed Training Orchestration

代理联邦学习:分布式训练编排的未来

Rafael O. Jarczewski, Gabriel U. Talasso, Leandro Villas, Allan M. de Souza

机构 * Institute of Computing, University of Campinas(坎皮纳斯州立大学计算研究所) Hub of Artificial Intelligence and Cognitive Architectures - H.IAAC(人工智能与认知架构中心 - H.IAAC)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出代理联邦学习框架,通过语言模型代理自主协调,缓解客户端异质性和系统动态波动,提升资源利用和公平性,推动联邦学习向去中心化生态系统演进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04190 2026-04-07 cs.AI 57%

Schema-Aware Planning and Hybrid Knowledge Toolset for Reliable Knowledge Graph Triple Verification

基于模式的规划和混合知识工具集的可靠知识图谱三元组验证

Xinyan Ma, Xianhao Ou, Weihao Zhang, Shixin Jiang, Runxuan Liu, Dandan Tu, Lei Chen, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Technologies Co., Ltd.(华为技术有限公司) Bay Area International Business School, Beijing Normal University(北京师范大学湾区国际商学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出SHARP,一种无需训练的自主代理,通过动态策略规划、主动调查和证据推理改进知识图谱三元组验证的稳定性与解释性,实验证明其在FB15K-237和Wikidata5M-Ind上准确率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04103 2026-04-07 cs.AI 57%

Compliance-by-Construction Argument Graphs: Using Generative AI to Produce Evidence-Linked Formal Arguments for Certification-Grade Accountability

基于构造的合规性论证图:利用生成式AI生成证据关联的正式论证以实现认证级问责

Mahyar T. Moghaddam

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出一种结合生成式AI与结构化正式论证表示的合规性架构,通过类型化论证图、检索增强生成、推理验证内核和溯源账本,确保论证的可验证性和可追溯性,防止不支持的主张进入决策记录。

Comments Accepted at FACCT 2026, IoT CPS Week

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03968 2026-04-07 cs.CR cs.AI 57%

TraceGuard: Structured Multi-Dimensional Monitoring as a Collusion-Resistant Control Protocol

TraceGuard:结构化多维监控作为抗合谋的控制协议

Khanh Linh Nguyen, Hoa Nghiem, Tu Tran

机构 * Independent Researchers(独立研究人员) Apart Research

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 本文提出TraceGuard,一种结构化多维监控协议,通过五个维度评估代理行为,结合LLM调用和启发式检测器,有效区分攻击与诚实行为,防止合谋攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03266 2026-04-07 cs.MA cs.LG 57%

Emergent Compositional Communication for Latent World Properties

涌现的组合通信用于潜在世界属性

Tomek Kaszyński

机构 * Independent Researcher, Amsterdam, Netherlands(独立研究者,阿姆斯特丹,荷兰)

专题命中 推理与问题求解 :pretraining(abstract);分类 cs.LG

AI总结 本文研究多智能体通信能否从冻结视频特征中提取离散组合性表示,展示通过Gumbel-Softmax瓶颈和迭代学习发展出无标签的组合协议,验证了感知先验对可通信信息的影响。

Comments 24 pages, 4 figures, 12 tables. Code: https://github.com/TomekKaszynski/emergent-physics-comm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03242 2026-04-07 cs.LG 57%

DRAFT: Task Decoupled Latent Reasoning for Agent Safety

草稿:任务解耦的潜在推理用于代理安全

Lin Wang, Junfeng Fang, Dan Zhang, Fei Shen, Xiang Wang, Tat-Seng Chua

机构 * National University of Singapore, Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.LG

AI总结 本文提出DRAFT框架,通过解耦安全判断为提取器和推理器两个阶段,利用潜在空间证据聚合提升代理安全性,在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18633 2026-04-07 cs.AI cs.ET 57%

An Onto-Relational-Sophic Framework for Governing Synthetic Minds

一个面向合成智能的本体-关系-Sophic框架

Huansheng Ning, Jianguo Ding

机构 * University of Science and Technology Beijing(北京科技大学) Blekinge Institute of Technology(布莱金厄理工学院)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 本文提出ORS框架,通过本体论、数字人格谱系和Cybersophy三支柱,解决合成智能的治理问题,展示其在自主研究代理和医疗AI等场景中的适应性治理能力。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02900 2026-04-07 cs.AI 57%

Seemingly Simple Planning Problems are Computationally Challenging: The Countdown Game

看似简单的规划问题具有计算挑战性:倒计时游戏

Michael Katz, Harsha Kokel, Sarath Sreedharan

机构 * IBM T. J. Watson Research Center(IBM T. J. Watson 研究中心) IBM San Jose(IBM 圣何塞) Colorado State University(科罗拉多州立大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 本文提出基于倒计时游戏的规划基准,该问题具有NP完全复杂性,能有效评估规划能力,实验显示现有LLM方法在该基准上仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15925 2026-04-07 cs.RO cs.AI cs.CV 57%

VERDI: VLM-Embedded Reasoning for Autonomous Driving

VERDI:嵌入视觉语言模型的自动驾驶推理

Bowen Feng, Zhiting Mei, Julian Ost, Filippo Ghilotti, Baiang Li, Roger Girgis, Anirudha Majumdar, Felix Heide

机构 * Princeton University(普林斯顿大学) Torc Robotics

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 VERDI通过在训练时整合视觉语言模型的推理过程和常识知识,提升自动驾驶系统的决策能力,实现更高效的模块化架构,同时保持快速推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04863 2026-04-07 cs.CV 50%

Beyond the Global Scores: Fine-Grained Token Grounding as a Robust Detector of LVLM Hallucinations

超越全局评分:细粒度令牌接地作为检测LVLM幻觉的稳健检测器

Tuan Dung Nguyen, Minh Khoi Ho, Qi Chen, Yutong Xie, Nguyen Cam-Tu, Minh Khoi Nguyen, Dang Huy Pham Nguyen, Anton van den Hengel, Johan W. Verjans, Phi Le Nguyen, Vu Minh Hieu Phan

机构 * Hanoi University of Science and Technology(河内科技大学) Australian Institute for Machine Learning, University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学) Nanjing University(南京大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Hanoi-Amsterdam High School for the Gifted(河内阿姆斯特丹天才高中)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出细粒度令牌接地方法,通过分析模型层间令牌交互,发现幻觉令牌的扩散注意力模式和语义对齐失败特征,实现90%的幻觉检测准确率。

Comments Accepted at CVPR2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04564 2026-04-07 cs.RO cs.CV 50%

Visual Prompt Based Reasoning for Offroad Mapping using Multimodal LLMs

基于视觉提示的越野制图推理使用多模态大语言模型

Abdelmoamen Nasser, Yousef Baba'a, Murad Mebrahtu, Nadya Abdel Madjid, Jorge Dias, Majid Khonji

机构 * Khalifa University(哈利法大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出一种零样本方法,利用SAM2进行环境分割和多模态大语言模型(VLM)进行可行驶区域推理,通过整合分割图像和原始图像实现越野制图推理,无需专门地形模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04500 2026-04-07 cs.CV 50%

Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward

Saliency-R1: 通过显著图对齐奖励增强可解释性和忠实的视觉-语言推理

Shizhan Gong, Minda Hu, Qiyuan Zhang, Chen Ma, Qi Dou

机构 * The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 Saliency-R1通过显著图对齐奖励提升视觉-语言模型的推理可解释性和忠实性,利用显著图技术高效突出关键图像区域,结合GRPO优化策略增强模型对相关区域的关注,实验显示提升推理忠实性和任务性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13193 2026-04-07 cs.RO 50%

Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control

可调节的视觉-语言-动作策略用于具身推理和分层控制

William Chen, Jagdeep Singh Bhatia, Catherine Glossop, Nikhil Mathihalli, Ria Doshi, Andy Tang, Danny Driess, Karl Pertsch, Sergey Levine

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出可调节策略,通过训练在丰富合成命令上的视觉-语言-动作模型,提升低层可控性,解锁预训练VLM知识,改进任务泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03855 2026-04-07 cs.DB 50%

VectraFlow: Long-Horizon Semantic Processing over Data and Event Streams with LLMs

VectraFlow:基于LLM的长时域语义处理数据与事件流

Shu Chen, Junhan Liu, Deepti Raghavan, Ugur Cetintemel

专题命中 推理与问题求解 :LLM(abstract)

AI总结 VectraFlow通过结合LLM与传统关系运算符,实现了对无结构数据流的长时域语义处理,提供连续语义运算符,支持自然语言意图到可执行运算图的转换,实现从原始文本到匹配事件群体的端到端模式检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03796 2026-04-07 cs.MA 50%

When AI Agents Disagree Like Humans: Reasoning Trace Analysis for Human-AI Collaborative Moderation

当AI代理像人类一样产生分歧:用于人机协作 moderation 的推理轨迹分析

Michał Wawer, Jarosław A. Chudziak

专题命中 推理与问题求解 :LLM(abstract)

AI总结 本文研究AI代理在仇恨言论 moderation 中的分歧模式,通过推理轨迹分析发现分歧结构比幅度更能预测人类判断需求,提出从共识寻求转向不确定性揭示的多代理设计。

Comments Accepted to the ICLR 2026 Workshop on "From Human Cognition to AI Reasoning: Models, Methods, and Applications (HCAIR)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 83 篇

2604.03758 2026-04-07 cs.SE cs.AI 90%

AutoReSpec: A Framework for Generating Specification using Large Language Models

AutoReSpec:一种利用大语言模型生成规范的框架

Ragib Shahariar Ayon, Shibbir Ahmed

机构 * Texas State University(德克萨斯州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出AutoReSpec框架,通过动态选择LLM和提示配置,结合协作模型反馈,提升规范生成的准确性和效率,实验显示其在成功概率和完整性上优于现有方法。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏