arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18810 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18810 篇

2607.02448 2026-07-08 cs.MA 新提交 89%

AgentsCAD: Automated Design for Manufacturing of FDM Parts via Multi-Agent LLM Reasoning and Geometric Feature Recognition

AgentsCAD: 通过多智能体大语言模型推理和几何特征识别实现FDM零件的自动化制造设计

Emmanuel George, Christopher Keefe, Peter Pak, Amir Barati Farimani

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 提出AgentsCAD多智能体系统,结合B-Rep几何解析与LLM推理,自动检测FDM零件悬垂缺陷并生成修改建议,输出修正STEP文件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01641 2026-07-03 cs.SE 新提交 89%

When Agents Do Not Stop: Uncovering Infinite Agentic Loops in LLM Agents

当智能体不停止:揭示LLM智能体中的无限循环

Xinyi Hou, Shenao Wang, Yanjie Zhao, Haoyu Wang

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出IAL-Scan静态分析工具,通过抽象智能体代码为Agent IR并构建循环依赖图,检测LLM智能体项目中因反馈路径未有效约束导致的无限循环故障,在6549个仓库中达到91.9%精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16662 2026-07-03 cs.MA 版本更新 89%

Evaluating Collective Behaviour of Hundreds of LLM Agents

评估数百个LLM代理的集体行为

Richard Willis, Jianing Zhao, Yali Du, Joel Z. Leibo

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出框架评估LLM代理在社会困境中的涌现行为,通过自然语言策略生成与代码翻译,分析行为指纹、自博弈福利及文化演化,发现大群体中文化演化收敛至低福利自私均衡。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01213 2026-07-02 cs.SE 新提交 89%

RepoRescue: An Empirical Study of LLM Agents on Whole-Repository Compatibility Rescue

RepoRescue: LLM智能体在全仓库兼容性修复上的实证研究

Zhihao Lin, Mingyi Zhou, Zhensu Sun, Yizhuo Yang, Renyu Yang, David Lo, Li Li

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 研究LLM智能体能否自动修复因环境演化而失效的旧仓库,提出RepoRescue基准,包含315个仓库,评估多种智能体系统,发现跨文件协调是主要难点,且系统间互补性显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01138 2026-07-02 cs.CR 新提交 89%

Antaeus: Hunting Repository-Level Logic Vulnerabilities via Context-Grounded LLM Reasoning

Antaeus: 通过上下文锚定的LLM推理发现仓库级逻辑漏洞

Michele Armillotta, Nicolò Romandini, Rebecca Montanari, Lorenzo Cavallaro

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出Antaeus框架,通过仓库级代码上下文锚定LLM推理,结合函数优先级排序、上下文推理、比较验证和结构化报告,有效检测逻辑漏洞,在28个仓库中检测出15个漏洞,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27416 2026-06-29 cs.MA cs.SE 新提交 89%

Glite ARF: Verifier-Driven Research with Parallel LLM Coding Agents

Glite ARF:基于验证器的并行LLM编码代理研究

Vassili Philippov, Pavel Katunin, Dmitry Andreev, Igor Ostanin, Anton Nikolaev

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出Glite ARF框架,通过确定性验证器脚本强制执行任务隔离和不可变性,实现并行LLM编码代理的可重复研究,在BEA 2026词汇难度共享任务中取得领先结果。

Comments 13 pages, 6 figures, 7 tables. Open-source framework (Apache-2.0) and a public demo project at https://github.com/GliteTech/glite-arf and https://github.com/GliteTech/research-ace-cefr

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04806 2026-06-29 cs.SE 版本更新 89%

MIRAGE: Online LLM Simulation for Microservice Dependency Testing

MIRAGE:微服务依赖测试的在线LLM模拟

XinRan Zhang

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 MIRAGE通过在线LLM模拟动态响应微服务依赖请求,提升测试场景的覆盖率和准确性,尤其在错误处理和代码推理方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26545 2026-06-26 cs.SE 新提交 89%

ConcoLixir: Reactive LLM Discovery Oracles for Python Concolic Testing

ConcoLixir:用于Python符号执行的响应式LLM发现预言

Dong Chen, Chih-Duo Hong, Fang Yu

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 针对Python符号执行中库调用降级、语义操作难解和路径覆盖停滞问题,提出ConcoLixir,利用LLM作为发现预言生成种子、输入并引导覆盖,平均行覆盖率提升8.6-17.0个百分点,成本仅$1.63。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26377 2026-06-26 cs.CR 新提交 89%

Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats

验证意图与危害:针对LLM生成威胁的统一防御

Poojitha Thota, Yun Lei, Santhosh Thangaraj, Siddhartha Reddy Jonnalagadda, Shirin Nilizadeh

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一种联合验证用户提示意图和模型响应危害的防御框架,通过专门分析器与裁决器协同工作,在五个威胁类别上平均F1提升至0.95,攻击成功率降至4.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25497 2026-06-25 cs.RO 新提交 89%

SAGE-Nav: Leveraging LLM Planning and Alignment Fusion for Hierarchical Scene Graph-Guided Navigation

SAGE-Nav:利用LLM规划与对齐融合的分层场景图引导导航

Hao Su, Yuehao Huang, Yukai Ma, Yong Liu, Jiajun Lv

机构 * Zhejiang University(浙江大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出SAGE-Nav分层框架,结合大语言模型与动态场景图,通过解耦全局语义规划与高频反应控制,实现高效目标导航,在i-THOR和RoboTHOR中达到最优性能。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25388 2026-06-25 cs.DB 新提交 89%

TabClean: Reusable LLM-Synthesized Programs for Tabular Data Cleaning

TabClean: 用于表格数据清洗的可复用LLM合成程序

Yibo Wang, Riteng Zhang, Yinghao He, Yongye Su, Bharat Bhargava, Chunwei Liu

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出TabClean系统,通过将LLM推理编译为可复用的带守卫修复程序,实现无模型训练的表格数据清洗,在五个基准数据集上F1优于基线,并大幅降低重复运行成本。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24094 2026-06-24 cs.CV 新提交 89%

Universal Guideline-Driven Image Clustering via a Hybrid LLM Agent

通用指南驱动图像聚类:基于混合LLM代理

Wenliang Zhong, Rob Barton, Lucas Goncalves, Kushal Kumar, Feng Jiang, Hehuan Ma, Yuzhi Guo, Vidit Bansal, Karim Bouyarmane, Junzhou Huang

机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校) Amazon(亚马逊)

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出首个通用图像聚类框架,通过文本指南弥合任务差异,利用生成式概念代理建模和基于最小生成树的LLM遍历,在多种聚类场景中超越专用方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22337 2026-06-24 econ.TH cs.GT econ.GN q-fin.EC 新提交 89%

Theorist Toolbox: Tools for Agent Based LLM-assisted economic theory Research

理论家工具箱:基于智能体的LLM辅助经济理论研究工具

Moran Koren

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一种验证优先的经济理论LLM辅助协议,通过三种可重用方法(单次检查、对抗性证明-验证对、多智能体项目)在等级膨胀的Gans-Kominers特征模型上设计Groves/Pigouvian激励机制的实例验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20922 2026-06-23 cs.CR 新提交 89%

Think Twice Before You Act: Protecting LLM Agents Against Tool Description Poisoning via Isolated Planning

三思而后行:通过隔离规划保护LLM代理免受工具描述投毒攻击

Shanghao Shi, Xiao Wang, Chaoyu Zhang, Hao Li, Wenjing Lou, Thomas Hou, Yevgeniy Vorobeychik, Chongjie Zhang, Ning Zhang

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出Tool-Guard系统级防御,通过隔离规划机制将可疑工具调用隔离到受感染列表,阻断投毒描述持续影响,在AgentDojo和ASB基准上显著降低攻击成功率并保持任务效用。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22354 2026-06-23 cs.RO 版本更新 89%

LLM-Based Generalizable Hierarchical Task Planning and Execution for Heterogeneous Robot Teams with Event-Driven Replanning

基于LLM的异构机器人团队通用分层任务规划与执行及事件驱动重规划

Suraj Borate, Bhavish Rai B, Vipul Pardeshi, Madhu Vadali

机构 * Department of Mechanical Engineering, IIT Gandhinagar(印度加尔各直辖区理工学院机械工程系) Sahyadri College of Engineering and Management(萨哈亚德里工程与管理学院) Vishwakarma Institute of Information Technology(维什瓦克arma信息技术学院)

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出CoMuRoS架构,结合集中式规划与分布式执行,通过LLM解释自然语言目标、分配子任务,并支持事件驱动重规划,在硬件实验中实现自主恢复和协调运输。

Comments full version of this short paper is accepted at Frontiers in Robotics and AI Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19826 2026-06-19 cs.CR cs.MA 新提交 89%

Heterogeneous LLM Debate Under Adversarial Peers: Honest Gains, Replacement Costs, and Resilience

对抗性同伴下的异构LLM辩论:诚实增益、替代成本与韧性

Prashanti Nilayam, Kiran Kumar Ramanna, Prashil Tumbade, Sankalp Nayak

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 研究异构LLM辩论中诚实与对抗性同伴对修正行为的影响,发现诚实同伴降低有害修正率,对抗性同伴则逆转,且异构性在已有对手时也能作为防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15020 2026-06-16 cs.CR 新提交 89%

Semantic Integrity Failures in Document-to-LLM Supply Chains

文档到LLM供应链中的语义完整性失败

Side Liu, Jiang Ming

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 研究文档到LLM应用中的隐藏提取层导致的split-view PDF攻击,发现25种提取间隙,评估16个处理栈和7个商业LLM服务,提出静态扫描工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26760 2026-06-15 cs.IR 版本更新 89%

Factorized Latent Reasoning for LLM-based Recommendation

基于分解潜在推理的LLM推荐方法

Tianqi Gao, Chengkai Huang, Zihan Wang, Cao Liu, Ke Zeng, Lina Yao

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对现有潜在推理方法用单向量表示用户意图难以捕捉多面偏好的问题,提出分解潜在推理框架,通过多因子注意力模块解耦偏好因子,结合正则化与强化学习提升推荐性能与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19945 2026-06-15 cs.CR 版本更新 89%

Multi-LLM Energy Reasoning for Binary-Free Zero-Day IoT Detection

多LLM能量推理用于无二进制零日物联网检测

Saeid Jamshidi, Foutse Khomh, Kawser Wazed Nafi, Omar Abdul-Wahab, Martine Bellaïche

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出一种无需二进制文件、架构无关的方法,通过三LLM推理架构和能量感知符号负载模型,利用高层描述符估计零日漏洞可能性,模拟评估显示高风险条件下预测概率提升20-35%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10612 2026-06-10 cs.CV 新提交 89%

GaussTrace: Provenance Analysis of 3D Gaussian Splatting Models with Evidence-based LLM Reasoning

GaussTrace:基于证据的LLM推理的3D高斯泼溅模型溯源分析

Haoliang Han, Ziyuan Luo, Renjie Wan

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出GaussTrace框架,通过属性统计分析和假设驱动的编辑模拟,结合大语言模型链式推理,构建3D高斯泼溅模型的有向溯源图,无需训练或编辑历史。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07940 2026-06-09 cs.CR 新提交 89%

SGTO-MAS: Secure Gorilla Troops Optimization for Multi-Agent LLM Systems

SGTO-MAS:面向多智能体大语言模型系统的安全大猩猩部队优化

Saeid Jamshidi

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 提出一种基于大猩猩部队优化的安全感知多智能体LLM协调方法,通过信任建模、风险感知和集体智能的联合优化,在性能、安全性和效率间取得平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16136 2026-06-09 cs.RO 版本更新 89%

Reward Evolution with Graph-of-Thoughts: A Bi-Level Language Model Framework for Reinforcement Learning

基于思维图的奖励进化:一种用于强化学习的双层语言模型框架

Changwei Yao, Xinzi Liu, Chen Li, Marios Savvides

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Tokyo(东京大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract)

AI总结 本文提出RE-GoT框架,结合LLM与VLM的图思维推理,通过任务分解和视觉反馈迭代优化奖励函数,实验表明在RoboGen和ManiSkill2任务中均优于现有方法。

Journal ref IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04259 2026-06-04 cs.CR cs.SE 89%

WildCode Revisited: A Comprehensive Empirical Study on the Security of LLM-Generated Code

WildCode 再探:关于 LLM 生成代码安全性的综合实证研究

Kobra Khanmohammadi, Pooria Roy, Raphael Khoury, Abdelwahab Hamou-Lhadj, Wilfried Patrick Konan, Alexander Da Re, Nicholas Rebelo Melo

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 通过大规模实证分析真实场景下 ChatGPT 生成的代码,研究其正确性与安全性,并评估常见提示工程策略的有效性,发现 LLM 生成的代码在安全性方面经常不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03030 2026-06-03 cs.GT econ.GN q-fin.EC 89%

Do Matching Mechanisms Work with LLM Agents?

匹配机制在LLM智能体市场中是否有效?

Yukihiro Hoshino, Ayato Kitadai, Nariaki Nishino

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 研究通过对比自由协商与集中式机制市场,发现基于机制的匹配市场在稳定性和效率上更优,且LLM智能体比人类更倾向于真实报告偏好,但策略证明性并非总能提高真实报告率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00669 2026-06-02 cs.CR 89%

NeuroLog: Reasoning You Can Audit -- Neuro-Symbolic Vulnerability Discovery via LLM Facts, Datalog, and SMT

NeuroLog: 可审计的推理——通过LLM事实、Datalog和SMT进行神经符号漏洞发现

Sanjay Rawat

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出NeuroLog流水线,结合LLM提取事实、Souffle规则组合和Z3后处理,实现无需构建的漏洞发现,并在多个真实项目中重新发现CVE级漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12813 2026-06-02 cs.CL cs.AI cs.CR cs.LG 89%

REALISTA: Realistic Latent Adversarial Attacks that Elicit LLM Hallucinations

REALISTA: 引发LLM幻觉的逼真潜在对抗攻击

Buyun Liang, Jinqi Luo, Liangzu Peng, Kwan Ho Ryan Chan, Darshan Thaker, Kaleab A. Kinfu, Fengrui Tian, Hamed Hassani, René Vidal

机构 * University of Waterloo(滑铁卢大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出REALISTA框架,通过潜在空间优化语义等价的对抗提示,有效引发大语言模型幻觉,优于现有方法。

Comments Accepted at ICML 2026. Code is available at https://github.com/Buyun-Liang/REALISTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30666 2026-06-01 cs.CY 89%

The Tutoring Effectiveness Index: Predicting LLM Math Tutor Quality from Four Conversation Signals

辅导效果指数:从四个对话信号预测LLM数学辅导质量

Shim Jaechang, Unggi Lee

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出无需训练和外部评判的辅导效果指数(TEI),通过四个内部推理信号选择冻结模型,将预错误场景的改进率从59.0%提升至81.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21305 2026-05-27 cs.SI 89%

LLM-Supported Content Analysis of Motivated Reasoning on Climate Change

LLM支持的气候变化动机推理内容分析

Yuheun Kim, Qiaoyi Liu, Jeff Hemsley

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究利用大语言模型对YouTube评论进行定性标注,结合社会网络分析和线性混合效应模型,发现气候变化讨论中不同话题的互动模式差异反映了动机推理。

Comments 11 pages, 3 figures. Accepted for ASIS&T 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13305 2026-05-26 cs.SE 89%

SAINT: Service-level Integration Test Generation with Program Analysis and LLM-based Agents

SAINT: 基于程序分析和LLM智能体的服务级集成测试生成

Rangeet Pan, Raju Pavuluri, Ruikai Huang, Rahul Krishna, Tyler Stennett, Alessandro Orso, Saurabh SInha

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出SAINT方法,结合静态分析、大语言模型和智能体,自动生成企业Java应用的服务级端点测试和场景测试,提升覆盖率和缺陷检测能力。

Comments Accepted at ICSE'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19915 2026-05-20 cs.MA cs.SI 89%

LLM Agents Make Collective Belief Dynamics Programmable: Challenges and Research Directions

LLM Agents Make Collective Belief Dynamics Programmable: Challenges and Research Directions

Xin He, Junxi Shen, Yuchen Mou, David M. Bossens, Caishun Chen, Ivor W. Tsang, Yew Soon Ong

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 本文研究了LLM代理如何使集体信念动态变得可编程,探讨了挑战和研究方向,通过多智能体模拟证明协调AI代理可以诱导可测量的信念变化,并识别了使检测和防御困难的四个结构性质。

详情

展开后加载摘要…

URL PDF HTML 收藏