arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-13 至 2026-07-13 共收录 187 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 30 篇

2606.00726 2026-07-13 cs.AI 版本更新 70%

Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cognitive Behaviors in Reasoning LLMs

潜在奖励引导:一种自适应推理时框架,隐式促进推理大语言模型中的认知行为

Jiakang Li, Guanyu Zhu, Can Jin, Chenxi Huang, Dexu Yu, Ronghao Chen, Yang Zhou, Hongwu Peng, Xuanqi Lan, Dimitris N. Metaxas, Youhua Li

机构 * Rutgers University(罗格斯大学) South China Agricultural University(华南农业大学) Columbia University(哥伦比亚大学) Fenz.AI QuantaAlpha Adobe Santa Clara University(圣克拉拉大学) City University of Hong Kong(香港城市大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出潜在奖励引导(LRS)框架,通过优化稀疏自编码器潜在状态隐式促进认知行为,利用最终答案正确性训练潜在奖励模型估计中间状态质量,并在推理时提供状态特定的修正方向,实验表明该方法能提升推理性能并修复原始推理错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05559 2026-07-13 cs.AI 版本更新 70%

IFAR: Multi-Perspective and Multi-Level Causal Discovery with LLMs

IFAR:基于大语言模型的多视角多层次因果发现

Jinwei He, Feng Lu

机构 * Beihang University(北航大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型溯因推理中多视角多层次原因这一挑战,提出IFAR框架,结合广义反向推理与正向验证,构建专门数据集,实验表明该框架能提升大语言模型溯因推理性能,在F1分数等方面有显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09179 2026-07-13 cs.CR cs.SE 新提交 67%

Malaika: Understanding Malware through Tri-Grounded Agentic Reasoning

Malaika:通过三重基础的智能推理理解恶意软件

Xingzhi Qian, Xinran Zheng, Yiling He, Lorenzo Cavallaro

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 研究针对恶意软件理解挑战,将其视为基础推理问题,提出需三种基础形式。介绍多智能体框架Malaika,通过受分析师启发的推理等实现三种基础机制,用于安卓恶意软件分析,实验表明该框架提高分析质量,为可靠恶意软件理解及软件分析提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09123 2026-07-13 cs.SE 新提交 67%

ReProAgent: Tool-Augmented Multi-Stage Agentic Generation of Bug Reproduction Tests from Issue Reports

ReProAgent:从问题报告中通过工具增强的多阶段代理生成错误重现测试

Quanjun Zhang, Yi Zheng, Ye Shang, Weifeng Sun, Haichuan Hu, Chunrong Fang, Zhenyu Chen, Liang Xiao

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 研究提出ReProAgent多阶段代理框架,从问题报告生成错误重现测试,将任务分解为四个阶段,集成多种工具支持各阶段,实验表明其能成功重现较多问题,优于基线,还可跨模型泛化并提升下游问题解决性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07361 2026-07-13 cs.CV 新提交 67%

BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning

BUS:用于高级多模态推理的受脑启发的无监督自我反思

Jiacheng Yang, Tongying Xiao, Yunkai Dang, Cong Wang, Yuekun Yang, Qi Fan, Tianyu Ding, Wenbin Li, Feng Miao, Yang Gao

机构 * AAAI Press(美国人工智能协会出版社)

专题命中 推理与问题求解 :language model(abstract);SFT(abstract)

AI总结 研究针对VLM处理复杂视觉任务的不足,受脑启发提出BUS无监督训练框架,通过反向预测提升其反思推理能力,无需标注数据,与多种微调方法兼容,经实验验证在多任务中有效提升了VLM推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29943 2026-07-13 cs.CV 版本更新 67%

Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting

EC-Bench:超长视频的枚举与计数基准

Fumihiko Tsuchiya, Taiki Miyanishi, Shunsuke Yasuki, Mahiro Ukai, Nakamasa Inoue, Shuhei Kurita, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo, Japan(东京大学) Institute of Science Tokyo, Japan(东京科学大学) National Institute of Informatics, Japan(国立信息学研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 EC-Bench针对超长视频的枚举与计数问题,通过152部超过30分钟的视频和1699个查询,评估多模态大语言模型的性能,揭示模型在时间推理和计数任务中的局限性。

Comments The first two authors are equally contributed. The data and code are publicly available at: https://github.com/matsuolab/EC-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09061 2026-07-13 cs.CV cs.AI cs.LG 新提交 62%

On Locality and Length Generalization in Visual Reasoning

关于视觉推理中的局部性和长度泛化

Pulkit Madan, Sanjay Haresh, Reza Ebrahimi, Sunny Panchal, Apratim Bhattacharyya, Roland Memisevic

机构 * Qualcomm AI Research(高通人工智能研究中心)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究从视觉状态跟踪和长度泛化角度,探讨局部、顺序视觉模型是否有计算优势。受语言模型启发,研究简单视觉任务中视觉模型行为。发现其会利用全局捷径,基于严格局部感知的策略可缓解此问题,表明局部注意力对稳健组合泛化很关键。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09366 2026-07-13 cs.SE cs.AI cs.LO 新提交 57%

Diversifying to Verify: When Task-Equivalent Programs Differ in Verifiability

多样化以进行验证:当任务等效程序在可验证性上存在差异时

Shirley Yu, Ruben Martins

机构 * Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究任务等效程序的可验证性差异,提出基于大型语言模型的Diversify2Verify管道,通过推断契约、生成测试不同实现并修复注释来验证,构建基准测试,结果表明实现多样性有助于验证,提高了验证成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09217 2026-07-13 cs.AI cs.MS 新提交 57%

OpenProver: Agentic and Interactive Theorem Proving with Lean 4

OpenProver:使用Lean 4进行智能且交互式的定理证明

Matěj Kripner, Milan Straka

机构 * Charles University, Faculty of Mathematics and Physics(查尔斯大学数学与物理系)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 介绍用于大语言模型驱动的自动化定理证明的开源系统OpenProver,它集成特定架构,完全开源,能自动验证证明,提供交互式界面,通过在ProofNet上评估展示自动验证在定量消融实验中的潜力。

Comments 7 pages, 2 figures. Accepted at the 19th Conference on Intelligent Computer Mathematics (CICM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23449 2026-07-13 cs.AI cs.CR cs.SE 版本更新 57%

Beyond Embeddings: Interpretable Feature Extraction for Binary Code Similarity

超越嵌入:用于二进制代码相似性的可解释特征提取

Charles E. Gagnon, Steven H. H. Ding, Philippe Charland, Benjamin C. M. Fung

机构 * Defence Research and Development Canada(加拿大国防研究与发展署) McGill University(麦吉尔大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究二进制代码相似性检测问题,利用基于语言模型的智能体对汇编代码结构化推理分析生成可解释特征,无需匹配训练,在跨架构和跨优化任务中召回率表现良好,结合嵌入优于现有技术,实现准确性、可扩展性和可解释性共存。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09072 2026-07-13 cs.SE 新提交 50%

Agentic Proof and Property-Based Testing via Property-Templates in Data-Intensive Computing

通过数据密集型计算中的属性模板进行智能体证明和基于属性的测试

Seongmin Lee, Yaoxuan Wu, Miryung Kim

专题命中 推理与问题求解 :LLM(abstract)

AI总结 研究软件工程中意图规范和验证问题,提出用属性模板解决验证候选属性和实施PBT的子问题,设计智能体双轨验证框架,经评估该框架能提高证明成功率、减少幻觉、降低成本并提升代码覆盖,还能发现模型与实现差距。

Comments 12 pages, 7 figures, 4 tables; supplementary material included as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09054 2026-07-13 cs.SE 新提交 50%

Automating Just-In-Time Python Type Annotation Updating

自动化即时Python类型注释更新

Zhipeng Xue, Zhipeng Gao, Xing Hu, Jingyuan Chen, Xin Xia, Shanping Li

专题命中 推理与问题求解 :LLM(abstract)

AI总结 研究Python项目中类型注释易过时问题,提出基于大语言模型的TypeUp方法自动更新类型注释,能依据旧注释和代码更改生成新注释,性能优于现有方法,在实际项目评估中展现实用价值。

Comments 12 pages, accepted by ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 31 篇

2510.03595 2026-07-13 cs.CL 版本更新 89%

Decoupling Task-Solving and Output Formatting in LLM Generation

在大语言模型生成中解耦任务解决与输出格式

Haikang Deng, Po-Nien Kung, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对大语言模型任务指令与格式要求交织致性能下降的问题,提出解耦框架Deco-G,将格式遵循委托给单独模块,引入指令感知蒸馏等三项创新,实验证明其优于基线方法,能保证格式符合。

Comments Update to the latest ACL published version and add a link to the released code

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), Association for Computational Linguistics, 2026, pp. 16764-16781

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09091 2026-07-13 cs.CV 新提交 87%

Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

超越时间偏移:将全能语言模型(Omni-LLM)适配为生成式视听模型的无参考评估器

Yijie Qian, Juncheng Wang, Chao Xu, Huihan Wang, Yuxiang Feng, Yang Liu, Baigui Sun, Yong Liu, Shujun Wang

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) IROOTECH TECHNOLOGY(易路泰克科技)

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 研究针对视听生成模型跨模态同步评估难题,提出框架解决人类与自动化评估指标的矛盾。通过引入数据集、适配模型及提出优化方法,实现先进的人类偏好对齐,建立标准化基准推动评估从信号相关性到因果关系发展。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09524 2026-07-13 cs.SE 新提交 85%

Balancing Usefulness and Naturalness: An LLM-based Curation Pipeline for Code Review Comments

平衡有用性和自然性:基于大语言模型的代码审查评论整理管道

Oussama Ben Sghaier, Martin Weyssow, Houari Sahraoui

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对现有代码审查数据集质量问题限制大语言模型在代码审查任务中效用的情况,提出两种整理管道。一种用大语言模型重述评论生成CuREV数据集,另一种以高质量示例为指导增强评论真实性和多样性,提升了代码审查数据集质量和下游任务效果。

Comments arXiv admin note: substantial text overlap with arXiv:2502.03425

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09007 2026-07-13 cs.SE quant-ph 新提交 83%

Benchmarking Large Language Models on Repairing Qiskit Programs using Bugs4Q

使用 Bugs4Q 对修复 Qiskit 程序的大语言模型进行基准测试

Saumya Brahmbhatt, Mitali Hukkeri, Dongchan Kim, M. V. Panduranga Rao, Lei Zhang

专题命中 评测与基准 :large language model(title);language model(title)

AI总结 研究使用 Bugs4Q 对修复 Qiskit 程序的大语言模型进行基准测试,评估两个含 67 个缺陷的 Bugs4Q 版本,在六个 Qiskit 版本上测试四个大语言模型,发现问题并发布重新验证的基准测试,强调基准验证先于修复评估。

Comments 4 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09526 2026-07-13 cs.CV cs.AI 新提交 83%

ALICE: Learning a General-Purpose Pathology Foundation Model from Vision, Vision-Language, and Slide-Level Experts

ALICE:从视觉、视觉语言和玻片级专家学习通用病理学基础模型

Jiawen Li, Tian Guan, Huijuan Shi, Xitong Ling, Mingxi Fu, Anjia Han, Chao He, Yonghong He

机构 * Institute of Biopharmaceutical and Health Engineering, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学生物医药与健康工程研究院,清华大学深圳国际研究生院) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Department of Pathology, The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院病理科) Medical Optical Technology R&D Center, Research Institute of Tsinghua, Pearl River Delta(清华珠三角研究院医学光学技术研发中心)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 研究提出通过多阶段凝聚蒸馏训练的ALICE统一基础模型,将多种教师模型知识整合到单个主干。它在大量图像上预训练,经多场景多任务评估,在任务匹配病理基础模型中平均排名最佳,证明凝聚蒸馏可整合能力用于广泛病理学应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08981 2026-07-13 cs.SE cs.AI 新提交 83%

The Patchwork Problem in LLM-Generated Code

大语言模型生成代码中的拼凑问题

Viraaji Mothukuri, Reza M. Parizi

机构 * Decentralized Science Lab, College of Computing and Software Engineering(分布式科学实验室,计算机与软件工程学院)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究大语言模型生成代码中的拼凑问题,将结构一致性形式化并引入故障分类法,提出混合验证框架,经实证评估和真实世界验证,揭示多数结构故障难被现有检查发现,模型间故障模式有别,此类故障普遍存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20064 2026-07-13 cs.PL cs.AI cs.CR 版本更新 81%

The LLMbda Calculus: AI Agents, Conversations, and Information Flow

LLMlambda 计算:人工智能代理、对话与信息流

Zac Garby, Andrew D. Gordon, David Sands

机构 * University of Nottingham, UK(诺丁汉大学) University of Edinburgh, UK(爱丁堡大学) Chalmers University of Technology(查尔姆斯理工大学) The University of Gothenburg, Sweden(哥德堡大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种无类型的lambda计算模型,用于形式化描述和验证人工智能代理中对话和信息流的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07720 2026-07-13 cs.LG cs.AI 新提交 81%

Omni-Sleep: A Sleep Foundation Model via Hierarchical Contrastive Learning of CNS-ANS Dynamics

全睡眠:一种通过中枢神经系统-自主神经系统动态分层对比学习的睡眠基础模型

Zhoujie Hou, Song Wang, Kexin Lou, Mo Wang, Chen Wei, Quanying Liu

机构 * Department of Biomedical Engineering, Southern University of Science and Technology(南方科技大学生物医学工程系) Omni-Intelligence(全知智能) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 介绍全睡眠模型,利用CNS/ANS划分,通过分层对比学习的三个目标进行拓扑约束表示学习,在多中心多模态PSG数据预训练后用于睡眠分期和多疾病分类,性能优于基线,凸显生理层次对睡眠表示学习的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07047 2026-07-13 cs.CL cs.AI 新提交 81%

Riemannian Geometry for Pre-trained Language Model Embeddings

预训练语言模型嵌入的黎曼几何

Szczepan Konior, Alexandre Quemy, Przemysław Klocek, Bartłomiej Sobieski, Grégoire Cattan

机构 * IBM Automation and AI(IBM自动化与人工智能) Hother(霍瑟) University of Warsaw(华沙大学) Centre for Credible AI, Warsaw University of Technology(华沙理工大学可信人工智能中心)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究预训练语言模型嵌入的几何结构,提出黎曼均值池化方法,通过提取回拉度量并聚合,在三个数据集上RMP优于欧几里得均值池化,消融实验定位增益来源,训练好的编码器在特定数据集贡献额外信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09553 2026-07-13 cs.SE 新提交 80%

Writing Bug Reports for Software Repair Agents: What Information Matters Most?

为软件修复代理编写错误报告:哪些信息最重要?

Vincenzo Luigi Bruno, Alessandro Giagnorio, Daniele Bifolco, Leon Wienges, Massimiliano Di Penta, Gabriele Bavota

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 研究软件开发中为软件修复代理编写错误报告的问题,通过对错误报告分类标注,用三个LLM主干运行mini-swe-agent,拟合回归模型,发现定位线索和建议修复等信息对代理成功更重要,传统对人类有用的信息作用较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18613 2026-07-13 cs.CL cs.AI 新提交 79%

Are LLMs Ready to Assist Physicians? PhysAssistBench for Interactive Doctor-Patient-EHR Assistance

LLMs 是否已准备好辅助医生?PhysAssistBench:交互式医患-电子病历辅助基准

Tianming Du, Peijie Yu, Sihan Shang, Danli Shi, My Linh Nguyen, Shengbo Gao, Guangyuan Li, Yinghong Yu, Yan Jiang, Qianlong Zhao, Behzad Bozorgtabar, Shaoxiong Ji, Jiazhen Pan, Daniel Rueckert, Jiancheng Yang

机构 * Aalto University(阿尔托大学) Tencent(腾讯) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Hong Kong Polytechnic University(香港理工大学) Aarhus University(奥胡斯大学) Technical University of Munich(慕尼黑工业大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出PhysAssistBench基准,通过构建交互式患者代理评估LLM在医患-EHR交互中的协调能力,发现当前模型不可靠,瓶颈在于多维度协调而非单一能力。

Comments 34 pages with 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09016 2026-07-13 cs.CR cs.SE 新提交 78%

SLBench: Evaluating How LLM Agents Follow Logical Relations in Skills

SLBench:评估大语言模型智能体在技能中遵循逻辑关系的情况

Xuan Chen, Chengpeng Wang, Lu Yan, Xiangyu Zhang

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究评估大语言模型智能体遵循逻辑关系情况,引入SkillLogic框架,构建SLBench基准,扫描超500个公共技能,评估发现不安全率高,人工审核分析失败原因,还表明SLGuard可减少违规,确立遵循逻辑关系是技能引导智能体的可靠性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08952 2026-07-13 cs.HC 新提交 78%

Micro-level AI Feedback Features and Student Responses in Consecutive LLM Tutoring Interactions

连续大语言模型辅导交互中的微观层面人工智能反馈特征与学生反应

Shayla Sharmin, Mohammad Fahim Abrar, Roghayeh Leila Barmaki

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究自然辅导场景下连续用户与AI交互中反馈特征与学生反应的关系,聚焦具体阐述、情感语言和回复长度三个微观特征,通过数据分析发现具体阐述有助于学生理解,凸显跨交互检查反馈的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05711 2026-07-13 cs.CV 版本更新 78%

Any to Full: Prompting Depth Anything for Depth Completion in One Stage

任何到完整:提示深度任何物以完成深度估计的一阶段

Zhiyuan Zhou, Ruofeng Liu, Taichi Liu, Weijian Zuo, Shanshan Wang, Zhiqing Hong, Desheng Zhang

机构 * Rutgers University(罗格斯大学) Michigan State University(密歇根州立大学) JD Logistics(京东物流) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :prompting(title,abstract)

AI总结 Any2Full提出一种单阶段深度完成框架,通过尺度提示适应预训练MDE模型,提升鲁棒性和效率,优于现有方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09076 2026-07-13 cs.CV 版本更新 78%

ProSGNeRF: Progressive Dynamic Neural Scene Graph with Frequency Modulated Foundation Model in Urban Scenes

ProSGNeRF:城市场景中基于频率调制基础模型的渐进式动态神经场景图

Tianchen Deng, Yanbo Wang, Yejia Liu, Chenpeng Su, Jingchuan Wang, Danwei Wang, Shao-Yuan Lo, Weidong Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) National Taiwan University(国立台湾大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 针对大规模城市场景中快速移动对象建模及相机自我运动处理难题,提出ProSGNeRF,通过渐进式场景图网络架构学习局部场景表示,利用基础模型网络编码潜码并引入频率调制模块,提升视图合成等能力。

Comments Accepted by IJCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09510 2026-07-13 cs.SE cs.AI 新提交 77%

Failure as a Process: An Anatomy of CLI Coding Agent Trajectories

失败作为一个过程:CLI编码代理轨迹剖析

Xiangxin Zhao, Han Li, Shuaiting Li, Tianyi Zhao, Earl T. Barr, Federica Sarro, He Ye

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究CLI编码代理失败轨迹,引入面向过程框架,收集并标注大量执行轨迹,发现失败多由认知错误驱动,起始于最初几步且常隐藏,提出提高编码代理可靠性需早期验证和干预,而非仅靠最终结果评估。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12920 2026-07-13 cs.MA cs.AI cs.CL 版本更新 73%

Embodied Multi-Agent Coordination by Aligning World Models Through Dialogue

通过对话对齐世界模型实现具身多智能体协调

Vardhan Dongre, Dilek Hakkani-Tür

机构 * Siebel School of Computing & Data Science(计算机与数据科学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究通过对话机制探索具身智能体的世界模型对齐,发现对话能减少冲突但降低任务成功率,提出评估世界模型对齐的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09197 2026-07-13 cs.MA 新提交 71%

When is Routing Meaningful? Diversity and Robustness in Language Model Societies

路由何时有意义?语言模型社会中的多样性和鲁棒性

Fantine Huot, Michael Kaisers, Mirella Lapata

专题命中 评测与基准 :language model(title)

AI总结 研究多模型系统路由策略何时有意义,通过适应分层社会熵并引入基于扰动的度量来诊断失败模式,应用于EmbedLLM和RouterBench,发现HSE收益递减,KNN路由器扰动下鲁棒性差,提示路由稳定,揭示准确性与意义可能背离。

详情

展开后加载摘要…

URL PDF HTML 收藏