arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12169 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 12169 篇

2606.24311 2026-06-24 cs.AI 新提交 81%

LemonHarness Technical Report

LemonHarness 技术报告

Kailong Ren, Fubo Sun, Jiachen Liu, Liu Yang, Zimo Yin, Jiaying Li, Congli Yin, Ming He, Yu Huo, Jiawei Liu, Zeping Chen, Yubin Huangfu, Ronghua Li, Yixuan Wu, Xing Su, Yanzhi Xu, Likang Wu, Hongke Zhao, Lei Zhang, Xiaohui Geng, Jianping Fan

机构 * Tianjin University(天津大学) Anhui University(安徽大学) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对长周期智能体因工作空间状态变化难以追踪的问题,提出LemonHarness框架,通过显式执行边界、可复用规则知识库和时感知执行机制,在Terminal-Bench 2.0上实现86.52%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21514 2026-06-23 cs.LG 新提交 81%

Towards Understanding the Power and Limits of the Muon Optimizer: A River-Valley Perspective

理解Muon优化器的能力与局限:河流-山谷视角

Tianqi Shen, Jinji Yang, Runze Shi, Jianhao Ma, Jiaye Teng, Ziye Ma

机构 * City University of Hong Kong (CityUHK)(香港城市大学) University of Pennsylvania(宾夕法尼亚大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出混合尖峰矩阵感知模型,从河流-山谷视角分析Muon优化器在早期加速收敛但后期易振荡的机制,并建议在最后阶段切换为GD类优化器。

Comments 44 pages, 13 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21397 2026-06-23 cs.CR cs.AI 新提交 81%

Evaluating LLMs for Real-World Web Vulnerability Detection

评估LLMs在真实世界Web漏洞检测中的表现

Sebastian Neef, Luca Jungnickel, Antonio Benjamin Buchholz, Valene Spence, Vicente Birke Gonzalez

机构 * Technische Universität Berlin(柏林技术大学) Freie Universität Berlin(柏林自由大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过基准测试六种前沿和开源LLMs在WordPress插件静态分析中的Web漏洞检测能力,发现模型和提示设计显著影响检测率,其中Claude Opus 4.6达到最高63%,但所有模型均存在报告不一致问题。

Comments To be published at AI&CCPS Workshop @ ARES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19924 2026-06-19 cs.AI 新提交 81%

The Tao of Agency: Autotelic AI, Embedded Agency and Dissolution of the Self

主体之道:自生目标人工智能、嵌入主体与自我的消解

Aritra Sarkar

机构 * Aritra Sarkar

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文探讨自生目标AI中主体生成自身目标的问题,通过内在动机、资源驱动先验、因果干预学习、稳态和嵌入性等概念,揭示嵌入性虽必要但不充分,并指出核心难题在于主体如何生成并相对化自我,最后提出量子表述、哲学解读和基于LLM的具体实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19735 2026-06-19 cs.AI cs.CV 新提交 81%

GLARE: A Natural Language Interface for Querying Global Explanations

GLARE: 用于查询全局解释的自然语言接口

Bhavan Vasu, Rajesh Mangannavar

机构 * Oregon State University(俄勒冈州立大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出基于LLM的交互接口GLARE,将自然语言问题转换为SQL查询以聚合局部解释数据,提升全局解释的可访问性和可用性。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01697 2026-06-18 cs.CL 版本更新 81%

RCEM: Robust Conversational Search EMbedder in Distributional Shift

RCEM:配备查询重写技能的嵌入器,用于分布偏移下的鲁棒对话搜索

Kilho Son, Paul Hsu, Cha Zhang, Dinei Florencio

机构 * Microsoft(微软)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出RCEM模型,通过将LLM的查询重写能力蒸馏到嵌入模型中,实现无需显式重写的上下文感知检索,在分布偏移下提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25929 2026-06-18 cs.MA cs.LG 版本更新 81%

Multi-Agent Systems are Mixtures of Experts: Who Becomes an Influencer?

多智能体系统是专家混合:谁成为影响者?

Franka Bause, Jonas Niederle, Martin Pawelczyk, Rebekka Burkholz

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.LG

AI总结 本文通过Friedkin-Johnsen意见动力学模型分析多智能体LLM协商机制,揭示输入依赖的FJ参数使系统成为专家混合,并探讨基于自信度、感知自信度和初始观点对齐的影响者形成机制。

Comments Accepted at the 2nd Workshop on Compositional Learning at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16867 2026-06-16 cs.CL 新提交 81%

Revisiting the Systematicity in Negation in the Era of In-Context Learning

重新审视上下文学习时代否定中的系统性

Hitomi Yanaka, Taisei Yamamoto

机构 * The University of Tokyo(东京大学) Riken(理化学研究所) Tohoku University(东北大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过行为与表征系统性分析,发现大型语言模型在上下文学习中能部分识别否定表达和范围,但无法完美执行,且功能向量在否定线索提取任务中可组合,但范围识别更具挑战。

Comments Accepted to the 6th Workshop Natural Language Meets Logic and Machine Learning (NALOMA2026) at ESSLLI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16817 2026-06-16 cs.CL cs.IR 新提交 81%

Understanding the Behaviors of Environment-aware Information Retrieval

理解环境感知的信息检索行为

Ruifeng Yuan, Chaohao Yuan, David Dai, Yu Rong, Hong Cheng, Hou Pong Chan, Chenghao Xiao

机构 * Fudan University(复旦大学) Alibaba DAMO Academy(阿里巴巴达摩院) Chinese University of Hong Kong(香港中文大学) Stanford University(斯坦福大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.CL

AI总结 通过强化学习使LLM适应不同检索器的查询策略,发现不同检索器偏好不同查询风格,并提出分支式滚动技术提升训练稳定性。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15033 2026-06-16 cs.HC cs.CL cs.CY 新提交 81%

Cloze: An Open Research Platform for Studying Human-AI Conversations in Mental Health Contexts

Cloze:一个用于研究心理健康背景下人机对话的开放研究平台

Matthew Flathers, Francesco Cipriani, John Torous

机构 * Beth Israel Deaconess Medical Center(贝塞斯达以色列德acons医疗中心) University College London(伦敦大学学院) Division of Digital Psychiatry(数字精神病学部)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出开源平台Cloze,支持在心理健康研究中控制、监控人机对话,统一配置模型、指令、安全约束并记录完整溯源,为建立人机交互证据基础提供研究基础设施。

Comments 7 pages, 2 figures. Cloze is released under AGPL-3.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09222 2026-06-16 cs.CR cs.AI 版本更新 81%

MUZZLE: Adaptive Agentic Red-Teaming of Web Agents Against Indirect Prompt Injection Attacks

MUZZLE: 针对间接提示注入攻击的自适应智能体红队测试框架

Georgios Syros, Evan Rose, Brian Grinstead, Christoph Kerschbaumer, William Robertson, Cristina Nita-Rotaru, Alina Oprea

机构 * Northeastern University(东北大学) Mozilla Corporation(Mozilla公司)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MUZZLE框架,利用智能体轨迹自动识别高显著性注入面,自适应生成上下文相关的恶意指令,评估网络智能体对间接提示注入攻击的安全性,发现44种新攻击和跨应用攻击策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00784 2026-06-15 cs.CL 81%

Research Borderlands: Analysing Writing Across Research Cultures

研究边疆:跨研究文化中的写作分析

Shaily Bhatt, Tal August, Maria Antoniak

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院) Pioneer Centre for AI, University of Copenhagen(哥本哈根大学先锋人工智能中心) Allen Institute for Artificial Intelligence (Ai2)(人工智能研究院)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文通过跨文化访谈,揭示研究文化中的语言规范,并评估LLM的文化适应能力,强调人类中心方法在测量文化规范中的有效性。

Comments Accepted to ACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11869 2026-06-11 cs.SE cs.AI 新提交 81%

Agents All the Way Down; A Methodology for Building Custom AI Agents from Substrate to Production

层层代理:从底层到生产构建自定义AI代理的方法论

Marc Alier Forment, Juanan Pereira, Francisco José García-Peñalvo, María José Casañ Guerrero

机构 * Universitat Politècnica de Catalunya (UPC)(西班牙巴塞罗那理工大学) Universidad del País Vasco / Euskal Herriko Unibertsitatea (UPV/EHU)(西班牙巴斯克大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出一种无框架的方法论,通过两个前提条件(将LLM作为软件组件和构建块)和三个实践(原型设计、打包为CLI、代理测试代理)来构建自定义AI代理,实现端到端开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11652 2026-06-11 cs.LG 新提交 81%

IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents

IAPO:面向小型多模态代理工具使用的输入归因感知策略优化

Yifan Yang, Zhen Zhang, Jiayi Tian, Liyan Tan, Zheng Zhang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 其他LLM :SLM(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.LG

AI总结 提出输入归因感知策略优化(IAPO),通过强化学习对齐模型与教师模型的输入归因,提升多模态小语言模型的工具调用能力,在六个测试集上平均准确率提升3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11688 2026-06-11 cs.LG 版本更新 81%

Composing Linear Layers from Irreducibles

从不可约元组合线性层

Travis Pence, Daisuke Yamada, Vikas Singh

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.LG

AI总结 提出用Clifford代数将线性层分解为双向量(几何基元)的组合,仅需O(log^2 d)参数,在LLM注意力投影中匹配强基线性能。

Comments 35 Pages, 11 Tables, 6 Figures, Appearing in NeurIPS 2025

Journal ref Advances in Neural Information Processing Systems 38 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09892 2026-06-10 cs.LG stat.ME 新提交 81%

LMT: A Bayesian Framework for Causal Discovery from Textual Alarm Records in Manufacturing Systems

LMT: 制造系统中文本告警记录的因果发现贝叶斯框架

Xiaofeng Xiao, Jianhong Chen, Qiuzhuang Sun, Naichen Shi, Xubo Yue

机构 * Department of Mechanical & Industrial Engineering, Northeastern University, Boston, MA, USA(东北大学机械与工业工程系) College of Integrative Studies, Singapore Management University, Singapore(新加坡国立大学整合研究学院) Department of Industrial Engineering and Management Sciences, Department of Mechanical Engineering, Northwestern University, IL, USA(西北大学工业工程与管理科学系、机械工程系)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出LMT框架,结合大语言模型提取的语义信号和基于泊松过程的时间证据,通过贝叶斯方法从文本告警记录中发现因果图,在小样本场景下表现优异。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08622 2026-06-10 cs.CL cs.SE 版本更新 81%

Automated Alignment between Elicitation Interviews and Requirements

启发式访谈与需求之间的自动对齐

Francesco Dente, Fabiano Dalpiaz, Paolo Papotti

机构 * University of Bologna(博洛尼亚大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出将访谈转录与用户故事需求自动对齐的任务,定义忠实度和覆盖率两个度量,利用大语言模型和嵌入模型实现自动评估,在四个数据集上达到0.86 macro-F1。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24940 2026-06-09 cs.PL cs.AI 81%

Evaluating adaptive and generative AI-based feedback and recommendations in a knowledge-graph-integrated programming learning system

评估基于自适应和生成式AI的反馈与推荐在知识图谱集成的编程学习系统中的效果

Lalita Na Nongkhai, Jingyun Wang, Adam Wynn, Takahiko Mendori

机构 * Graduate School of Engineering, Kochi University of Technology(Kochi大学技术大学工学研究院) Department of Computer Science, Durham University(Durham大学计算机科学系)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种整合大型语言模型与检索增强生成方法的知识图谱编程学习系统,通过实验比较三种教学模式的反馈效果与学习表现。

Journal ref Computers and Education: Artificial Intelligence, Volume 10, June 2026, 100526

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07513 2026-06-08 cs.CL 新提交 81%

Agentopia: Long-Term Life Simulation and Learning in Agent Societies

Agentopia: 智能体社会中的长期生活模拟与学习

Xintao Wang, Sirui Zheng, Hongqiu Wu, Weiyuan Li, Jen-tse Huang, Minghao Zhu, Can Zu, Qi Deng, Jiawei Wang, Qianyu He, Heng Wang, Xiaojian Wu, Yunzhe Tao

机构 * Fudan University(复旦大学) Johns Hopkins University(约翰霍普金斯大学) University of Science and Technology of China(中国科学技术大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出Agentopia框架,模拟100个智能体在10年内的社会生活,通过生命奖励训练LLM,提升其社交智能,并在角色扮演基准上取得15.6%的提升。

Comments 79 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06559 2026-06-08 cs.SD cs.AI eess.AS 新提交 81%

IRAF: Interference-Resilient Adaptive Fusion for Noise-Robust End-to-End Full-Duplex Spoken Dialogue Systems

IRAF:面向噪声鲁棒的端到端全双工口语对话系统的抗干扰自适应融合

Tao Zhong, Jiajun Deng, Nikita Kuzmin, Yinke Zhu, Tianxiang Cao, Tristan Tsoi, Zhili Tan, Simon Lui, Xunying Liu

机构 * The Chinese University of Hong Kong(香港中文大学) AudioLab Hong Kong, Huawei Leibniz Research Center(香港AudioLab,华为Leibniz研究中心) Nanyang Technological University(南洋理工大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出IRAF模块,通过逐帧预测可靠性门控来调节用户音频对LLM的贡献,提升全双工对话系统在干扰说话人环境下的响应质量和交互稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02399 2026-06-08 cs.SE cs.AI 版本更新 81%

Towards Iterative End-to-End Software Development: A Feature-Driven Multi-Agent Framework

迈向迭代式端到端软件开发:一种特征驱动的多智能体框架

Junwei Liu, Chen Xu, Chong Wang, Tong Bai, Weitong Chen, Kaseng Wong, Yiling Lou, Xin Peng

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出EvoDev框架,通过特征分解、依赖建模和上下文传播,实现迭代式端到端软件开发,在Android任务上比Claude Code提升57.3%。

Comments Accepted by ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00911 2026-06-05 cs.AI 81%

Synapse: Federated Tool Routing via Typed Compendium Artifacts

Synapse: 通过类型化编目工件实现联邦工具路由

Abhijit Chakraborty, Yash Shah, Vivek Gupta

机构 * MongoDB Arizona State University(亚利桑那州立大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出了一种名为Synapse的联邦工具路由编目系统,通过类型化联邦工件实现跨客户端的联邦学习,解决了在异构LLM和无共享数据的情况下,如何实现隐私保护、冲突解决和跨架构迁移的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03223 2026-06-03 cs.RO cs.AI 81%

BotDirector: Robot Storytelling Across the Symmetrical Reality with Multi-modal Interactions

BotDirector:跨对称现实的多模态交互机器人讲故事

Zhe Sun, Meng Wang, Lei Wang, Yuxi Wang, Wanxin Li, Yujia Peng, Zhenliang Zhang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI, Beijing, China(国家一般人工智能重点实验室,BIGAI,北京,中国) Peking University, Beijing, China(北京大学,北京,中国)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出一个结合具身交互和自然语言交互的机器人讲故事系统,利用LLM代理将儿童创建的叙事转化为自导航群体机器人的运动序列,支持灵活场景和日常物品。

Journal ref 2026 IEEE Conference on Virtual Reality and 3D User Interfaces Abstracts and Workshops (VRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03078 2026-06-03 cs.CL 81%

G^2C-MT: Graph-Guided Context Selection for Document-Level Machine Translation

G^2C-MT: 面向文档级机器翻译的图引导上下文选择

Baijun Ji, Zixuan Zhou, Xiangyu Duan, Yu Liu, Longbo Sun, Rupu Wei, Bohong Zhao

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Trip.com Group(Trip.com集团)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出G^2C-MT方法,通过构建轻量级篇章图并采用深度偏置随机游走采样上下文路径,以结构化方式为文档级机器翻译选择上下文,提升翻译质量与鲁棒性。

Comments 9 pages, 2 figures; IJCAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02973 2026-06-03 cs.CL 81%

Chatbots Output Meaningful (but Problematic) Language

聊天机器人输出有意义(但有问题)的语言

Matthew Stone, Una Stojnić

机构 * University of Parma(帕尔马大学) University of Cambridge(剑桥大学) University of Pittsburgh(匹兹堡大学) Franklin and Marshall College(弗兰克林与马歇尔学院)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文论证大型语言模型(LLM)的输出是有意义的,但无需假设其具有心理状态或意图,并探讨了这一观点对语言理论和AI伦理的影响。

Comments 49 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02488 2026-06-02 cs.AI 81%

RASER: Recoverability-Aware Selective Escalation Router for Multi-Hop Question Answering

RASER: 可恢复性感知的选择性升级路由器用于多跳问答

Yuyang Li, Zihe Yan, Tobias Käfer

机构 * Institute AIFB, Karlsruhe Institute of Technology, Karlsruhe, Germany(卡尔斯鲁厄理工学院AIFB研究所) Shanghai Jiao Tong University, Shanghai, China(上海交通大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出RASER路由器,基于单次RAG的六个特征决定是否升级到更昂贵的检索策略,在不增加额外LLM调用的情况下,在F1分数与SOTA相当的同时节省大量token。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14003 2026-06-02 cs.LG 81%

Unlearning Isn't Invisible: Detecting Unlearning Traces in LLMs from Model Outputs

遗忘并非不可见:从模型输出中检测LLMs的遗忘痕迹

Yiwei Chen, Soumyadeep Pal, Yimeng Zhang, Qing Qu, Sijia Liu

机构 * Michigan State University(密歇根州立大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) IBM Research(IBM研究院)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文发现大型语言模型在经历机器遗忘后会在行为和内部表征中留下可检测的“指纹”,并通过分类器利用预测logits或文本输出以超过90%的准确率识别遗忘模型。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16462 2026-06-02 cs.CL 81%

Finding What Matters: Anchoring Context Knowledge with Evolving Indices for Iterative Retrieval

寻找关键:通过演化索引锚定上下文知识进行迭代检索

Mingyan Wu, Zhenghao Liu, Xinze Li, Yuqing Lan, Yukun Yan, Shuo Wang, Cheng Yang, Minghe Yu, Zheni Zeng, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系) Beijing National Research Center for Information Science and Technology, China(北京信息科学与技术国家研究中心) School of Computer Science, Beijing University of Posts and Telecommunications, China(北京邮电大学计算机学院)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出KAIR框架,通过迭代检索中动态更新的知识索引锚定关键证据,引导大语言模型在多跳问答中有效推理并缓解噪声干扰。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01011 2026-06-01 cs.MA cs.AI 81%

Multi-Agent Teams Hold Experts Back

多智能体团队阻碍专家发挥

Aneesh Pappu, Batu El, Hancheng Cao, Carmelo di Nolfo, Yanchao Sun, Meng Cao, James Zou

机构 * stanford(斯坦福大学) apple(苹果公司) goizueta business school, emory(埃默里大学戈izueta商学院)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究自组织多智能体LLM团队在无约束协调下无法匹配专家性能,发现整合妥协行为是主要瓶颈,导致性能损失高达41.1%。

Comments Accepted at the International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29857 2026-05-29 cs.LG 81%

Feedback-to-Rubrics: Can We Learn Expert Criteria from Inline Comments?

从内联评论到评分标准:我们能从内联评论中学习专家标准吗?

Kotaro Yoshida, So Kuroki, Yuki Imajuku, Taishi Nakamura, Ryunosuke Iwai, Haruki Goda, Takuya Akiba

机构 * Sakana AI Institute of Science Tokyo(东京科学研究所)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出从内联评论中学习可复用的自然语言评分标准的方法,通过迭代优化评分标准来预测评论并支持自动修订。

详情

展开后加载摘要…

URL PDF HTML 收藏