Interaction Protocol Shapes Moral Judgment in Multi-Agent Debate
辩论动态与价值对齐在大语言模型辩论中
机构 * D-Lab University of California, Berkeley(D-Lab 加州大学伯克利分校)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 研究通过LLM辩论探讨多轮设置中模型的辩论动态与价值对齐,发现不同模型在同步和轮转结构下的行为差异及价值倾向。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
辩论动态与价值对齐在大语言模型辩论中
机构 * D-Lab University of California, Berkeley(D-Lab 加州大学伯克利分校)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 研究通过LLM辩论探讨多轮设置中模型的辩论动态与价值对齐,发现不同模型在同步和轮转结构下的行为差异及价值倾向。
零权限操纵:我们能否信任由大型多模态模型驱动的GUI代理?
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) ; Hornor Device Co., Ltd(Hornor设备有限公司) ; Institute of Dataspace, Hefei Comprehensive National Science Center(数据空间研究所,合肥综合性国家科学中心)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 研究揭示了由大型多模态模型驱动的GUI代理在Android中存在视觉原子性假设的漏洞,通过零权限攻击实现对代理执行的重新绑定,并利用意图对齐策略绕过验证门,展示了代理-操作系统集成中的安全缺陷。
基于2.5-D分解的LLM空间构建
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出了一种基于2.5-D分解的神经符号管道,通过让LLM在二维水平面上规划,同时确定性执行器计算垂直放置,从而消除一类错误,提升了空间构建的准确性。
面向LLM代理的低延迟欺诈检测层:用于检测对抗性交互模式
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Indiana University Bloomington(印第安纳大学布卢明顿分校)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出一种低延迟欺诈检测机制,通过交互轨迹的结构化运行时特征检测对抗性交互模式,采用轻量模型实现实时部署,实验表明交互层面行为检测应成为LLM代理部署时的核心防护措施。
MG$^2$-RAG:多粒度图用于多模态检索增强生成
机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 MG$^2$-RAG通过构建层次化多模态知识图谱,融合文本与视觉信息,提升多模态检索与生成性能,实验显示其在四个任务中均取得最佳效果,同时显著提升效率。
EasyLens: 一种无需训练的即插即用型微病变表示放大器,用于医学视觉语言模型
机构 * Jilin University(吉林大学) ; School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) ; ByteDance(字节跳动) ; Institute of Translational Medicine, Shanghai Jiao Tong University(上海交通大学转化医学研究院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 提出EasyLens,一种无需训练的即插即用模块,通过构建病理-解剖原型空间、反事实推理选择病变相关补丁以及形态引导残差增强,放大医学视觉语言模型对微病变的表示能力。
TeamTR: 用于多智能体大语言模型协调的信赖区域微调
机构 * Department of Electrical \& Computer Engineering, University of Arizona ; Engineering College, Soochow University ; INSAIT, Sofia University "St. Kliment Ohridski" ; Department of Electrical ; Computer Engineering, Stony Brook University
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG
AI总结 本文提出TeamTR,通过信赖区域框架在每个组件更新后重采样轨迹并控制每个智能体的发散度,解决多智能体系统中因上下文分布变化导致的性能下降问题,实验表明其在协调回归抑制和组件替换支持方面优于单智能体和序列基线。
Comments 9pages, Accepted at ICML2026
超越反应性:衡量大语言模型智能体中的主动解决问题能力
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 研究旨在衡量大语言模型智能体的主动解决问题能力。提出PROBE方法,将主动性分解为三个核心能力。应用该方法评估领先模型和框架,发现即使最先进的模型表现也不佳,GPT-5和Claude Opus-4.1最佳端到端性能为40%,突出局限并揭示未来研究方向。
VASP智能体:一种用于自主第一性原理计算的智能框架
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Department of Computer Science and Technology(计算机科学与技术系) ; School of Physical Science and Technology(物理科学与技术学院) ; Department of Automation(自动化系) ; Beijing National Research Center for Information Science and Technology (BNRist)(北京信息科学与技术国家研究中心) ; School of Chemistry and Chemical Engineering(化学与化工学院) ; Key Laboratory of Computational Physical Sciences (Ministry of Education)(计算物理科学重点实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 研究针对第一性原理材料计算对自主性的高要求,提出VASP智能体系统,结合多种技能和工具执行多步VASP计算,经多任务评估,其计算结果更优,还能诊断并恢复计算错误。
以叙事为中心的情感反思:人工智能支持的情感自我反思的早期原型
专题命中 复杂问题求解 :planning(abstract);分类 cs.AI
AI总结 该研究以Reflexion为早期原型,通过整合情感检测、分层反思提示和隐喻故事生成等方法,探索结构化情感自我反思,支持用户超越基本情感分类进行自主情感探索,记录了理论驱动的情感计算方向。
Comments 7 pages, 1 figure
Gypscie:一个跨平台的AI艺术品管理系统
机构 * LNCC(巴西国家科学计算实验室) ; CEFET/RJ(里约热内卢联邦技术教育中心) ; Inria, Univ Montpellier, CNRS, LIRMM(法国国家信息与自动化研究所,蒙彼利埃大学,法国国家科学研究中心,蒙彼利埃计算机科学实验室)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出Gypscie,通过知识图谱和规则查询语言统一管理AI艺术品,实现跨平台的数据流调度与可解释性。
Comments 39 pages, 13 figures
在Linux提权中使用可验证奖励进行训练后的本地LLM代理
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出一种两阶段训练流程,通过监督微调和强化学习提升Linux提权任务的性能,实现高成功率和低推理成本。
kAgent:一种用于Linux内核的执行引导式崩溃修复代理
机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) ; Google Inc.(谷歌公司) ; Google DeepMind(谷歌DeepMind)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 研究针对Linux内核崩溃修复难题,以内核开发者修复方式为灵感构建kAgent及支持工具栈,通过检查日志等步骤修复崩溃,消融特性定量分析,评估显示其能有效修复多种崩溃。
Comments Accepted to ICML, 2026; in the Deep Learning for Code Workshop. This paper was previously circulated as "CrashFixer"
迈向有根的自主研究:一个端到端的LLM微型研究循环在已发表的计算物理学中的应用
机构 * Department of Physics, Princeton University(普林斯顿大学物理系)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出一个端到端的LLM微型研究循环,用于在已发表的计算物理学中进行自主研究,通过大规模和深度测试展示其在复现、批评和扩展研究中的能力。
Comments v2: camera-ready version, accepted at ICML 2026 AI for Science Workshop. Corrects the phase-classification statistics and adds a coding-sensitivity analysis (Methods M6); the agent-produced six-page Comment is reproduced as-is in the final appendix. 24 pages, 4 figures
从实验到专长:面向AI驱动计算物理的科学知识巩固
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 提出QMatSuite平台,通过记录、检索和反思机制巩固计算材料科学中的知识,减少推理开销并提高模拟准确性。
Comments v2: camera-ready version, accepted at the ICML 2026 Workshop on AI for Physics (AI4Physics@ICML 2026). 20 pages, 6 figures
LearNAT: 基于AST引导任务分解的NL2SQL大语言模型学习
机构 * School of Computer Science, Peking University(北京大学计算机科学系) ; Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) ; Big Data Technology Research Center, Nanhu Laboratory(纳米实验室大数据技术研究中心) ; National Engineering Research Center For Software Engineering, Peking University(北京大学软件工程国家工程研究中心) ; Peking University Information Technology Institute (Tianjin Binhai)(北京大学信息技术研究院(天津滨海)) ; School of Computer Sciences, Beijing University of Posts and Telecommunications(北京邮电大学计算机科学系) ; Huawei Technologies Co., Ltd(华为技术有限公司) ; Seed, ByteDance Inc.(字节跳动公司)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 提出LearNAT框架,通过AST引导的分解合成过程和边际感知强化学习,增强小规模LLM的NL2SQL任务分解能力,以7B参数模型达到GPT-4可比性能。
Comments Accepted by ICLR'26
ActivityNarrated: 一种面向可穿戴人类活动理解的开放性叙事范式
机构 * DFKI Kaiserslautern(德国人工智能研究中心凯泽斯劳滕) ; RPTU(莱茵兰-普法尔茨州凯泽斯劳滕-兰道工业大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG
AI总结 本文提出一种开放性叙事范式,通过将可穿戴传感器数据与自然语言描述对齐,实现开放词汇环境下的人类活动理解,实验表明其在跨参与者评估中表现优于传统闭合集方法。
正交层次分解:面向结构感知的大语言模型表格理解
机构 * Zhejiang University of Technology, China(浙江工业大学,中国) ; Zhejiang Key Laboratory of Visual Information Intelligent Processing, China(浙江视觉信息智能处理重点实验室,中国) ; University of Aberdeen, UK(爱丁堡大学,英国)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 针对复杂表格中多级表头、合并单元格等结构导致大语言模型理解困难的问题,提出正交层次分解(OHD)框架,通过空间-语义联合约束的正交树归纳方法将不规则表格分解为列树和行树,并设计双路径关联协议重构单元格语义,在AITQA和HiTab基准上优于现有方法。
Comments ICML 2026
Polaris:通过经验抽象策略修复实现小型语言模型的Gödel代理框架
机构 * TCS Research, India(印度TCS研究)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG
AI总结 Polaris通过经验抽象策略修复实现小型语言模型的Gödel代理框架,通过分析、策略形成、抽象和最小代码修补实现策略更新,提升模型在多个基准测试中的表现。
Comments Accepted to ACL 2026 (Findings). 33 pages
ErrorLLM: 为文本到SQL精炼建模SQL错误
机构 * The Hong Kong Polytechnic University(香港理工大学) ; City University of Macau(澳门城市大学) ; Jilin University(吉林大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Beihang University(北航大学)
专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL
AI总结 提出ErrorLLM框架,通过专用错误令牌和结构特征显式建模SQL错误,结合静态检测与错误引导精炼,显著提升文本到SQL生成质量。
Comments Accepted to SIGKDD2026
代理时代的多媒体与可视化分析
机构 * University of Amsterdam(阿姆斯特丹大学) ; Czech Technical University in Prague(布拉格捷克技术大学) ; Eindhoven University of Technology(埃因霍温理工大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出一个框架,将多媒体与可视化分析结合,以支持专业用户从大规模多媒体集合中获取可操作见解,实现人类与AI的真正协作。
面向高效视频大语言模型的sink-token感知剪枝:用于细粒度视频理解
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国高级科学技术研究院) ; Oracle ; University of California, San Diego(加州大学圣地亚哥分校) ; Electronics and Telecommunications Research Institute (ETRI)(电子电信研究院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG
AI总结 本文提出Sink-Token-aware Pruning方法,通过识别并抑制semantically uninformative tokens,提升细粒度视频理解性能,在多种基准测试中表现优异。
Comments ECCV 2026
统一思维还是孤立代理?探索认知负荷理论下LLM的协调
机构 * Hong Kong University of Science and Technology(香港科技大学) ; University of California San Diego(加州大学圣地亚哥分校) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 受认知负荷理论启发,提出CoThinker多智能体框架,通过智能体分工和结构化通信降低认知负荷,在复杂推理任务上提升性能,但在低负荷任务上协调开销占优。
基于Agent Rosetta的蛋白质设计:面向专业科学智能体的案例研究
机构 * Polymathic AI(多学科人工智能实验室) ; Center for Computational Biology, Flatiron Institute(计算生物学中心,Flatiron研究所) ; Google DeepMind(谷歌DeepMind) ; Center for Computational Mathematics, Flatiron Institute(计算数学中心,Flatiron研究所) ; New York University(纽约大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 提出Agent Rosetta,将大语言模型与Rosetta软件环境结合,通过迭代优化实现用户定义的蛋白质设计目标,在规范氨基酸设计上匹配专家,在非规范残基设计上超越现有ML方法。
学习共享:面向高效并行智能体系统的选择性记忆
机构 * Institute of Artificial Intelligence, University of Central Florida, Orlando, United States(人工智能研究所,中央佛罗里达大学,奥兰多,美国)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 提出LTS机制,通过强化学习训练控制器选择性共享跨团队中间信息,在减少并行智能体系统计算开销的同时保持或提升任务性能。
Comments ICML 2026
DynaDebate: 通过动态路径生成打破多智能体辩论中的同质性
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) ; North Automatic Control Technology Institute(北自动控制技术研究所) ; Shenzhen Institute for Advanced Study, UESTC(深圳先进研究 institute, 电子科技大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 提出DynaDebate框架,通过动态路径生成、过程中心辩论和触发式验证机制,解决多智能体辩论中推理路径同质化问题,提升辩论效果。
Comments 19pages,7 figures
Shachi: 一种用于基于LLM的涌现集体行为建模的模块化、可控框架
机构 * Sakana AI, Japan(日本Sakana AI) ; The University of Tokyo, Japan(日本东京大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 提出Shachi框架,将智能体认知分解为配置、记忆和工具等独立可控组件,通过扰动实验研究微观认知特征如何影响宏观群体动态,并在10任务基准和关税冲击案例中验证其有效性。
Comments Accepted to ALIFE 2026
从数字到物理:数字代理作为物理智能的自主教练
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) ; Zhongguancun Academy, Beijing, China(中关村学院) ; School of Integrated Circuits, Shanghai Jiao Tong University, Shanghai, China(上海交通大学集成电路学院) ; School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(北京大学计算机科学学院多媒体信息处理国家重点实验室)
专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI
AI总结 提出EmboCoach-Bench基准,评估LLM代理自主设计具身策略的能力,通过迭代调试和优化,代理在平均成功率上超越人工基线26.5%,并具备自我修正能力。
Comments 53 pages, 12 figures
MLaGA: 多模态大语言与图助手
机构 * New York University(纽约大学) ; New York University Shanghai(纽约大学上海) ; New York University Brooklyn(纽约大学布鲁克林) ; Virginia Polytechnic Institute and State University(弗吉尼亚理工大学) ; New York University Abu Dhabi(纽约大学阿布扎克)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 提出MLaGA模型,通过结构感知多模态编码器和指令微调,将大语言模型扩展到多模态图数据,在监督和迁移学习任务中优于基线方法。
ConRAG: 用于多跳问答的共识驱动多视角检索
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 提出ConRAG框架,通过共识驱动的多视角检索(关系、实体、文本信号)优化查询和语料库,显著提升多跳问答性能,在MuSiQue上创下新纪录。