arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4154 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 362 篇

2607.24082 2026-07-28 cs.AI 新提交 57%

Towards High-Level Semantic Intelligence

迈向高级语义智能

Xiujie Song, Gefei Yang, Yining You, Jiahui Gan, Qi Jia, Shota Watanabe, Tianxi Wan, Mengyue Wu, Kai Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 综述从语义复杂性角度审视人工智能语义智能发展,系统调研高级语义任务研究,总结理解和生成的相关方法及策略,旨在推动人工智能向高级语义智能持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23538 2026-07-28 cs.CL 新提交 57%

Guiding Language Models to Be More Empathetic: Culturally Sensitive Mental Health Advice Generation Through Human-LLM Collaboration

引导语言模型更具同理心:通过人机协作生成具有文化敏感性的心理健康建议

Fatema Tuj Johora Faria, Mukaffi Bin Moin, Md. Mahfuzur Rahman, Khan Md Hasib, Jubayer Al Mahmud, M. F. Mridha

机构 * Ahsanullah University of Science and Technology(阿山努拉科技大学) Bangladesh University of Business and Technology(孟加拉国商业与技术大学) The University of New South Wales(新南威尔士大学) Jashore University of Science and Technology(贾绍尔科技大学) American International University - Bangladesh(孟加拉国美国国际大学)

专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.CL

AI总结 研究探索大语言模型在低资源语言中生成同理心心理健康建议的能力,提出角色扮演反思性思维链咨询框架和基于Grok 4的评估框架,通过人机协作及特定策略,提升心理健康建议质量,使其更符合专业咨询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23420 2026-07-28 cs.CL 新提交 57%

LA-RL: Label-Aware Self-Reflection for Reinforcement Learning in Information Extraction

LA-RL:信息抽取中强化学习的标签感知自反思

Xiao You, Tianwei Yan, Zixu Shan, Longyu Du, Shan Zhao

机构 * Hefei University of Technology(合肥工业大学) Chongqing Jiaotong University(重庆交通大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL

AI总结 研究针对大语言模型信息抽取中现有反思校正方法不足,提出LA-RL框架,通过任务诊断标签指导自校正,经特定训练阶段提升抽取质量,在多项任务实验中取得良好效果,且发现反思结构对任务敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22597 2026-07-28 cs.AI 新提交 57%

HyCE-RAG: Hypergraph Chain-of-Evidence Retrieval-Augmented Generation for Explainable Multi-hop Question Answering

HyCE-RAG:用于可解释多跳问答的超图证据链检索增强生成

Hong-Yu An, Yun-Jian Zhang, Chen-Wei Liang, Tian-Yi Zhang, Jian Ding, Yi-Lun Wu, Ao-Bo Li, Wei-Cong Su, Saifullah, Mujiangshan Wang

机构 * University of Macau(澳门大学) Shenzhen Kaihong Digital Industry Development Co., Ltd.(深圳开鸿数字产业发展有限公司) University of New South Wales(新南威尔士大学) Zhejiang University(浙江大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究可解释多跳问答,提出HyCE-RAG框架,将实体等组织成超边构建超图,经置信度传播和证据组装选择连接证据路径,评分时考虑多种因素,实验证明其在多方面优于标准和基于图的RAG基线,为复杂问答检索后推理提供新方向。

Comments 15 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22562 2026-07-28 cs.AI 新提交 57%

SF-AMS: Strategic Forgetting for Structured Memory in LLM Agent

SF-AMS:大语言模型智能体中结构化记忆的策略性遗忘

Ning Yang, Siqi Li, Miaoxin Shen, Yuan Zhou, Meng Zhang, Tong Li, Haijun Zhang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究大语言模型智能体长上下文依赖瓶颈问题,提出SF-AMS框架,通过效用驱动机制和复合评分整合信号维护记忆,实验表明该方法在多跳推理等任务中相比基线有显著提升,证明建模记忆重要性对长上下文推理关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22319 2026-07-27 cs.DB cs.AI 新提交 57%

Towards Trustworthy and Cost-Efficient Data Integration: From Naïve RAG to Agentic RAG

迈向可信且经济高效的数据集成:从朴素检索增强生成到智能体检索增强生成

Chuangtao Ma, Arijit Khan

机构 * Aalborg University, Denmark(丹麦奥胡斯大学) Bowling Green State University, USA(美国布恩威尔州立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 探讨大语言模型和人工智能智能体在企业数据集成中面临的挑战,介绍从经典RAG到智能体RAG的演变,研究经济高效集成的优化策略,为构建可靠、可解释和可扩展的数据集成系统指明方向。

Comments To Appear in the IEEE Data Engineering Bulletin

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21600 2026-07-27 cs.AI 新提交 57%

Securing Multimodal AI through Internal Information Decomposition

通过内部信息分解保护多模态人工智能

Jehyeok Yeon, Hyeonjeong Ha, Qiusi Zhan, Heng Ji

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究多模态大语言模型的攻击问题,提出FlowGuard框架,通过监测内部多模态一致性检测有害输入,受部分信息分解启发得出FlowVectors量化相关指标,有效降低攻击成功率且减少效用损失和延迟,为多模态推理提供有效防御。

Comments Accepted as Spotlight Paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21599 2026-07-27 cs.PF cs.AI 新提交 57%

Decoupled Attention Fusion: Accelerating RAG with Efficient KV Cache Reuse

解耦注意力融合:通过高效的键值缓存重用加速检索增强生成

Xiabao Wu, Wentao Liu, Yongchao Liu, Jiajun Zheng

机构 * Ant Group, China(蚂蚁集团,中国) Southeast University, Nanjing, China(东南大学,南京,中国)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对RAG在长上下文场景中TTFT延迟高及缓存问题,提出解耦注意力融合(DAF)框架,将注意力过程解耦为三个阶段,与Flash-Attention内核兼容,实验显示其在不牺牲准确性的情况下,相比CacheBlend和完全重新计算有显著加速。

Comments Accepted by EuroSys 2026 (poster track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21596 2026-07-27 cs.AI 新提交 57%

FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills

FlowEvo:通过工作流和可执行技能的协同进化实现自我进化的智能体

Zeyu Ren, Ling Yue, Ran Li, Yishu Wang, Shengxiang Xu, Hanmo Liu, Shaowu Pan, Shimin Di

机构 * Southeast University(东南大学) Rensselaer Polytechnic Institute(伦斯勒理工学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究旨在让大型语言模型智能体通过工作流解决复杂任务。提出FlowEvo框架,通过工作流到技能编译、技能到工作流反馈、技能管理三个机制,使智能体无需更新模型参数积累完善能力,实验显示其在基准测试中精度-成本权衡优,各机制有贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21437 2026-07-24 cs.AI 新提交 57%

Agent-Guided Relational Concept Discovery: Toward Interpretable Surgical Margin Assessment

代理引导的关系概念发现:迈向可解释的手术切缘评估

Nooshin Maghsoodi, Amoon Jamzad, Robert Policelli, Mohammad Farahmand, Dilakshan Srikanthan, Martin Kaufmann, Kevin Y. M. Ren, Shaila Merchant, Sonal Varma, Ross Walker, Doug McKay, John Rudan, Gabor Fichtinger, Parvin Mousavi

机构 * Queen’s University(女王大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对深度学习模型用于手术切缘评估时面临的泛化难及黑箱问题,提出代理引导的概念发现框架,直接从数据学习概念,经推理代理和知识图谱完善调整,在相关数据集和术中病例中提升了评估效果。

Comments This paper is accepted to MICCAI 2026, and this is the submission version, not the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20517 2026-07-24 cs.LG 新提交 57%

Multimodal CoLRAG-TF: Triple-Filtered Retrieval for Complex PDFs

多模态CoLRAG-TF:复杂PDF的三重过滤检索

Takato Yasuno

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 研究针对异构PDF集合检索增强生成的挑战,提出多模态CoLRAG-TF四轴融合架构,集成多种技术。构建多模态索引,经贝叶斯优化确定融合权重。实验显示其检索召回率高,多跳答案相似性提升显著,还适用于视觉输入,提供通用框架。

Comments 18 pages, 8 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20489 2026-07-24 cs.AI cs.DB 新提交 57%

EvoSQL: Memory-Augmented Critic-Generator Co-Evolution for Text-to-SQL

EvoSQL:用于文本到SQL的内存增强型评论家-生成器协同进化

Jiawei Zhou, Jianwei Wang, Chenyu Zhou, Chaojian Shi, Ming Dong, Kai Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of New South Wales(新南威尔士大学) Fudan University(复旦大学) Wuhan University of Technology(武汉理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究文本到SQL问题,提出EvoSQL协同进化框架,通过生成器与评论家迭代交互、维护内存、验证候选及自蒸馏策略优化微调等,在Spider和BIRD实验中持续改进开源模型,证明该方法是有效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20216 2026-07-23 cs.CR cs.AI 新提交 57%

Small, Free, and Effective: Orchestrating Open-Weight Small Language Models to Outperform Single LLM for Malware Analysis

小巧、免费且高效:编排开放权重的小型语言模型以在恶意软件分析中超越单个大语言模型

Adel ElZemity, Shujun Li, Budi Arief

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究恶意软件分析中,小型语言模型编排集成能否超越单个大语言模型。通过测试多种模型建立基线,设计评估四种编排架构,其中混合系统表现出色,总体准确率超专业和前沿基线,证明基于证据的编排可提升SLM性能。

Comments To appear in Proceedings of the 29th International Symposium on Research in Attacks, Intrusions, and Defenses (RAID)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18243 2026-07-22 cs.AI 新提交 57%

From Agent Failure Paths to Quantified Residual Risk: A Compositional Framework for Resilient Agentic AI

从智能体故障路径到量化残余风险:一种用于弹性智能体人工智能的组合框架

Hassan Karim, Sai Sitharaman, Deepti Gupta, Danda B. Rawat

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究智能体人工智能风险表示问题,提出CPSAINT和FRIESA-K结合故障机制与风险估计,通过单独惩罚报告治理可观测性,形式化结构可组合性,在两个场景展示框架,获支持跨域推理等的紧凑内核。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17879 2026-07-21 cs.AI 新提交 57%

Exploratory and Assimilating Reflection: Reflective Recall Cycle for Long-term Memory

探索性与同化性反思:用于长期记忆的反思性回忆循环

Ganesh Senrayan, Moyuru Yamada, Ishan Jindal, Kiran Purohit

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究基于大语言模型的自主智能体外部记忆问题,提出探索性 - 同化性反思(EAR)框架,结合探索性反思与同化性反思两种机制,提高初始检索性能和样本效率,在长期对话基准上比基线检索器提升检索率达 17.9%,且样本效率高、抗噪声反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17044 2026-07-21 cs.SE cs.AI 新提交 57%

Where Does Agent Reliability Come From? A Cross-Benchmark Decomposition of Verification Loops, Specialist Models, and Scaffolding in a Production Enterprise Agent

智能体可靠性源自何处?生产企业智能体中验证循环、专家模型和脚手架的跨基准分解

Arunabh Dastidar

机构 * Leni Inc.(Leni公司)

专题命中 复杂问题求解 :verifier(abstract);分类 cs.AI

AI总结 研究多步骤企业智能体任务失败问题,以生产系统Leni为研究对象,其含验证循环等。通过在三个基准测试评估,发现完整系统有提升。核心贡献是分解提升来源,指出大部分来自脚手架等,验证步骤单独贡献小但作用关键,还得出相关矩阵和模型等结论。

Comments 19 pages, 5 figures, 5 tables. Evaluations conducted March-April 2026. Run-level evaluation record and audit scripts: https://github.com/arnabdastidar/leni-agent-evals

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16388 2026-07-21 cs.MA cs.AI cs.SE 新提交 57%

Automated Hardware Validation Test Plan Generation for Large Scale AI Datacenter Platforms Using a Generative AI Multi-Agents Architecture

使用生成式人工智能多智能体架构为大规模人工智能数据中心平台生成自动化硬件验证测试计划

Mohammed-Khalil Ghali, Saurabh Kulkarni, Prathamesh Kulkarni, Rohan Kulkarni, Sangwon Yoon, Daehan Won

机构 * School of Systems Science and Industrial Engineering, Binghamton University, State University of New York(系统科学与工业工程学院,宾夕法尼亚州立大学布林茅尔分校) Meta Platforms, Inc.(Meta平台公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对大规模人工智能数据中心平台硬件验证测试计划手动编写的问题,提出基于生成式人工智能多智能体架构,依据自愈验证文档和物料清单自动生成测试计划,提高了覆盖范围、编写效率和可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14641 2026-07-17 cs.AI 新提交 57%

Analytic Abduction: Causal Decomposition and Governed Commitment for Human--AI Coordination

分析性溯因:用于人机协作的因果分解与受控承诺

Remo Pareschi

机构 * Stake Lab, University of Molise(莫利塞大学斯塔克实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究分析性溯因推理,核心方法是κ - τ 机制及因果簇,贡献在于将未确定分解作为共享协调对象,用于人机协作,为决策者提供竞争解释场景及证据,助力合理行动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14557 2026-07-17 cs.AI 新提交 57%

Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation

从零步洞察终点:通过MLP稀疏感知截断加速扩散多模态大语言模型

Qicheng Zhao, Qi Sun, Zheyu Yan

机构 * Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究针对扩散多模态大语言模型推理效率受固定长度生成约束影响的问题,提出Seer框架,利用MLP激活稀疏性变化检测有效语义边界,进行冗余截断及采用混合执行策略,实验表明其可加速吞吐量并维持性能甚至提升复杂视觉任务准确性。

Comments Accepted to ACM Multimedia (ACM MM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14416 2026-07-17 cs.AI 新提交 57%

CausalGraphX: A Counterfactual Graph Neural Network Framework for Explainable Systemic Risk Assessment

因果图X:用于可解释系统性风险评估的反事实图神经网络框架

Rabimba Karanjai, Hemanth Madhavarao, Lei Xu, Weidong Shi

机构 * University of Houston(休斯顿大学) Kent State University(肯特州立大学) PayPal Inc.(贝宝公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对传统风险模型无法捕捉金融网络复杂动态及图神经网络缺乏因果解释的问题,提出因果图X框架,结合图神经网络与反事实推理,能有效评估系统性风险并提供可解释的反事实解释,优于传统和深度学习基线。

Comments Accepted in AAAI'26 Workshop, Agentic AI in Financial Services

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14341 2026-07-17 cs.RO cs.AI 新提交 57%

Beyond Visual Grasping: Benchmarking Complex Grasping from Detection to Execution

超越视觉抓取:从检测到执行的复杂抓取基准测试

Hanyi Zhang, Khang Nguyen, Charith Munasinghe, Basu Hela, Tianyu Li, Zihong Luo, Hoan Nguyen, Hans Wernher van de Venn, Yalin Zheng, Ravi Prakash, Tung D. Ta, Anh Nguyen, Baoru Huang

机构 * University of Liverpool(利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Zurich University of Applied Science(苏黎世应用科学大学) Indian Institute of Science(印度科学研究所) University of Information Technology(信息技术大学) The University of Tokyo(东京大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对现有抓取基准未涵盖复杂多步推理和语义理解任务的问题,提出GCA-Bench基准,实现多种基线方法并进行实证研究,给出新评估指标等,为开发更强大通用的抓取策略提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14303 2026-07-17 physics.ed-ph cs.AI 新提交 57%

Assessing AI in Introductory Physics Problem Solving

评估人工智能在基础物理问题解决中的能力

Amir Bralin, N. Sanjay Rebello

机构 * Texas Tech University(德克萨斯理工大学) Purdue University(普渡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究评估OpenAI的o4-mini模型解决基础物理问题的能力,通过解决《费曼物理学讲义》章节末尾问题展开,发现模型总体准确率约90%,性能受问题模态和难度影响,表明先进大语言模型虽能解决不少基础物理问题,但表现不均衡。

Comments Working paper, submitted as a placeholder

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13881 2026-07-16 cs.CV cs.AI 新提交 57%

Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild

释放多模态大语言模型用于野外无训练的人机交互检测

Ting Lei, Jialin Liu, Zhu Xu, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对传统人机交互检测方法在开放世界和组合场景中泛化能力受限的问题,提出无训练的AgentHOI框架,利用基础模型多模态推理能力,通过上下文感知多轮推理和多方面交互定位机制,在实际场景中取得优于现有监督和弱监督方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12634 2026-07-15 cs.AI 新提交 57%

Atomic Units of X: The Compression Layer of Intelligence

X的原子单位:智能的压缩层

Sachin Dev Duggal, Pradyumna Swarnalatha Ramanna, Alexandros Vassiliades

机构 * SeKondBrain AI Labs(第二大脑人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 该论文提出将智能视为原子压缩与组合复用过程的理论框架,借助多学科证据阐述原子单位概念,给出压缩演算等核心方法,为设计自进化知识系统奠基,为智能相关多方面提供统一视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11890 2026-07-15 cs.CY cs.AI 新提交 57%

So Many Opinions, So Many LLMs: Comparing Large Language Models to Traditional Machine Learning for Open- Ended Survey Analysis

众多观点,众多大语言模型:将大语言模型与传统机器学习用于开放式调查分析的比较

Abdullah Akinde, Mariam Akinde, Rasheedat Emiola, Ahmed Akinsola

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究对比多种大语言模型与传统机器学习用于开放式调查分析,在情感分析和主题分类等任务中评估性能,发现LLMs分类准确性更高,但在预测理由及应用类别边界上差异大,凸显了使用LLMs进行定性分析时的权衡并给出实用建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10557 2026-07-14 cs.CL 新提交 57%

UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp

UNIBROWSE:用于多模态浏览比较的数据到智能体框架

Xiyu Wei, Qingwei Zong, Zhuocheng Yu, Sujian Li

机构 * Key Laboratory of Computational Linguistics, MOE, Peking University(教育部计算语言学重点实验室,北京大学) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 研究多模态浏览比较任务,提出UNIBROWSE统一数据管道,同时生成三种模式训练数据,增强知识图谱,引入探索度度量。经此训练的35B规模智能体在多模态浏览比较基准测试中性能领先,超多个闭源智能体工作流程。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08255 2026-07-10 cs.AI 新提交 57%

Compete Then Collaborate: Frontier AI Teachers Build a Verifiable Curriculum to Improve a Coding Student Beyond Imitation

竞争然后合作:前沿人工智能教师构建可验证课程以提升编码学生超越模仿

Miseong Shawn Kim

机构 * Genesis Cortex AI Inc.(创世纪皮层人工智能公司)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 研究探讨大型语言模型作教师时的教学问题,提出竞争然后合作框架,让四个前沿人工智能教师先对决排名,再合作构建课程提升学生。发现执行验证下教师解决标准问题情况,模仿不一定提升学生,合作课程能提升学生,强调合作构建可验证环境的价值。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08182 2026-07-10 cs.CV cs.AI 新提交 57%

LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action

LEEVLA:在视觉-语言-动作的潜在环境演化中洞察关键要素

Qi Lyu, Baicheng Liu, Xudong Wang, Jiahua Dong, Lianqing Liu, Zhi Han

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究针对视觉-语言-动作模型难以应对复杂动态场景的问题,提出LEEVLA架构,引入漂移引导动态优先级和结构化特征流生成,构成“何处-如何”训练框架,实验表明该方法优于现有方法,强调了关键要素引导和结构化推理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06807 2026-07-09 cs.CR cs.AI 新提交 57%

When Agents Go Rogue: Activation-Based Detection of Malicious Behaviors in Multi-Agent Systems

当智能体行为异常时:基于激活的多智能体系统恶意行为检测

Haowen Xu, Xue Tan, Lei Ma, Zhihao Zhang, Chao Wang, Qingze Wang, Ping Chen, Jun Dai, Xiaoyan Sun

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对多智能体系统面临的安全挑战,提出基于激活的框架AcMAS,通过分析智能体激活空间中的推理状态检测隐蔽攻击,不依赖交互图,还能恢复受损智能体功能,在检测隐蔽攻击上显著优于基线方法。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06445 2026-07-08 cs.CV cs.AI 新提交 57%

Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders

代理分析:作为条件编码器的视觉语言模型中的定位信号

Yoav Baron, Sara Dorfman, Roni Paiss, Daniel Cohen-Or, Or Patashnik

机构 * Tel Aviv University, Tel Aviv, Israel(特拉维夫大学) Google DeepMind(谷歌DeepMind)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究视觉语言模型(VLMs)作条件编码器时编辑管道定位性能差的问题,引入代理分析框架,通过训练代理模型分析VLM中间表示来揭示编码定位信息的表示,发现现有条件提取策略缺陷,为条件架构设计提供新思路。

Comments Accepted as a Spotlight at the ICML 2026 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏