arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-14 至 2026-05-14 共收录 123 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 24 篇

2605.13021 2026-05-14 cs.LG cs.AI 62%

Rethinking Efficient Graph Coarsening via a Non-Selfishness Principle

重新思考通过非自私原则的高效图粗化

Xu Bai, Bin Lu, Kun Zhang, Shengbo Chen, Xinbing Wang, Chenghu Zhou, Meng Jin

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University, Shanghai, China(上海交通大学信息科学与电子工程学院) School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) School of Environment Science and Engineering, Shanghai Jiao Tong University, Shanghai, China(上海交通大学环境科学与工程学院) School of Artificial Intelligence, Nanchang University, Nanchang, China(南昌大学人工智能学院) Institute of Geographic Sciences and Natural Resources Research, Chinese Academy of Sciences, Beijing, China(中国科学院地理科学与资源研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出非自私原则的图粗化方法NOPE,通过局部各向同性假设降低计算复杂度,实现线性内存和近线性时间复杂度,实验显示在高阶节点上具有显著加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12645 2026-05-14 cs.CL cs.AI 62%

Training LLMs with Reinforcement Learning for Intent-Aware Personalized Question Answering

通过强化学习训练LLMs进行意图感知的个性化问答

Maryam Amirizaniani, Benjamin Charles Germain Lee, Jevin West, Nicholas Weber

机构 * University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IAP框架,通过强化学习直接从单轮问题推断用户意图并生成意图感知的回答,实验表明其在LaMP-QA基准上优于所有基线,平均宏得分提升约7.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09636 2026-05-14 cs.AI cs.CV cs.HC cs.LG 62%

PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records

PersonalAlign:面向个性化GUI代理的分层隐式意图对齐

Yibo Lyu, Gongwei Chen, Rui Shao, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PersonalAlign,通过长期用户记录实现个性化GUI代理的隐式意图对齐,引入AndroidIntent基准测试,评估代理在模糊指令解析和主动建议中的表现,HIM-Agent在执行和主动性能上提升显著。

Comments Accepted to ACL26 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08461 2026-05-14 cs.LG cs.AI cs.CV hep-ex 62%

Adapting Vision-Language Models for Neutrino Event Classification in High-Energy Physics

为高能物理中的中微子事件分类适应视觉-语言模型

Dikshant Sagar, Kaiwen Yu, Alejandro Yankelevich, Jianming Bian, Pierre Baldi

机构 * Department of Computer Science, University of California, Irvine, CA, USA(计算机科学系,加州大学欧文分校,加州,美国) Department of Physics, University of California, Irvine, CA, USA(物理系,加州大学欧文分校,加州,美国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了将微调后的LLaMA 3.2应用于中微子事件分类,对比了Transformer架构与CNN在准确性和鲁棒性上的表现,展示了视觉-语言模型在物理事件分类中的潜力。

Comments Accepted for publication in Communications Physics (Nature Portfolio)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12525 2026-05-14 cs.SI cs.AI cs.CL 62%

PERCEIVE: A Benchmark for Personalized Emotion and Communication Behavior Understanding on Social Media

PERCEIVE:面向社交媒体个性化情绪与交流行为理解的基准测试

Jian Liao, Yujin Zheng, Suge Wang, Jianxing Zheng, Deyu Li

机构 * School of Computer and Information Technology, Shanxi University, China(山西大学计算机与信息学院) Key Laboratory of Computational Intelligence and Chinese Information Processing of Ministry of Education, Shanxi University, China(教育部计算智能与中文信息处理重点实验室,山西大学,中国) Joint Laboratory of Tourism Big Data in Shanxi Province, China(山西省旅游大数据联合实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PERCEIVE是首个整合五维社交感知的双语大规模基准,通过真实用户互动捕捉读者个性化情绪响应,推动社交智能NLP研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13651 2026-05-14 cs.SD cs.AI 57%

NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating

NAACA:无训练神经听觉注意力认知架构:具有振荡工作记忆的显著性驱动注意力门控

Zhongju Yuan, Geraint Wiggins, Dick Botteldooren

机构 * WAVES Research Group, Ghent University, Gent, Belgium(根特大学WAVES研究组,比利时根特) AI Lab, Vrije Universiteit Brussel, Brussel, Belgium(布鲁塞尔自由大学AI实验室,比利时布鲁塞尔) EECS, Queen Mary University of London, London, UK(伦敦大学学院女王学院电子工程与计算机科学系,英国伦敦)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 NAACA通过振荡工作记忆实现听觉显著性过滤,提升音频理解精度并减少冗余处理,实验显示在XD-Violence数据集上AP提升17.1%。

Comments Accepted as a regular paper by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13408 2026-05-14 cs.CL 57%

From Rosetta to Match-Up: A Paired Corpus of Linguistic Puzzles with Human and LLM Benchmarks

从罗塞塔到配对:一种带有人类和LLM评估的语料库语言谜题

Neh Majmudar, Anne Huang, Jinfan Frank Hu, Elena Filatova

机构 * City University of New York (CUNY)(纽约城市大学) Davidson Academy(戴维森学院) Phillips Academy(菲利普斯学术院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了高中语言竞赛中使用的语言谜题,重点分析了罗塞塔石和配对两种常见形式,并提出了一种系统方法将现有罗塞塔石谜题转换为对应的配对谜题,通过人类和LLM评估验证了其有效性。

Comments Proceedings of the Fifteenth Language Resources and Evaluation Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11726 2026-05-14 cs.LG 57%

Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models

Block-R1: 重新审视块大小在多领域强化学习中的作用以提升扩散大语言模型

Yan Jiang, Ruihong Qiu, Zi Huang

机构 * The University of Queensland(昆士兰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文从领域冲突角度研究多领域场景下扩散大语言模型强化学习中的块大小问题,提出领域块大小冲突公式、Block-R1-41K数据集、Block-R1基准和跨领域强化学习方法,通过13个数据集和7种算法验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16246 2026-05-14 cs.AI 57%

Toward Scalable Verifiable Reward: Proxy State-Based Evaluation for Multi-turn Tool-Calling LLM Agents

迈向可扩展的可验证奖励:基于代理状态的多轮工具调用LLM代理评估

Yun-Shiuan Chuang, Chaitanya Kulkarni, Alec Chiu, Avinash Thangali, Zijie Pan, Shivani Shekhar, Yirou Ge, Yixi Li, Uma Kona, Linsey Pang, Prakhar Mehrotra

机构 * PayPal AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于代理状态的评估框架,用于多轮工具调用LLM代理的可扩展可验证奖励评估,通过LLM驱动的模拟框架实现稳定且区分模型的排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13332 2026-05-14 cs.AI cs.CC 57%

Diversity of Extensions in Abstract Argumentation

抽象论证中扩展的多样性

Johannes K. Fichte, Markus Hecher, Yasir Mahmood, Zhengjun Wang

机构 * Department of Computer and Information Science (IDA), Linköping University, Sweden(链接öping大学计算机与信息科学系(IDA)) University of Potsdam, Germany & University of Artois, CNRS, UMR8188 (CRIL), France(波茨坦大学 & 阿尔托伊斯大学、法国CNRS UMR8188(CRIL)) Data Science Group, Heinz Nixdorf Institute, Paderborn University, Germany(帕德博恩大学数据科学小组、海因茨·尼克斯多夫研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究了抽象论证中扩展多样性的量化概念,探讨了扩展的兼容性及计算最大多样性k值的方法。

Comments Technical Report to the paper accepted at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13311 2026-05-14 cs.AI cs.IR cs.MA 57%

IdeaForge: A Knowledge Graph-Grounded Multi-Agent Framework for Cross-Methodology Innovation Analysis and Patent Claim Generation

IdeaForge: 一种基于知识图谱的多智能体框架,用于跨方法论创新分析和专利主张生成

Joy Bose

机构 * Independent Researcher(独立研究员)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 IdeaForge通过多智能体框架整合TRIZ、设计思维和SCAMPER等创新方法,利用知识图谱实现跨方法论的创新分析和专利主张生成,提升创新候选的多样性和可追溯性。

Comments 14 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12988 2026-05-14 cs.AI cs.CY cs.IR 57%

Retrieval-Augmented Tutoring for Algorithm Tracing and Problem-Solving in AI Education

增强检索的辅导系统用于AI教育中的算法追踪与问题解决

Mragisha Jain, Tirth Bhatt, Griffin Pitts, Aum Pandya, Peter Brusilovsky, Narges Norouzi, Arto Hellas, Juho Leinonen, Bita Akram

机构 * North Carolina State University(北卡罗来纳州立大学) University of Pittsburgh(匹兹堡大学) University of California, Berkeley(加州大学伯克利分校) Aalto University(阿尔托大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出KITE系统,通过增强检索生成技术辅助学生理解算法追踪和问题解决,提升算法推理能力。

Comments Paper accepted to the 21st Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2026), co-located with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10267 2026-05-14 cs.AI 57%

IndustryBench: Probing the Industrial Knowledge Boundaries of LLMs

IndustryBench: 探索大语言模型在工业知识边界的限制

Songlin Bai, Xintong Wang, Linlin Yu, Bin Chen, Zhiang Xu, Yuyang Sheng, Changtong Zan, Xiaofeng Zhu, Yizhe Zhang, Jiru Li, Mingze Guo, Ling Zou, Yalong Li, Chengfu Huo, Liang Ding

机构 * Multimodal and Industrial AI Team(多模态与工业AI团队)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 IndustryBench通过中国国家标准和工业产品记录构建2049项工业采购问答基准,揭示LLM在工业QA中的可靠性问题,发现标准与术语能力最弱,扩展推理降低安全调整分数,安全违规率影响排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18842 2026-05-14 cs.CR cs.AI cs.CV 57%

GUIGuard-Bench: Toward a General Evaluation for Privacy-Preserving GUI Agents

GUIGuard-Bench:面向隐私保护GUI代理的通用评估

Yanxi Wang, Zhiling Zhang, Wenbo Zhou, Weiming Zhang, Jie Zhang, Qiannan Zhu, Yu Shi, Shuxin Zheng, Jiyan He

机构 * Beijing Normal University(北京师范大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) A*STAR Zhongguancun Institution of Artificial Intelligence(中关村人工智能研究所)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 GUIGuard-Bench通过241个真实GUI代理轨迹和4080张截图,评估隐私保护GUI代理的隐私识别、规划一致性和保护策略影响,揭示隐私识别是实际应用中的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00839 2026-05-14 cs.SE cs.AI 57%

CodeClash: Benchmarking Goal-Oriented Software Engineering

CodeClash:面向目标导向软件工程的基准测试

John Yang, Kilian Lieret, Joyce Yang, Carlos E. Jimenez, Muhtasham Oblokulov, Aryan Siddiqui, Ofir Press, Ludwig Schmidt, Diyi Yang

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Cornell University(康奈尔大学) Technical University of Munich(慕尼黑技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CodeClash通过多轮竞赛评估语言模型在无明确指导下迭代开发代码以实现开放性目标的能力,揭示了模型在战略推理和长期代码维护方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13034 2026-05-14 cs.CV cs.IR 50%

ViDR: Grounding Multimodal Deep Research Reports in Source Visual Evidence

ViDR:基于源视觉证据的多模态深度研究报告 grounding

Zhuofan Shi, Peilun Jia, Baoqin Sun, Haiyang Shen, Sixiong Xie, Yun Ma, Xiang Jing

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) National Key Laboratory of Data Space Technology and System(数据空间技术与系统国家重点实验室) School of Software Engineering, Beijing Jiaotong University(北京交通大学软件学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 ViDR通过源视觉证据构建多模态深度研究报告框架,提升报告质量与证据可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13054 2026-05-14 cs.CV 50%

Topo-R1: Detecting Topological Anomalies via Vision-Language Models

Topo-R1: 通过视觉-语言模型检测拓扑异常

Meilong Xu, Qingqiao Hu, Xiaoling Hu, Shahira Abousamra, Xin Yu, Weimin Lyu, Kehan Qi, Dimitris Samaras, Chao Chen

机构 * Stony Brook University(石溪大学) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院) Stanford University(斯坦福大学) Penn State University(宾夕法尼亚州立大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文通过构建拓扑感知基准Topo-R1,评估视觉-语言模型在检测管状网络拓扑异常中的能力,发现现有模型缺乏拓扑感知,提出基于拓扑感知奖励的联合评分方法,显著提升模型在ID和OOD测试中的性能。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 16 篇

2605.12746 2026-05-14 cs.CR cs.AI 92%

CoT-Guard: Small Models for Strong Monitoring

CoT-Guard:用于强监控的小型模型

Nirav Diwan, Han Wang, Berkcan Kapusuzoglu, Ramin Moradi, Supriyo Chakraborty, Giri Iyengar, Sambit Sahu, Huan Zhang, Gang Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Capital One

专题命中 其他推理 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出CoT-Guard,通过结合监督微调和强化学习,提升小型模型在代码生成任务中检测隐藏目标的能力,其在提示和代码攻击下的表现优于现有大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23143 2026-05-14 cs.AI 87%

THINKSAFE: Self-Generated Safety Alignment for Reasoning Models

THINKSAFE: 为推理模型生成的自我安全对齐

Seanie Lee, Sangwoo Park, Yumin Choi, Gyeongman Kim, Minki Kang, Jihun Yun, Dongmin Park, Jongho Park, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) KRAFTON(KRAFTON公司) UC Berkeley(加州大学伯克利分校)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 THINKSAFE通过自我生成对齐框架提升推理模型的安全性,无需外部教师,实验表明其在安全性和推理能力上优于GRPO,计算成本显著降低。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13255 2026-05-14 cs.AI 83%

Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning

尊重自我不确定性在在线自我蒸馏中的高效大语言模型推理

Junlong Ke, Zichen Wen, Weijia Li, Conghui He, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出EGRSD方法,通过三种信号统一token级更新,提升大语言模型推理的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13687 2026-05-14 cs.LG cs.AI stat.ML 81%

A Hierarchical Language Model with Predictable Scaling Laws and Provable Benefits of Reasoning

具有可预测扩展规律和推理证明益处的分层语言模型

Jason Gaitonde, Frederic Koehler, Elchanan Mossel, Joonhyung Shin, Allan Sly

机构 * Duke University(杜克大学) University of Chicago(芝加哥大学) Massachusetts Institute of Technology(麻省理工学院) Princeton University(普林斯顿大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种合成语言家族,通过树上的广播过程生成,分析上下文长度和推理在自回归生成中的作用。通过精确k-gram假设,证明了在特定条件下,上下文深度与序列生成的方差和峰度关系,展示了推理模型在有限内存下能精确生成真实语言。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12518 2026-05-14 cs.CL cs.AI 81%

TimelineReasoner: Advancing Timeline Summarization with Large Reasoning Models

TimelineReasoner: 通过大推理模型推进时间线摘要

Liancheng Zhang, Xiaoxi Li, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出TimelineReasoner框架,通过大推理模型的主动推理能力,改进时间线摘要任务,提升准确性、覆盖性和连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07267 2026-05-14 cs.CR 78%

How to Steal Reasoning Without Reasoning Traces

如何在不进行推理的情况下窃取推理

Tingwei Zhang, John X. Morris, Vitaly Shmatikov

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出trace inversion模型,通过输入、答案和推理摘要生成详细推理轨迹,证明隐藏推理轨迹不会阻碍模型推理能力的窃取,并通过微调提升学生模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03295 2026-05-14 cs.CL cs.AI cs.CY 73%

Language Model Goal Selection Differs from Humans' in a Self-Directed Learning Task

语言模型的目标选择与人类在自我指导学习任务中不同

Gaia Molinaro, Dave August, Danielle Perszyk, Anne G. E. Collins

机构 * University of California, Berkeley(加州大学伯克利分校) Amazon AGI Lab(亚马逊人工智能实验室)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 研究通过控制实验发现语言模型在目标选择上与人类存在显著差异,多数模型表现不佳,而人类则能逐步探索并达成多样化目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15867 2026-05-14 cs.LG cs.AI cs.CL cs.MA 67%

RDMA: Cost Effective Agent-Driven Rare Disease Mining from Electronic Health Records

RDMA: 低成本的代理驱动罕见病挖掘从电子健康记录

John Wu, Adam Cross, Jimeng Sun

机构 * Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Department of Pediatrics, University of Illinois College of Medicine Peoria(伊利诺伊大学皮奥里亚医学院儿科系)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RDMA通过代理框架在电子健康记录中挖掘罕见病,无需特定任务训练,提升性能并降低部署成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02350 2026-05-14 cs.AI cs.LG cs.MA 62%

Context Learning for Multi-Agent Discussion

多智能体讨论中的上下文学习

Xingyuan Hua, Sheng Yue, Xinyi Li, Yizhe Zhao, Jinrui Zhang, Ju Ren

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Cyber Science and Technology, Sun Yat-sen University Shenzhen Campus(中山大学深圳校区网络科学与技术学院) College of Computer Science, Northwest University(西北大学计算机学院) State Key Laboratory of Internet Architecture, Tsinghua University(清华大学互联网体系结构实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出M2CL方法,通过动态生成上下文指令提升多智能体讨论的一致性与协作效率,实验表明其在多个任务中性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13625 2026-05-14 cs.AI 57%

How to Interpret Agent Behavior

如何解释智能体行为

Jie Gao, Kaiser Sun, Jen-tse Huang, Katherine Van Koevering, Sijie Ji, Heyuan Huang, Weiyan Shi, Zhuoran Lu, Ziang Xiao, Daniel Khashabi, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学) California Institute of Technology(加州理工学院) Northeastern University(东北大学) Purdue University(普渡大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ACT*ONOMY框架,通过构建行为分类体系和开放仓库,帮助研究人员更一致地解读智能体行为,提升监控与控制能力。

Comments 34 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13411 2026-05-14 cs.CR cs.CL 57%

Model-Agnostic Lifelong LLM Safety via Externalized Attack-Defense Co-Evolution

基于外部化攻击-防御共演的模型无关持续LLM安全

Xiaozhe Zhang, Chaozhuo Li, Hui Liu, Shaocheng Yan, Bingyu Yan, Qiwei Ye, Haoliang Li

机构 * City University of Hong Kong(香港城市大学) Beijing University of Posts and Telecommunications(北京邮电大学) Wuhan University(武汉大学) Beihang University(北京航空航天大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出EvoSafety框架,通过外部结构实现持续安全改进,采用对抗技能库和轻量防御模型,在单一训练中实现攻击探测与防御提升,实验显示其在Guard模式下防御成功率高达99.61%。

Comments 48 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01750 2026-05-14 cs.MA cs.AI 57%

Talk is Cheap, Communication is Hard: Dynamic Grounding Failures and Repair in Multi-Agent Negotiation

言者无罪,沟通艰难:多智能体谈判中的动态 grounding 故障与修复

Yiheng Yao, Chelsea Zou, Robert D. Hawkins

机构 * Stanford University(斯坦福大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究多智能体谈判中动态 grounding 的故障与修复,通过多轮谈判游戏揭示四类失败模式,发现协调瓶颈在于动态 grounding 而非个体推理或信息不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26969 2026-05-14 cs.IR cs.AI 57%

AgenticRecTune: Multi-Agent with Self-Evolving Skillhub for Recommendation System Optimization

AgenticRecTune: 多智能体与自演化技能 hub 用于推荐系统优化

Xidong Wu, Yue Zhuan, Ruoqiao Wei, Hangxin Chen, Di Bai, Jintao Liu, Xinyi Wang, Xue Wang, Luoshu Wang, Xinwu Cheng

机构 * Google(谷歌)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AgenticRecTune框架,通过五个智能体实现端到端配置优化,利用LLM进行最优配置空间探索,结合自演化Skillhub提升推荐系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏