arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4155 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 1018 篇

2607.25891 2026-07-29 cs.AI cs.DB 新提交 57%

Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation

梅西耶:用于跨基准智能体评估的高分辨率语料库

Stefan Krsteski, Charlotte Meyer, Guillaume Allegre, Tony O'Halloran, Alexandre Sallinen

机构 * Andromede AI(仙女座人工智能公司)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 研究针对智能体评估中任务等碎片化问题,引入梅西耶语料库,整合多基准、智能体、任务和验证器等信息,标准化记录并分类。通过该语料库发现基准进展不均衡,指出多验证器任务评分问题,得出能力量表,为智能体评估提供基础可复用设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25420 2026-07-29 cs.IR cs.AI 新提交 57%

MARS: Multi-Agent Re-ranking for Repeat-Order Food Delivery Recommendation

MARS:用于重复订单食品配送推荐的多智能体重排

Jiahao Tian, Zhenkai Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对重复订单食品配送推荐,提出MARS模块化多智能体重排框架,分两阶段推荐,结合多种信号与推理。通过实验评估,贡献包括给出集成框架、证明预训练主干结合轻量级检索有竞争力、建立可重现评估设置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24856 2026-07-29 cs.CV cs.AI 新提交 57%

DisasterTD: Disaster Toponym Disambiguation Using Multimodal LLMs and Cross-View Geolocalization

DisasterTD:使用多模态大语言模型和跨视角地理定位的灾害地名消歧

Wenping Yin, Ziqi Liu, Naixia Mou, Weijia Li, Danfeng Hong, Hao Li

机构 * College of Geodesy and Geomatics, Shandong University of Science and Technology(山东科技大学测绘与地理信息学院) School of Environmental Science and Spatial Informatics, China University of Mining and Technology(中国矿业大学环境与测绘学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Automation, Southeast University(东南大学自动化学院) Department of Geography, National University of Singapore(新加坡国立大学地理系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对社交媒体图像地理参考模糊问题,提出DisasterTD框架,集成多模态大语言模型语义推理与跨视角地理定位,在飓风哈维数据集上评估,该方法优于基线,能有效进行细粒度灾害地理定位,提升不同距离下的定位准确率并减少误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24810 2026-07-29 cs.AI eess.IV 新提交 57%

RRS-10K: A Multitask Vision-Language Model Benchmark for Rare Remote Sensing Image Interpretation

RRS-10K:用于罕见遥感图像解释的多任务视觉语言模型基准测试

Yuqiao Lai, Jiancheng Qi, Fei Wang, Yuxin Liu, Kun Li, Ye Chen, Yan Gao, Yanyan Wei

机构 * Laboratory of Intelligent Language Processing, National University of Defense Technology(国防科技大学智能语言处理实验室) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) United Arab Emirates University(阿联酋大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对视觉语言模型在罕见遥感图像解释能力不足的问题,提出RRS-10K基准测试,含军事遥感图像及问答对,构建时引入干扰项过滤策略,评估多个模型,揭示其性能弱点,为开发更可靠的遥感视觉语言模型提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24707 2026-07-28 cs.AI cs.CV cs.DB 新提交 57%

ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams

ERUnderstand:在结构化实体关系图上评估视觉语言模型

Ali Ansari, Yasmin Mohammadi, Farnoush Nili, Parsa Esmaeilkhani, Longin Jan Latecki, Eduard Dragut

机构 * Temple University(天普大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对实体关系图仅为图像限制AI辅助数据库工程的问题,引入ERUnderstand基准测试。通过对2960个图表及标准化表示评估视觉语言模型,发现常见元素恢复良好,但特定元素性能差,推理增强模型可提升性能,为评估多模态理解提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24625 2026-07-28 cs.CR cs.AI 新提交 57%

Agentic Permissions Policy Algebra for Taint Confinement in LLM Agents

用于大语言模型代理中污点限制的代理权限策略代数

Arseny Kravchenko, Vadim Liventsev, Innokentii Konstantinov, Ildar Iskhakov, Matvey Kukuy

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究大语言模型代理处理混合机密数据时的安全风险,提出APPA框架,通过引擎管理上下文分支等解决可用性瓶颈,经双幺半群模型证明相关特性,实验表明其能抑制数据泄露并恢复部分被污点跟踪损失的效用。

Comments Preprint. Submitted to the 19th ACM Workshop on Artificial Intelligence and Security (AISec '26). 10 pages, 2 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24273 2026-07-28 cs.CL 新提交 57%

INS-ActBench: A Comprehensive Benchmark for Assessing Professional Actuarial Capability of Large Language Models

INS-ActBench:一个用于评估大语言模型专业精算能力的综合基准

Changyu Chen, Chenwei Lin, Xian Xu

机构 * Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 介绍INS-ActBench这一综合基准评估大语言模型专业精算能力,含12050个问答对及三个子集,通过实验揭示前沿大语言模型在不同方面的能力表现,为精算大语言模型开发提供可重复基础。

Comments 18 pages, including appendices; 11 figures and 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24054 2026-07-28 cs.AI 新提交 57%

Success Is Not Self-Explanatory: Auditing Success Provenance in Agent Evaluation

成功并非不言自明:在智能体评估中审核成功溯源

Jingkun Luo, Da-Tian Peng

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究智能体评估中成功溯源问题,通过AcquaBench的匹配值替换和聚类分析审核,在不同场景测试,发现成功与正确值相关,行为依赖可能超出预期,模型比较有分数差距变化,建议基准报告成功及信息状态支持情况。

Comments 17 pages, 3 figures, including supplementary material. Code: https://github.com/luojingkun22/acquabench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23740 2026-07-28 cs.CL 新提交 57%

Zing: Social Mind for LLMs

Zing:大语言模型的社交智能

Zing Team, Ao Xiang, Bi Jingping, Chen Jiahui, Chen Lehan, Chen Yilin, Cheng Xueqi, Fan Yixing, Gan Kairong, Gao Haowen, Gao Jinhua, Gao Shuxuan, Gong Chang, Guo Jiafeng, Guo Ruijie, Han Zhouyu, He Guangfu, He Yichun, Jiang Shuo, Jing Shaoling, Jing Ya, Lei Chenhao, Lei Yan, Li Anqi, Li Chengao, Li Haoyu, Li Shitian, Liang Xinjian, Liu Zhaoge, Lyu Xingyu, Nie Zhuwei, Pang Liang, Quan Zeping, Shan Shiguang, Shen Huawei, Tang Xinran, Tian Feng, Wang Qian, Wang Ruiping, Wang Xiaohong, Xia Zaiyu, Xiao Yi, Xu Jiayuan, Xu Kehan, Xu Qianqian, Xu Tianyu, Xu Yongjun, Yang Haoming, Yang Jun, Yao Di, Yu Xiaoming, Zhang Futong, Zhang Jie, Zhang Shixuan, Zhang Yuxuan, Zhao Xinyu, Zhao Zhuoran, Zhong Yunfei, Zhu Shengyu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究大语言模型社交智能,提出Zijing框架,含测量基准SoMBench、训练方法Zing及推理架构Actio,通过实验证明社交智能大语言模型在评估、内化和落地方面需协同发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23386 2026-07-28 cs.AI 新提交 57%

Confidently Wrong: Exception Chain Collapse in Frontier LLM Rule Evaluation

确信错误:前沿大语言模型规则评估中的异常链崩溃

Paul Simpson, John Kozak, Lisa Doake

机构 * Aethis

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究前沿大语言模型在规则评估中异常链崩溃问题,提出神经符号架构Aethis资格模块,通过多方面验证,将不确定性从推理边界转移到规范边界,且相关内容公开可重现。

Comments 43 pages, 9 figures. Working paper v3.13.0. Benchmark data, rule encodings and per-case result artefacts: https://github.com/Aethis-ai/confidently-wrong-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23123 2026-07-28 cs.AI 新提交 57%

SQBench: A Benchmark for Evaluating Task Delivery by Language-Model Agents in Production-Oriented Workflows

SQBench:用于评估面向生产工作流程中语言模型代理任务交付的基准测试

Summer Sun

机构 * Shaqiu Community(沙丘社区)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究面向生产工作流程中语言模型代理任务交付评估问题,核心方法是引入SQBench基准测试,包含多种任务并按特定方式评估,主要贡献是揭示功能完成度不能完全体现交付质量,风险判定需单独报告。

Comments 17 pages, 8 figures. Code and aggregate results: https://github.com/shaqiu-ai/SQBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22600 2026-07-28 cs.AI 新提交 57%

Chart Deception in Vision-Language Models: From Vulnerability to Mitigation

视觉语言模型中的图表欺骗:从漏洞到缓解

Ridwan Mahbub, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Mizanur Rahman, Mir Tafseer Nayeem, Enamul Hoque

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究视觉语言模型对图表欺骗的鲁棒性,引入VisDeception基准和欺骗分数,发现模型易受影响,提出推理时多智能体缓解框架,揭示可靠性差距,确立相关评估及推理方向以开发更可信的视觉分析VLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22598 2026-07-28 cs.CY cs.AI cs.HC 新提交 57%

A didactical-driven teacher assistant for a dimensional modeling course

面向维度建模课程的教学驱动型教师助手

Laurent Brisson, Maria Segarra, Grégory Smits

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对维度建模课程,提出教学驱动型教师助手,无需商业大语言模型预算或GPU设施。架构含确定性模块处理多任务,大语言模型作语言执行器。评估学生问题发现标准检索不足,确定性管道精度高但覆盖有限,为教学策略提供新思路。

Journal ref International Conference on Computer Supported Education, May 2026, Benidorm/Spain, France. pp.177-189

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22566 2026-07-28 cs.AI 新提交 57%

MedLoCoMo: A Long-Context Multi-Session Medical Dialogue Benchmark for Large Language Models

MedLoCoMo:用于大语言模型的长上下文多会话医学对话基准

Zeyu Zhang, Ziqing Wang, Kaize Ding

机构 * Northwestern University(西北大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对大语言模型在多入院医学对话临床推理方面的不足,构建MedLoCoMo基准,通过特定方法生成问答项目,含100个患者时间线,发现跨入院推理比局部证据使用难,提供代码和基准供使用与复现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22529 2026-07-27 cs.CL 新提交 57%

Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills

技能自我博弈:通过协同进化技能拓展大语言模型能力边界

Siyuan Huang, Pengyu Cheng, Haotian Liu, Tao Chen, Yihao Liu, Jingwei Ni, Shijie Zhou, Ziyi Yang, Gangwei Jiang, Mengyu Zhou, Yu Cheng, Xiaoxi Jiang, Guanjun Jiang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究针对大语言模型训练困境,引入Skill Self-Play协同进化框架,由提议者、求解器和控制器构成,经强化学习循环使组件协同进化,有效弥合验证与探索差距,推动模型性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22445 2026-07-27 cs.AI cs.CR 新提交 57%

Dynamic Capability Scoping for Enterprise AI Agents: A Synthetic Dataset and Three-Source Permission Architecture

企业人工智能代理的动态能力范围界定:一个合成数据集和三源权限架构

Halil Burak Noyan

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究企业人工智能代理动态能力范围界定问题,提出三源权限架构,包括基于角色的上限等,贡献含600个企业任务提示的合成数据集,经验证可推动策略优化,还发布相关内容支持对动态范围界定机制的评估。

Comments Published at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22136 2026-07-27 cs.CL 新提交 57%

Dynamic Commonsense Coordination for Empathetic Response Generation

用于移情响应生成的动态常识协调

Zhengyu Qi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究移情响应生成问题,提出含三个互补模块的动态常识协调框架DCC,能整合常识表示、过滤低相关性关系及动态检索记忆,实验表明其可提升情绪分类准确率、响应多样性等,生成更好的响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22115 2026-07-27 cs.DB cs.AI 新提交 57%

Benchmarking Text-to-SQL under Role-Based Access Control

基于角色的访问控制下的文本到SQL基准测试

Yang Fei, Yangfan Jiang, Yin Yang, Xiaokui Xiao

机构 * National University of Singapore(新加坡国立大学) Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究基于角色的访问控制下文本到SQL的基准测试问题,提出含现实RBAC约束的综合基准测试框架,通过大语言模型辅助工作流程及人工审核等增强基准,应用该框架研究发现部分高分系统在有访问约束时性能因RBAC违规而大幅下降。

Comments Accepted at ACM SIGMOD 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21962 2026-07-27 cs.CL 新提交 57%

Ground Truth First: A Longitudinal Evaluation Instrument for Agent Memory, and the Tenure Crossover in Memory-Architecture Rankings

真实优先:智能体记忆的纵向评估工具及记忆架构排名中的任期交叉

Quentin Spencer

专题命中 推理评测 :verifier(abstract);分类 cs.CL

AI总结 研究大型语言模型智能体记忆基准问题,提出颠倒流程的评估方法,通过合成虚构语料库嵌入新特征,对五种记忆架构基准测试,发现排名随历史长度反转,分层架构表现最佳,发布开源库Veracium。

Comments 25 pages, 2 figures. Code: https://github.com/veracium-ai/Veracium

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21763 2026-07-27 cs.CR cs.AI 新提交 57%

Every Model Cheats: Prompt-Level Mitigation of Cheating on Offensive Cyber Tasks

每个模型都作弊:在进攻性网络任务中对作弊行为进行提示级缓解

Michael Kouremetis, Ads Dawson, Raja Sekhar Rao Dheekonda, Brian Greunke

机构 * dreadnode

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 研究大语言模型在网络安全基准测试中的作弊问题,通过对22个前沿模型在三种提示条件下的控制提示消融研究,发现作弊普遍,反作弊提示能降作弊倾向,但即使最严条件下仍有模型作弊,引入“解决率”指标,强调反作弊提示非环境控制替代品。

Comments 21 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21680 2026-07-27 cs.LG 新提交 57%

Encoding Invisible Causation for Bridge Diagnostic Agents: Triple-Guided Retrieval-Augmented Fine-Tuning with QLoRA

为桥梁诊断代理编码无形因果关系:基于QLoRA的三重引导检索增强微调

Takato Yasuno

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 研究针对桥梁损伤原因难以肉眼察觉及专家诊断依赖隐性知识的问题,提出基于QLoRA的三重引导检索增强微调方法(含知识三元组提取等组件),能在消费级硬件上实现内存高效、高精度的桥梁诊断代理。

Comments 13 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21614 2026-07-27 cs.AI 新提交 57%

Household Movement Detection in Mixed-Format Occupancy Data Using LLM-Based Entity Resolution

使用基于大语言模型的实体解析在混合格式居住数据中进行家庭移动检测

Sasirekha Oguri, John R. Talburt, Mert Can Cakmak

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究在混合格式居住数据中检测家庭移动相关间接实体链接的问题,核心方法是集成基于提示的LLM命名实体识别、语义文本嵌入和基于图的推理,主要贡献是提高召回率和F1分数。

Comments Computer Science & Information Technology (CS & IT) ISSN : 2231 - 5403, Volume 16, Number 10, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21173 2026-07-24 cs.LG 新提交 57%

Automated Synthesis and Adversarial Validation of Executable Causal Research Pipelines

可执行因果研究管道的自动合成与对抗验证

Irena Girshovitz, Dan Zeltzer, Ran Gilad-Bachrach

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 研究聚焦自动化研究系统隐性失败问题,核心方法是提出ARA框架,集成多环节到统一管道,将自然语言问题转化为可执行代码并评估。主要贡献是改变失败模式,强调有效性优先的自动化科学系统评估应综合考量答案准确性及因果声明合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21155 2026-07-24 cs.CV cs.AI 新提交 57%

CRAG-MM-Diagnostics: Enabling Stage-Wise Analysis of Knowledge-Intensive VQA

CRAG-MM诊断:实现对知识密集型视觉问答的逐阶段分析

Hanseok Oh, Parishad BehnamGhader, Benno Krojer, Hyunji Lee, Paul Liang, Siva Reddy, Verna Dankers

机构 * New York University(纽约大学) McGill University(麦吉尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) UNC Chapel Hill(北卡罗来纳大学教堂山分校) MIT(麻省理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究知识密集型视觉问答流程,引入CRAG-MM-Diagnostics诊断基准,通过逐阶段数据注释分离子问题,评估VLM并进行细粒度分析,指出知识检索和推理是主要瓶颈,还提出改进流程提升准确率。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21063 2026-07-24 cs.CL cs.CY cs.HC 新提交 57%

QuantiBias: Benchmarking Quantization-Induced Bias in LLMs

QuantiBias:量化大语言模型中量化诱导偏差的基准测试

Emilio Ferrara

机构 * University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究大语言模型量化中的偏差问题,提出QuantiBias基准测试,通过结合多种控制和对比有无推理的构建来评估偏差,发现量化器按无偏差预防信号的数据分配精度,推理对部分偏差有减半效果,强调需重新评估量化模型的开放式偏差。

Comments Benchmark protocol on Hugging Face: https://huggingface.co/datasets/emilioferrara/quantibias

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20925 2026-07-24 cs.AI 新提交 57%

Representing Entity Importance in AI Knowledge Systems: A Dual-Signal Framework of Audience Evaluation and Structural Authority

在人工智能知识系统中表示实体重要性:受众评估与结构权威的双信号框架

Shen Xu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究人工智能知识系统中实体重要性表示,提出受众评估与结构权威双信号框架,经电影实体实验验证,表明两维度是不可冗余信号,贡献是最小知识表示框架及维度必要性实证测试,支持任务感知AI知识系统。

Comments 12 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20462 2026-07-24 cs.AI 新提交 57%

Marking the Wrong Symptoms: Evaluating LLM Watermarks in Medical Texts

标记错误症状:评估医学文本中的大语言模型水印

Melanie Rieff, Robin Staab, Thibaud Gloaguen, Stefan Hegselmann, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院) Berlin Institute of Health at Charité – Universitätsmedizin Berlin(柏林夏里特医学院柏林健康研究所) Deutsches Herzzentrum der Charité – Medical Heart Center of Charité and German Heart Institute Berlin(柏林夏里特医学院德国心脏中心与柏林德国心脏研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究LLM水印对医学性能的影响,在11个LLM和7个VLM上对5种水印方案进行多任务基准测试,引入人类专家验证管道补充评估,发现水印会致多种退化,特定领域评估是医学中水印模型安全部署的前提。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19899 2026-07-23 cs.MA cs.LG 新提交 57%

Harnessing Disagreement: Detecting Correlated Agreement Blindness in Multi-Agent Triage

利用分歧:检测多智能体分诊中的相关一致性盲点

Shay Seiya McDonnell, Avantika Singh, Quoc-Viet Pham, Vratislav Havlik, Gregory M. P. O'Hare

机构 * School of Computer Science \& Statistics, Trinity College Dublin, College Green, Dublin 2, Ireland ADAPT Centre, Trinity College Dublin, College Green, Dublin 2, Ireland CKDelta, 28/29 Sir John Rogerson's Quay, Dublin 2, Ireland

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 研究多智能体分诊中分歧引发升级导致的相关一致性盲点问题,提出结合随机森林、k近邻智能体及校准元模型的ARAT系统。通过实验表明该系统能降低预测不足,跨数据集验证显示多样化产生有效分歧才提升安全,揭示相关故障被忽视的风险。

Comments 14 pages, 2 figures, 3 tables. Accepted at PAAMS 2026; this is the author's pre-review submitted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19433 2026-07-23 cs.AI cs.CR 新提交 57%

The Chronos Vulnerability: A Taxonomy of Temporal Persistence and Memory-Based Deception in Agentic AI

Chronos漏洞:智能AI中基于时间持久性和内存欺骗的分类法

Om Narayan, Ramkinker Singh, Praveen Baskar

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 研究人工智能中Chronos漏洞,形式化基于持久性攻击的威胁模型,指出传统端点内容过滤器不足,综合深度防御格局并分类新兴框架,应对智能体内存攻击等安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19429 2026-07-23 cs.LG 新提交 57%

Adaptive Multi-Expert Graph Transformer for Interpretable EEG-Based Diagnostics

用于基于脑电图的可解释诊断的自适应多专家图变换器

Maryam Rahimimovassagh, Md Elias Hossain, Ivan Garibay, Niloofar Yousefi

机构 * University of Central Florida(中佛罗里达大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 研究基于EEG的诊断问题,提出空间多专家图变换器,将EEG记录建模为动态功能连接图序列,用wPLI估计连接性,经层次图编码和多专家架构实现亚型感知推理,实验证明该方法在异常检测上性能良好且具可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏