arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-31 至 2026-07-31 共收录 49 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 49 篇

2605.15040 2026-07-31 cs.AI cs.CL 版本更新 89%

Orchard: An Open-Source Agentic Modeling Framework

Orchard:一个开源的智能体建模框架

Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandro Sordoni, Xingdi Yuan, Yelong Shen, Pengcheng He, Tong Zhang, Zhou Yu, Jianfeng Gao

机构 * Microsoft Research(微软研究院) Columbia University(哥伦比亚大学) UIUC(伊利诺伊大学香槟分校)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);tool use(abstract)

AI总结 本文提出Orchard,一个开源的智能体建模框架,通过轻量级环境服务和三种智能体建模食谱,实现了跨领域可重用的智能体数据、训练和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27556 2026-07-31 cs.AI cs.MA 新提交 87%

Evaluating Agentic Bioinformatics through Function, Evidence, and Validation

通过功能、证据和验证评估智能体生物信息学

Phuc Pham, Truong-Son Hy

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);workflow(abstract)

AI总结 该研究提出FEV框架评估智能体生物信息学,梳理多领域128篇文献后发现规划等进展快于科学验证相关环节,主张应基于工作流正确性评估这类系统

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27453 2026-07-31 cs.AI 新提交 84%

VAmoS Bench: Voice Agent Simulation Bench

VAmoS Bench:语音智能体仿真基准

Joshua Meyer, Sahar Shayegan, Ritiz Tambi, Ali Khan, Sun Kim, Victor Shih, Mehdi Jamei, Andi Partovi

机构 * Veris AI(维瑞斯人工智能公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 该研究推出 VAmoS Bench 语音智能体仿真基准,针对现有基准无法评估语音智能体独立处理电话呼叫能力的空白,在金融服务场景中端到端评估完整语音智能体系统,支持动态排行榜。

Comments 12 pages, 3 figures, 2 tables. Agent implementations: https://github.com/veris-ai/riley-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27677 2026-07-31 cs.MA cs.AI 新提交 83%

Stop Shipping AI Agents on Faith: Capability Is Not Production Readiness

不要凭直觉部署AI智能体:能力并非生产就绪

Fouad Bousetouane

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 该研究针对AI智能体部署依赖能力而非生产就绪性的问题,提出ProofAgent Index(PAI)这一四维度治理就绪指标,经医疗、金融领域验证可区分风险,实现从直觉部署到可审计决策的转变。

Comments 24

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04425 2026-07-31 cs.CR cs.AI 版本更新 83%

What If Prompt Injection Never Left? Rethinking Agent Security through Cross-Session Stored Prompt Injection

如果提示注入从未消失?探索智能体系统中的跨会话存储提示注入

Yuanbo Xie, Wenlei Zhu, Tianyun Liu, Yingjie Zhang, Suchen Liu, Yulin Li, Liya Su, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) AI Sec Lab, Beijing Chaitin Technology Co.,Ltd(北京柴坦科技有限公司AI安全实验室)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本研究引入跨会话存储提示注入,通过持久化状态使提示注入从单会话模型级威胁转变为长期系统级漏洞,并构建了分类法、基准测试和沙箱工具以评估风险。

Comments position paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27259 2026-07-31 cs.LO cs.AR 新提交 82%

CircuitProver: Agentic Lean 4 Theorem Proving with Reusable Circuit Proof Library for Hardware Verification

CircuitProver:基于可复用电路证明库的智能体Lean 4定理证明框架,用于硬件验证

Ziyi Yang, Wenji Fang, Chen Chen, Zhiyao Xie, Hongce Zhang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 CircuitProver是基于Lean 4的智能体硬件验证框架,可自动转换硬件设计为Lean模型,通过积累可复用证明知识完成63项基准证明,比普通智能体更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27595 2026-07-31 cs.CL cs.AI cs.DL 新提交 81%

Beyond Similarity: Grounded Agentic Extraction and Expert-Adjudicated Evaluation of Intertextuality in Classical Chinese Histories

超越相似性:中国古典史书互文性的智能体式提取与专家裁决评估

Zhaoji Wang, Wanyu Si, Jun Wang

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本研究将细粒度互文性提取设为LLM智能体任务,构建专家裁决的古典史书互文基准,验证12种LLM性能,扩展至二十四史揭示引文的总体稳定与个案漂移规律并发布相关资源。

Comments 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28037 2026-07-31 cs.LG 新提交 79%

ClawTrack: Towards Trace-Level Evaluation and Improvement of Real-World Autonomous Agents

ClawTrack:面向真实世界智能体的追踪级评估与改进

Xingjian Wu, Xuhang Zhu, Xingchen Liu, Junlin Liu, Jianing Wang, Linsen Guo, Xiaoyu Li, Xuezhi Cao, Xunliang Cai

机构 * Meituan(美团)

专题命中 Agent评测 :autonomous agent(title);agent(abstract);分类 cs.LG

AI总结 本研究针对现有智能体评估仅看结果的缺口,提出双评估基准ClawTrack,含320个任务及过程评分器,评估21个模型后发现其可归因推理、验证结果验证瓶颈等,助力智能体改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27929 2026-07-31 cs.AI 新提交 79%

Meta-Task: Turning Terminal Task Synthesis into a Terminal Task for Scalable Agent Training

元任务:将终端任务综合转化为可扩展智能体训练的终端任务

Zhihong Pan, Jiyuan He, Kai Zhang, Yupeng Han, Ze Liu, Yuze Zhao, Yongcong Ye, Zhaohua Yang

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学) Meituan(美团)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 Meta-Task框架将终端任务综合转化为Terminal-Bench格式任务,通过多阶段机制等提升任务质量,生成3221条轨迹微调Qwen3系列模型,效果优于同期方法且训练数据更少。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27849 2026-07-31 eess.SY cs.LG cs.SY 新提交 79%

Safety-Gated Agentic Supervisory Control on a Coupled Distillation Benchmark: Regime Map, Auditable Gate, and Co-Design Findings

耦合精馏基准上的安全门控智能体监督控制:工况图、可审计门与协同设计发现

Christian Rosenthal

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.LG

AI总结 该研究针对耦合精馏基准,提出基于规则的分叉孪生反事实安全门控机制,结合DeepSeek-V4-Flash等模型,在目标获取、扰动抑制等任务上优于基准方法,可有效遏制有害操作。

Comments 31 pages, 8 figures. Code and data: https://github.com/cgncro-cyber/IndustrialAI. Sole author; independent research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27518 2026-07-31 cs.AI 新提交 79%

Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks

用于检测智能体基准中缺陷的自动 transcript 分析

Jeff Mohl, Nelson Gardner-Challis, Magda Dubois, Harry Coppock, Benjamin Allan-Rahill, Kaelan Yim, Damian Sójka, James Mann, Justin Olive

机构 * UK AI Security Institute(英国人工智能安全研究所) Poznan University of Technology(波兹南理工大学) Generality Labs(Generality实验室)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本研究开发AI扫描器检测智能体基准中四类有效性问题,在Inspect Evals基准测试中识别出五个常用基准的多项质量问题,为自动审计基准质量提供了概念验证。

Comments 49 pages, 19 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27353 2026-07-31 cs.CL 新提交 79%

LayerRAG-Bench: A Cross-Layer Reliability Benchmark for Agentic Retrieval-Augmented Generation

LayerRAG-Bench:面向智能体检索增强生成的跨层可靠性基准

Musa Shams

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL

AI总结 该研究推出LayerRAG-Bench跨层可靠性基准,含多领域任务与模型数据,发现模式标准化无法修复部分故障,验证了分层评估原则的重要性。

Comments 10 pages, 9 tables. Code and data: https://github.com/MusaShams/layerrag-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07853 2026-07-31 cs.CR cs.AI 版本更新 79%

FinVault: Benchmarking Financial Agent Safety in Execution-Grounded Environments

FinVault:在执行 grounded 环境中评估金融代理安全性的基准测试

Zhi Yang, Runguo Li, Qiqi Qiang, Jiashun Wang, Fangqi Lou, Mengping Li, Dongpo Cheng, Rui Xu, Heng Lian, Shuo Zhang, Xiaolong Liang, Xiaoming Huang, Zheng Wei, Zhaowei Liu, Xin Guo, Huacan Wang, Ronghao Chen, Liwen Zhang

机构 * SUFE(上海财经大学) CUHKSZ(香港中文大学) SUIBE(上海对外经贸大学) FDU(福建大学) XDU(西安电子科技大学) BUPT(北京邮电大学) Tencent(腾讯) UCAS(中国科学院大学) PKU(北京大学) QuantaAlpha(量子Alpha)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 FinVault 是首个针对金融代理的执行 grounded 安全基准测试,通过31个监管案例驱动的沙盒场景和963个测试用例,评估金融代理在现实金融环境中的安全性和防御有效性。

Comments After further review of the current submission, we have identified potential legal and intellectual property concerns associated with keeping the manuscript publicly available as a preprint. In particular, there are ongoing considerations regarding institutional affiliation information, intellectual property ownership, and related compliance matters

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26172 2026-07-31 cs.HC cs.AI cs.SI 版本更新 79%

Linking Heterogeneous Data with Coordinated Agent Flows for Social Media Analysis

通过协调智能体流关联异构数据以开展社交媒体分析

Shifu Chen, Dazhen Deng, Zhihong Xu, Sijia Xu, Linyu Qin, Tai-Quan Peng, Yingcai Wu

机构 * Zhejiang University(浙江大学) Department of Communication, Michigan State University(密歇根州立大学通讯系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本研究提出LLM智能体系统SIA,通过协调智能体流关联社交媒体异构多模态数据,采用阶段同步策略挖掘洞见,经评估可发现多样有意义的洞见,为社交媒体分析提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28186 2026-07-31 cs.CV 新提交 78%

Think with Extra-Image: A Farmland Segmentation Agent Driven by Spatio-Temporal Information Gain

借助图像外信息思考:由时空信息增益驱动的农田分割智能体

Haiyang Wu, Weiliang Mu, Zhuofei Du, Dandan Zhong, Kaijie Shi, Haifeng Li, Chao Tao

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究针对现有农田遥感图像分割范式的不足,提出动态分割智能体FarmSeeker,构建支持推理查询的全球高分辨率基准GSFS-Bench,其分割性能比现有方法更稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17751 2026-07-31 cs.IR cs.AI cs.CL 交叉投稿 76%

MagicSelector: Joint Optimization for Agent Tool Selection via Counterfactual Decomposition and Progressive Reranking

MagicSelector:通过反事实分解和渐进重排实现智能体工具选择的联合优化

HONOR Agentic Search Team, Zhengzong Chen, Lei Tang, Lijun Liu, Chuandi Jiang, Fan Yang, Keyun Chu, Chu Zhao, Shihao Liu, Minghang Li, Bo Liang, Can Wen, Hailong Wu, Jingnan Ju, Mian Liu, Nengbin Zhang, Peiqiang Wang, Penghe Nie, Qinhui Gu, Sijia Lv, Siqi Chen, Wei Zhang, Yang Xu, Yuhao Qian, Yuxiang Zhang, Zeng Cheng, Zhen Wang, Zuan Chen, Yuanyuan Zhao, Fei Huang

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

AI总结 研究智能体工具检索问题,提出MagicSelector联合优化框架,含反事实任务分解、渐进重排和动态Top-K策略,经实验验证,该框架在工具检索准确性、OOD泛化能力和整体令牌效率方面显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28317 2026-07-31 cs.AI 新提交 74%

One Human, $N$ Agents: Audit-Budget Allocation for LLM Agent Fleets under Miscalibrated, Correlated Confidence

一个人类,N个智能体:校准不当且相关置信度下LLM智能体集群的审计预算分配

Cesare Zavattari, Alessandro Tommasi, Giuseppe Prencipe

机构 * Università di Pisa(比萨大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 针对单人类需在有限审计预算下审计N个LLM智能体的问题,研究了置信度校准不当且存在相关性时的审计预算分配,发现校准阈值的变化规律,验证了部分大语言模型置信度的实用性,给出了无效监督的定量准则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27231 2026-07-31 cs.AI cs.LG 新提交 73%

KernelGenBench: A Multi-Source and Multi-Chip Benchmark for LLM-based Kernel Generation

KernelGenBench:面向基于大语言模型的内核生成的多源多芯片基准测试

Peiyu Zang, Jian Tao, Jialing Zhang, Yichen Yuan, Wentao Zhang, Guang Liu, Yonghua Lin

机构 * Beijing Normal University(北京师范大学) Beijing Jiaotong University(北京交通大学) Institute of Automation, CAS(中国科学院自动化研究所) Peking University(北京大学) BAAI(北京智源人工智能研究院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出KernelGenBench基准,评估LLM与智能体生成的Triton内核,发现智能体方法优于纯LLM采样,cuBLAS算子最具挑战,跨平台性能退化严重,自主生成成本远高于简单采样。

Comments 10 pages, 4 figures. Code and data are publicly available at https://github.com/flagos-ai/KernelGenBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08532 2026-07-31 cs.LG cs.AI 73%

LuckyMera: a Modular AI Framework for Building Hybrid NetHack Agents

Luigi Quarantiello, Simone Marzeddu, Antonio Guzzi, Vincenzo Lomonaco

机构 * Department of Computer Science, University of Pisa(比萨大学计算机科学系) Journal Production Department, IOS Press(IOS Press期刊生产部)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27895 2026-07-31 cs.AI cs.CV 新提交 70%

MMHBench: A Multi-Perspective Benchmark for Mental Health Understanding in Long-Form Videos

MMHBench:用于长视频心理健康理解的多视角基准测试集

Jinpeng Hu, Erqiang Wang, Shan Wang, Zhuo Li, Peipei Song, Xun Yang, Meng Wang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出MMHBench多视角心理健康理解基准,含268个长视频与2184条问题,采用MAQG框架生成问题,评估22个多模态大语言模型后发现该任务仍具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24101 2026-07-31 cs.CV cs.AI 版本更新 70%

LU-500: A Logo Benchmark for Concept Unlearning

LU-500:用于概念遗忘的标志基准

Keyu Li, Jin Gao, Jialing Zhang, Dequan Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究文本到图像模型中概念遗忘里公司标志未被充分研究的问题,引入LU-500基准及多粒度协议,通过实验评估多种方法,分析ProLU基线,指出未来标志遗忘或需空间感知控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27288 2026-07-31 cs.CR 新提交 67%

Open Security Benchmark: Towards Autonomous Enterprise Cyber Defense

开放安全基准:面向自主企业网络防御

Gal Engelberg, Michael Arenzon, Leon Goldberg

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 该研究针对自主企业网络防御智能体AI的环境数据缺口,提出Open Security Benchmark框架,通过冻结环境等设计实现端到端评估,还规划了框架的扩展方向。

Comments 14 pages, 3 tables. Code: https://github.com/OpenSecurityAI/osb ; datasets: https://huggingface.co/OpenSecurityAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04510 2026-07-31 cs.CE 版本更新 67%

OSCAgent: Accelerating the Discovery of Organic Solar Cells with LLM Agents

OSCAgent:利用LLM代理加速有机太阳能电池的发现

Zhaolin Hu, Zhiliang Wu, Kun Li, Hehe Fan, Yi Yang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 OSCAgent通过多代理框架整合检索增强设计、分子生成和系统评估,提升有机太阳能电池材料发现效率,实现预测性能超越传统和LLM基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28074 2026-07-31 cs.AI cs.LG 新提交 62%

Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale

Echoverse:用于大规模训练计算机使用智能体的深度演化环境

Yash Pandya, Sahil Gupta, Sarthak Harne, Archana Yadav, Kavyansh Chourasia, Hussein Mozannar, Vibhav Vineet, Sara Abdali, Corby Rosset, Yash Lara, Ahmed Awadallah, Ece Kamar, Akshay Nambi

机构 * Microsoft Research(微软研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 Echoverse是用于大规模训练计算机使用智能体的深度演化环境,其协同演化循环可提升智能体性能,经12个环境训练后9B模型准确率大幅提升,还发布了基准环境与代码

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27536 2026-07-31 cs.GT cs.AI cs.LG cs.MA 新提交 62%

Strategy, Not Payoffs: A Behavioural Embedding of Normal-Form Games

策略,而非收益:标准型博弈的行为嵌入

Joshua Caiata, Sreepriya Pulyassary, Xiang Li, Kate Larson

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出轻量双特征行为嵌入,可预测大型语言模型在不同标准型博弈间微调后的策略能力变化,证明策略能力迁移由决策行为结构而非收益几何决定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27384 2026-07-31 cs.CL cs.AI 新提交 62%

Same Facts, Different Diagnosis: Measuring and Mitigating Narrative Anchoring in Clinical Language Models

相同事实,不同诊断:临床语言模型中叙事锚定的测量与缓解

Prabhjot Singh, Pritam Deka, Vijay Chennareddy

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Queen’s University Belfast(贝尔法斯特女王大学) Middlesex University London(伦敦密德萨斯大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对临床语言模型的叙事锚定偏差,构建含1000个USMLE案例的基准,提出NarrativeShield三智能体流水线,可大幅降低叙事锚定差距并减少不稳定决策,同时发布数据集供相关研究使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12790 2026-07-31 cs.AI cs.CL cs.MA 版本更新 62%

Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents

谁来评估评估者?用于自我改进的语言模型代理的协同进化评估指标和技能

Xing Zhang, Guanghui Wang, Yanwei Cui, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * Amazon(亚马逊)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究自我进化智能体系统中评估指标缺失问题,提出指标可进化,通过“双棘轮”协同进化指标与技能循环,在多任务中保留提升效果,还阐述安全性源于锚定规则与外部审核,为无可靠自动验证器场景提供架构。

Comments Code: https://github.com/amazon-science/Self-Evolving-Agents-Double-Ratchet

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28568 2026-07-31 cs.CL 新提交 57%

Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

Frontis-MA1:训练AI4AI模型以实现机器学习工程中的递归自我改进

Junlin Yang, Che Jiang, Yu Fu, Tianwei Luo, Can Ren, Weizhi Wang, Kaikai Zhao, Hongyi Liu, Yuxin Zuo, Yuru Wang, Yuchen Fan, Kai Tian, Zhenzhao Yuan, Xiaojian Lin, Li Sheng, Rushi Qiang, Guoli Jia, Xingtai Lv, Ermo Hua, Dianqiao Lei, Youbang Sun, Ning Ding, Bowen Zhou, Kaiyan Zhang

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 该研究推出面向MLE中RSI研究的开源全栈系统OpenMLE,后训练Frontis-MA1(35B)作为元进化智能体,在多个基准测试中提升性能,相关模型与系统已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28523 2026-07-31 cs.AI cs.LO 新提交 57%

Selective Credibility-Limited Belief Update

选择性可信度受限的信念更新

Theofanis Aravanis, Costas D. Koutras

机构 * University of the Peloponnese(伯罗奔尼撒大学) American University of the Middle East(中东美国大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文针对现有可信度受限信念更新无法处理复合认知输入部分可实现的问题,提出选择性可信度受限的信念更新,刻画其语义与公理,定义两类子类,证明框架通用性,提供统一且表达力更强的信念更新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28497 2026-07-31 cs.LG cs.CY cs.GT 新提交 57%

The Role of Causality in Algorithmic Recourse

因果关系在算法追索中的作用

Srikanth Avasarala, Varun Gupta, Shahin Jabbari, Saber Salehkaleybar, Juba Ziani

机构 * Georgia Institute of Technology(佐治亚理工学院) Vector Institute(向量研究院) Drexel University(德雷塞尔大学) Leiden University(莱顿大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本研究针对算法追索仅关注翻转模型预测的缺陷,提出因果表演框架建模追索行动的因果传播,实验显示其优于标准方法并减少模型重训需求。

详情

展开后加载摘要…

URL PDF HTML 收藏