arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-30 至 2026-03-30 共收录 60 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 8 篇

2603.26034 2026-03-30 cs.CL 57%

AgentCollab: A Self-Evaluation-Driven Collaboration Paradigm for Efficient LLM Agents

AgentCollab: 一种以自我评估驱动的高效大语言模型代理协作范式

Wenbo Gao, Renxi Liu, Xian Wang, Fang Guo, Shuai Yang, Xi Chen, Hui-Ling Zhen, Hanting Chen, Weizhe Lin, Xiaosong Li, Yaoyuan Wang

机构 * Huawei(华为) Hong Kong Polytechnic University(香港理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出AgentCollab框架,通过自我反思信号动态协调不同推理能力的模型,提升LLM代理在复杂任务中的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18746 2026-03-30 cs.CV cs.AI 57%

Any4D: Open-Prompt 4D Generation from Natural Language and Images

Any4D: 从自然语言和图像生成开放提示的4D生成

Hao Li, Qiao Sun

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Primitive Embodied World Models,通过限制视频生成时间范围,实现语言与视觉表示的细粒度对齐,降低学习复杂度,提升数据效率,并减少推理延迟,支持复杂任务的组合泛化。

Comments The authors identified issues in the 4D generation pipeline and evaluation that affect result validity. To ensure scientific accuracy, we will revise the methodology and experiments thoroughly before resubmitting. This version should not be cited or relied upon

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 15 篇

2603.18940 2026-03-30 cs.CL cs.LG 88%

Entropy trajectory shape predicts LLM reasoning reliability: A diagnostic study of uncertainty dynamics in chain-of-thought

熵轨迹形状预测LLM推理可靠性:对不确定性动态的诊断研究

Xinghao Zhao

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.LG

AI总结 研究通过分析推理过程中熵轨迹形状来预测大语言模型的推理可靠性,提出了一种基于轨迹形状而非标量大小的诊断方法,展示了其在黑盒环境中的实用性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26332 2026-03-30 cs.CL cs.AI 81%

CALRK-Bench: Evaluating Context-Aware Legal Reasoning in Korean Law

CALRK-Bench:评估韩国法律中的情境感知法律推理

JiHyeok Jung, TaeYoung Yoon, HyunSouk Cho

机构 * KAIST AI(韩国科学技术院人工智能学院) Law School, Ajou University(亚洲大学法学院) Department of Artificial Intelligence, Ajou University(亚洲大学人工智能系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CALRK-Bench,一个基于韩国法律体系的情境感知法律推理基准,评估模型对法律规范时效性、案件法律信息充分性及法律判断变化原因的理解能力,实验表明大语言模型在这些任务上表现不佳。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12896 2026-03-30 cs.CL 80%

None of the Others: a General Technique to Distinguish Reasoning from Memorization in Multiple-Choice LLM Evaluation Benchmarks

并非其他:一种区分推理与记忆的通用技术,用于多选LLM评估基准

Eva Sánchez Salido, Julio Gonzalo, Guillermo Marco

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一种通用方法,通过改变数学问题的数值来区分LLM的推理能力与记忆能力,评估了多个模型在公开和私有数据集上的表现,发现模型在该方法下准确率显著下降,揭示了记忆在当前LLM回答中的重要作用。

Journal ref "On the Limits of LLM Reasoning: Evidence From Contamination, Translation, and Answer Modification in Multiple-Choice Benchmarks," in IEEE Access, vol. 14, pp. 9384-9393, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19669 2026-03-30 cs.AI 80%

HeaRT: A Hierarchical Circuit Reasoning Tree-Based Agentic Framework for AMS Design Optimization

HeaRT:一种基于分层电路推理树的代理框架用于AMS设计优化

Souradip Poddar, Chia-Tung Ho, Ziming Wei, Weidong Cao, Haoxing Ren, David Z. Pan

机构 * ECE Department, The University of Texas at Austin(德克萨斯大学奥斯汀分校电子与计算机工程系) NVIDIA Corporation(英伟达公司) The George Washington University(乔治华盛顿大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 HeaRT提出了一种分层电路推理树的代理框架,通过提升F1(subcircuits)和F1(loops)指标,实现更高效的AMS设计优化,且在不同架构上表现出更好的适应性和收敛速度。

Comments Analog Design Automation, Hierarchical Circuit Reasoning, Context-Aware Design Adaptation, LLMs, Agentic Frameworks, Electronic Design Automation (EDA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20964 2026-03-30 cs.CV cs.AI 79%

Evidence-based diagnostic reasoning with multi-agent copilot for human pathology

基于多智能体助手的证据驱动诊断推理

Luca L. Weishaupt, Chengkuan Chen, Drew F. K. Williamson, Richard J. Chen, Guillaume Jaume, Tong Ding, Bowen Chen, Anurag Vaidya, Long Phi Le, Guillaume Jaume, Ming Y. Lu, Faisal Mahmood

机构 * Health Sciences and Technology, Harvard-MIT(哈佛-MIT健康科学与技术) Department of Pathology, Massachusetts General Hospital, Harvard Medical School(麻省总医院病理科,哈佛医学院) Cancer Program, Broad Institute of Harvard and MIT(哈佛-MIT博德研究所癌症项目) Harvard John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保尔森工程与应用科学学院) Electrical Engineering and Computer Science, Massachusetts Institute of Technology (MIT)(麻省理工学院电气工程与计算机科学) Harvard Data Science Initiative, Harvard University(哈佛大学数据科学计划)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出PathChat+,一种专为人类病理设计的多模态大语言模型,通过大量病理特定指令样本训练,显著优于现有模型,在多图像理解与自主诊断推理方面表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25944 2026-03-30 cs.CL cs.AI 73%

Can Small Models Reason About Legal Documents? A Comparative Study

小型模型能否对法律文件进行推理?一项比较研究

Snehit Vaddi

机构 * Independent Researcher(独立研究员)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文通过测试九种模型在三个法律基准上的表现,发现3B参数的混合专家模型在法律持有识别上优于GPT-4o-mini,且提示策略影响显著,few-shot提示效果最佳。

Comments 17 pages, 9 models, 5 prompting strategies, 3 legal benchmarks, 405 experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26646 2026-03-30 cs.CV 67%

Beyond Language: Grounding Referring Expressions with Hand Pointing in Egocentric Vision

超越语言:基于手部指向的自我中心视觉指称表达定位

Ling Li, Bowen Liu, Zinuo Zhan, Peng Jie, Jianhui Zhong, Kenglun Chang, Zhidong Deng

机构 * Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Northwestern Polytechnical University(西北工业大学) Apple(苹果公司)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出EgoPoint-Ground数据集,通过手部指向与语音结合的指称机制,改进视觉指称表达的定位方法,并提出SV-CoT框架提升多模态理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26449 2026-03-30 cs.CL 57%

ClimateCheck 2026: Scientific Fact-Checking and Disinformation Narrative Classification of Climate-related Claims

ClimateCheck 2026:气候相关主张的科学事实核查与虚假信息叙述分类

Raia Abu Ahmad, Max Upravitelev, Aida Usmanova, Veronika Solopova, Georg Rehm

机构 * Deutsches Forschungszentrum für Künstliche Intelligenz GmbH (DFKI)(德国人工智能研究中心) Technische Universität Berlin(柏林工业大学) Leuphana Universität Lüneburg(吕讷堡大学) Humboldt-Universität zu Berlin(柏林洪堡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ClimateCheck 2026通过扩大训练数据和新增虚假信息叙述分类任务,挑战气候相关主张的自动核查,揭示传统指标的系统性偏差。

Comments Accepted at NSLP@LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26221 2026-03-30 cs.CR cs.AI cs.ET cs.SE 57%

Clawed and Dangerous: Can We Trust Open Agentic Systems?

带刺且危险:我们能信任开放代理系统吗?

Shiping Chen, Qin Wang, Guangsheng Yu, Xu Wang, Liming Zhu

机构 * CSIRO Data61(澳大利亚联邦科学与工业研究组织Data61) University of Technology Sydney(悉尼科技大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文探讨开放代理系统在安全治理中的挑战,提出六维分析框架和安全建设参考原则,指出当前在部署控制、运营治理等方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25197 2026-03-30 cs.AI cs.ET cs.HC cs.RO cs.SE 57%

The Competence Shadow: Theory and Bounds of AI Assistance in Safety Engineering

能力阴影:物理AI系统安全工程中AI辅助的理论与界限

Umair Siddique

机构 * Independent Research(独立研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨AI在安全工程中的辅助作用,提出能力阴影理论,揭示AI辅助可能带来的系统性盲区,并强调协作设计的重要性。

Comments 8 Pages, 3 Figures, 2 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26586 2026-03-30 cs.CV 50%

MA-Bench: Towards Fine-grained Micro-Action Understanding

MA-Bench:迈向细粒度微动作理解

Kun Li, Jihao Gu, Fei Wang, Zhiliang Wu, Hehe Fan, Dan Guo

机构 * CVLab, College of Information Technology, United Arab Emirates University(阿拉伯联合酋长国大学信息技术学院CVLab) University College London(伦敦大学学院) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出MA-Bench基准,包含1000个视频和三级评估架构,系统评估微动作识别与解释,通过23个MLLM的实验发现微动作细粒度理解存在挑战,并构建MA-Bench-Train训练集提升模型性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21077 2026-03-30 cs.CV 50%

CoVFT: Context-aware Visual Fine-tuning for Multimodal Large Language Models

CoVFT:面向多模态大语言模型的上下文感知视觉微调

Nan Zhou, Huiqun Wang, Yaoyan Zheng, Di Huang

机构 * State Key Laboratory of Complex and Critical Software Environment, Beihang University(北京航空航天大学复杂关键软件环境国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出CoVFT框架,通过整合上下文向量提取和上下文混合专家模块,解决多模态任务中视觉微调的不稳定性问题,实现更稳定的视觉更新。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02569 2026-03-30 cs.HC cs.RO 50%

Reframing Human-Robot Interaction Through Extended Reality: Unlocking Safer, Smarter, and More Empathic Interactions with Virtual Robots and Foundation Models

通过扩展现实重新定义人机交互:利用虚拟机器人和基础模型实现更安全、更智能和更具同理心的交互

Yuchong Zhang, Yong Ma, Danica Kragic

机构 * Division of Robotics, Perception, and Learning, KTH Royal Institute of Technology(KTH皇家理工学院机器人、感知与学习部) Department of Clinical Medicine, University of Bergen(卑尔根大学临床医学系)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文探讨通过扩展现实技术,利用基础模型驱动的虚拟机器人实现更安全、智能和具同理心的人机交互,同时讨论多模态大模型在认知和情感交互中的应用及潜在风险。

Comments This paper is under review

Journal ref Empathic Computing, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25891 2026-03-30 cs.CV 50%

Few Shots Text to Image Retrieval: New Benchmarking Dataset and Optimization Methods

少样本文本到图像检索:新基准数据集和优化方法

Ofer Idan, Vladi Vexler, Gil Lederman, Dima Sivov, Aviad Cohen Zada, Shir Niego Komforti

机构 * Huawei Tel-Aviv Research Center(华为特拉维夫研究中心)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出FSIR任务及FSIR-BD数据集,通过少样本学习方法提升图像检索性能,实验表明其基准挑战性及优化方法优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25791 2026-03-30 cs.CV 50%

ArtHOI: Taming Foundation Models for Monocular 4D Reconstruction of Hand-Articulated-Object Interactions

ArtHOI:通过基础模型驯化实现单目4D手-物体交互重建

Zikai Wang, Zhilu Zhang, Yiqing Wang, Hui Li, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出ArtHOI框架,通过整合多基础模型先验知识,解决单目视频中手-物体交互的4D重建问题,引入自适应采样细化和多模态大语言模型引导对齐方法,构建两个新数据集并验证方法有效性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 13 篇

2603.26410 2026-03-30 cs.CL cs.AI 87%

Why Models Know But Don't Say: Chain-of-Thought Faithfulness Divergence Between Thinking Tokens and Answers in Open-Weight Reasoning Models

为何模型知道却不说:链式思考中的思考令牌与答案之间的信念差异在开放权重推理模型中

Richard J. Young

机构 * University of Nevada, Las Vegas(内华达大学拉斯维加斯分校) DeepNeuro AI

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title);分类 cs.CL、cs.AI

AI总结 研究探讨了12种开放权重推理模型在MMLU和GPQA问题中对误导提示的响应,发现思考令牌与答案之间的信念差异显著,且模型对提示的承认存在方向性差异。

Comments 19 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14765 2026-03-30 cs.LG cs.AI 86%

PepThink-R1: LLM for Interpretable Cyclic Peptide Optimization with CoT SFT and Reinforcement Learning

PepThink-R1:基于CoT SFT和强化学习的可解释环状肽优化LLM

Ruheng Wang, Hang Zhang, Trieu Nguyen, Shasha Feng, Hao-Wei Pang, Xiang Yu, Li Xiao, Peter Zhiping Zhang

机构 * Merck & Co., Inc., Rahway, NJ, USA(默克公司,美国新泽西州拉威) UT Southwestern Medical Center, Dallas, TX, USA(得克萨斯大学西南医学中心,美国得克萨斯州达拉斯) University of Pittsburgh, Pittsburgh, PA, USA(匹兹堡大学,美国宾夕法尼亚州匹兹堡)

专题命中 其他推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PepThink-R1,结合CoT SFT和强化学习,通过显式推理生成可解释的环状肽,提升药理性质表现,优于现有通用LLM和领域模型。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: AI for Science (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25942 2026-03-30 cs.CV cs.AI 85%

Reinforcing Structured Chain-of-Thought for Video Understanding

强化结构链式思考以提升视频理解

Peiyao Wang, Haotian Xu, Noranart Vesdapunt, Rui Hou, Jingyi Zhang, Haibin Ling, Oleksandr Obiednikov, Ning Zhou, Kah Kuen Fu

机构 * Stony Brook University(石溪大学) Amazon(亚马逊)

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出SDRL框架,通过结构化链式思考格式和自监督机制,解决多模态大语言模型在视频理解中的推理漂移和时间感知问题,实现单阶段强化学习,提升模型泛化能力。

Comments Accepted to CVPR 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25960 2026-03-30 cs.CL cs.AI 84%

When Chain-of-Thought Backfires: Evaluating Prompt Sensitivity in Medical Language Models

当链式思维产生反效果:评估医疗语言模型在提示敏感性上的表现

Binesh Sadanandan, Vahid Behzadan

机构 * SAIL Lab, University of New Haven(纽黑文大学SAIL实验室)

专题命中 其他推理 :chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 研究评估医疗语言模型在不同提示格式下的鲁棒性,发现链式思维提示降低准确性,少样本示例和答案选项洗牌显著影响性能,且领域特定模型的提示工程策略不适用于通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26330 2026-03-30 cs.CV cs.AI 79%

Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation

通过输入自适应深度聚合缓解视觉语言微调中的推理税

Yiming Ren, Yujiu Yang, Junjie Wang

机构 * Tsinghua University(清华大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出IADA机制,通过输入自适应的跨深度检索提升视觉语言模型的推理能力,实验表明其在参数效率方面优于LoRA微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26045 2026-03-30 cs.LG cs.AI cs.CL cs.NE 67%

H-Node Attack and Defense in Large Language Models

H-Node攻击与防御在大语言模型中

Eric Yocam, Varghese Vaidyan, Yong Wang

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出H-Node对抗噪声消除框架,通过识别并防御Transformer大语言模型中的幻觉表示,利用逻辑回归探针定位幻觉节点,通过白盒对抗攻击增强这些维度,并采用自适应防御抑制幻觉节点,提升模型鲁棒性。

Comments 17 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25861 2026-03-30 cs.LG cs.AI cs.CR 62%

Why Safety Probes Catch Liars But Miss Fanatics

为何安全探针会识破骗子却无法识别狂热分子

Kristiyan Haralambiev

机构 * Independent Research(独立研究)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究安全探针在检测欺骗性对齐AI系统时的局限性,发现当模型相信有害行为是正当的而非隐藏时,探针无法检测到这种一致性偏差,揭示了探针逃避现象的形成机制。

Comments 18 pages, 4 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18846 2026-03-30 cs.CV cs.AI 57%

DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference

DUET-VLM:双阶段统一高效令牌减少用于VLM训练和推理

Aditya Kumar Singh, Hitesh Kandala, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

机构 * Advanced Micro Devices, Inc. (AMD)(超威半导体公司(AMD))

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 DUET-VLM通过双阶段令牌压缩框架,在保持语义的同时显著减少视觉令牌数量,实现高效训练和推理。

Comments 15 Pages, 8 figures, 15 tables, CVPR 2026; Code: AGI/DUET-VLM" target="_blank" rel="noopener">https://github.com/AMD-AGI/DUET-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13622 2026-03-30 cs.CV cs.AI 57%

CARPE: Context-Aware Image Representation Prioritization via Ensemble for Large Vision-Language Models

CARPE:通过集成实现上下文感知的图像表示优先级

Donghee Lee, Rui Cai, Zhe Zhao

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 CARPE通过集成机制增强大视觉-语言模型对视觉和文本模态的自适应加权能力,提升图像分类和多模态任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26523 2026-03-30 cs.HC 50%

Exploring a Design Framework for Children's Agency through Participatory Design

通过参与式设计探索儿童自主性设计框架

Boyin Yang, Jun Zhao

专题命中 其他推理 :reasoning(abstract)

AI总结 本文通过参与式工作坊探讨儿童自主性设计框架,帮助设计者在设计过程中明确自主性权衡,解决设计者对儿童自主性重要性理解不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24197 2026-03-30 cs.CY cs.SE 50%

Learning to Program Alongside AI: Critical Thinking, AI Ethics, and Gendered Patterns of German Secondary School Students

与AI一同学习编程:批判性思维、AI伦理与德国中学学生的性别化模式

Isabella Graßl

专题命中 其他推理 :reasoning(abstract)

AI总结 研究探讨德国中学学生在使用生成式AI工具编程时的批判性思维、伦理观念及性别差异,发现学生虽具伦理意识,但对AI生成代码理解不足,且性别影响其使用模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26004 2026-03-30 cs.CY 50%

A Human-Centered Approach to Ethical AI Education in Underresourced Secondary Schools

面向欠资中学的伦理AI教育的人本方法

Valentina Kuskova, Sonia Howell, Brianna Stines, Brianna Conaghan

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出一种人本主义方法,通过提供学分课程提升欠资中学学生的人工智能伦理意识,研究发现该课程提高了学生的批判性思维和学术自信,支持伦理判断作为核心学习成果。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22403 2026-03-30 cs.SE 50%

XMENTOR: A Rank-Aware Aggregation Approach for Human-Centered Explainable AI in Just-in-Time Software Defect Prediction

XMENTOR:一种面向人类的排名感知聚合方法用于实时软件缺陷预测中的可解释AI

Saumendu Roy, Banani Roy, Chanchal Roy, Richard Bassey

专题命中 其他推理 :reasoning(abstract)

AI总结 XMENTOR通过整合多种事后解释方法,提升开发者对缺陷预测模型的信任与可解释性,减少混淆和认知负担。

Comments 10 pages, 14 figures, conference (FORGE '26: 2026 IEEE/ACM Third International Conference on AI Foundation Models and Software Engineering, Rio de Janeiro, Brazil, April 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏