arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2246 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2246 篇

2408.01959 2024-08-29 cs.CV cs.AI cs.CL cs.CY cs.LG 67%

Dataset Scale and Societal Consistency Mediate Facial Impression Bias in Vision-Language AI

Robert Wolfe, Aayushi Dangol, Alexis Hiniker, Bill Howe

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at Artificial Intelligence, Ethics, and Society 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17174 2024-06-25 cs.CV cs.AI cs.LG 67%

Visual Explanations of Image-Text Representations via Multi-Modal Information Bottleneck Attribution

Ying Wang, Tim G. J. Rudner, Andrew Gordon Wilson

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Published in Advances in Neural Information Processing Systems 36 (NeurIPS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19538 2024-06-05 cs.CL cs.AI cs.CV cs.LG 67%

CheXpert Plus: Augmenting a Large Chest X-ray Dataset with Text Radiology Reports, Patient Demographics and Additional Image Formats

Pierre Chambon, Jean-Benoit Delbrouck, Thomas Sounack, Shih-Cheng Huang, Zhihong Chen, Maya Varma, Steven QH Truong, Chu The Chuong, Curtis P. Langlotz

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 13 pages Updated title

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19098 2024-05-30 cs.LG cs.AI cs.CR cs.CV stat.ML 67%

Efficient Black-box Adversarial Attacks via Bayesian Optimization Guided by a Function Prior

Shuyu Cheng, Yibo Miao, Yinpeng Dong, Xiao Yang, Xiao-Shan Gao, Jun Zhu

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.00170 2024-04-24 cs.LG cs.AI cs.CV stat.ML 67%

Are Bias Mitigation Techniques for Deep Learning Effective?

Robik Shrestha, Kushal Kafle, Christopher Kanan

专题命中 幻觉与鲁棒性 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Published in WACV 2022 under the title "An Investigation of Critical Issues in Bias Mitigation Techniques"

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01313 2024-03-19 cs.CV cs.AI cs.CL cs.LG 67%

PerceptionCLIP: Visual Classification by Inferring and Conditioning on Contexts

Bang An, Sicheng Zhu, Michael-Andrei Panaitescu-Liess, Chaithanya Kumar Mummadi, Furong Huang

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.13096 2024-03-12 cs.CV cs.AI cs.LG 67%

Language-Driven Anchors for Zero-Shot Adversarial Robustness

Xiao Li, Wei Zhang, Yining Liu, Zhanhao Hu, Bo Zhang, Xiaolin Hu

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14998 2024-02-07 cs.CL cs.AI cs.CV cs.LG 67%

An Examination of the Robustness of Reference-Free Image Captioning Evaluation Metrics

Saba Ahmadi, Aishwarya Agrawal

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.11751 2023-10-17 cs.CV cs.AI cs.CR cs.LG 67%

How Robust is Google's Bard to Adversarial Image Attacks?

Yinpeng Dong, Huanran Chen, Jiawei Chen, Zhengwei Fang, Xiao Yang, Yichi Zhang, Yu Tian, Hang Su, Jun Zhu

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.11205 2023-01-25 cs.LG cs.AI cs.CL cs.CV 67%

Robustness through Data Augmentation Loss Consistency

Tianjian Huang, Shaunak Halbe, Chinnadhurai Sankar, Pooyan Amini, Satwik Kottur, Alborz Geramifard, Meisam Razaviyayn, Ahmad Beirami

专题命中 幻觉与鲁棒性 :visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.03380 2021-10-11 cs.CV cs.AI cs.LG cs.SC 67%

When Causal Intervention Meets Adversarial Examples and Image Masking for Deep Neural Networks

Chao-Han Huck Yang, Yi-Chieh Liu, Pin-Yu Chen, Xiaoli Ma, Yi-Chang James Tsai

专题命中 幻觉与鲁棒性 :visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Noted our camera-ready version has changed the title. "When Causal Intervention Meets Adversarial Examples and Image Masking for Deep Neural Networks" as the v3 official paper title in IEEE Proceeding. Please use it in your formal reference. Accepted at IEEE ICIP 2019. Pytorch code has released on https://github.com/jjaacckkyy63/Causal-Intervention-AE-wAdvImg

Journal ref 2019 26th IEEE International Conference on Image Processing (ICIP). IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10513 2026-08-12 cs.CV cs.AI 新提交 66%

SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning

SafeCap:通过图像字幕强化学习提升大型视觉语言模型(LVLM)的安全性

Caoyuan Ma, Wenpu Liu, Weichu Xie, Tian Gu, Shilei Zhao, Lingxi Min, Shuai Dong, Yuqi Xu, Ji Zhao, Ziyue Wang, Wenzheng Chang, Taiqiang Wu, Yongfu Zhu, Wenqi Shao, Yinqiang Zheng

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI;VLM(comments)

AI总结 SafeCap是一种通过图像字幕强化学习提升LVLM安全性的框架,在多模态安全基准上安全得分提升3.7-19.0个百分点,且视觉效用相当或更优,性能优于安全SFT等方法。

Comments 16pages, 4 figures. Preprint. Project page: https://safe-vlm.github.io/SafeCap/ ; code: https://github.com/Safe-VLM/SafeCap

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29699 2026-08-14 cs.CV cs.AI cs.RO 版本更新 62%

Early Warning Signals for OpenVLA Failure under Visual Distribution Shift

视觉分布偏移下OpenVLA故障的早期预警信号

Dipesh Tharu Mahato, Rachel Ren

机构 * New York University(纽约大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究在视觉分布偏移下,OpenVLA内部激活是否包含可线性解码的近期任务失败信息,通过LIBERO操作实验发现第16层逻辑探针在遮挡条件下预测失败AUROC达0.972。

Comments 16 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12086 2026-08-13 cs.CV cs.LG 新提交 62%

Look What the Probes Dragged In! Real-World Chest X-ray Shortcuts in MedCLIP

看看探针发现了什么!MedCLIP中的真实世界胸部X光捷径

Nikolette Pedersen, Regitze Sydendal, Veronika Cheplygina, Théo Sourget

机构 * Pattern Recognition Revisited Lab (PURRlab)(模式识别重访实验室(PURRlab)) IT University of Copenhagen(哥本哈根信息技术大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 该研究探究MedCLIP模型中不同层的真实世界胸部X光捷径,发现局部捷径出现在较后层、弥散捷径出现在较早层,且两个数据集存在数据质量问题,凸显高质量数据集的必要性。

Comments 11 pages, 3 figure, poster presentation at the joint FAIMI, BRIDGE, and EPIMI workshop at MICCAI 2026 (Strasbourg, France) conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10522 2026-08-12 cs.CV cs.AI 新提交 62%

Unlocking the Power of Medical Tabular Data via Semantic-Aware Multimodal Pre-training

通过语义感知多模态预训练释放医疗表格数据的力量

Yingsheng Liu, Haiming Li, Jingmin Zhu, Jiajun Sun, Victoria Mar, Monika Janda, H. Peter Soyer, Zongyuan Ge, Zhen Yu

机构 * Faculty of Information Technology, Monash University(莫纳什大学信息技术学院) Monash University(莫纳什大学) The University of Queensland(昆士兰大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对医疗表格数据的语义利用不足问题,提出语义感知多模态预训练框架,含重要性感知自适应掩码与软标签离散化模块,在皮肤病学、眼科数据集上实现SOTA,鲁棒性与跨域泛化能力优异。

Comments INTERNATIONAL CONFERENCE ON MEDICAL IMAGE COMPUTING AND COMPUTER ASSISTED INTERVENTION (ORAL presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10289 2026-08-12 cs.CV cs.LG 新提交 62%

SeFaR: Semantic Feature-aware Robustness Testing of Deep Neural Networks

SeFaR:面向深度神经网络的语义特征感知鲁棒性测试

Nusrat Jahan Mozumder, Divya Gopinath, Corina Pasareanu, Matthew Dwyer

机构 * University of Virginia(弗吉尼亚大学) KBR Inc.(KBR公司) NASA Ames(美国国家航空航天局艾姆斯研究中心) Carnegie Mellon University(卡内基梅隆大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 SeFaR是一个以语义特征为核心的视觉模型鲁棒性测试框架,可在保留需求满足性的前提下,生成测试输入以识别影响模型决策的特征,进而发现故障并关联相关特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17173 2026-08-12 cs.CL cs.AI cs.LG 版本更新 62%

Why Do Safety Guardrails Degrade Across Languages?

为何安全护栏在不同语言中会退化?

Max Zhang, Ameen Patel, Sang T. Truong, Sanmi Koyejo

机构 * Stanford University(斯坦福大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 该研究通过引入多组项目反应理论框架,揭示了语言无关的安全鲁棒性、提示内在难度、全球语言处理难度和提示特定的跨语言安全差距等因素,发现安全退化并非仅在低资源语言中发生,且文化与概念不匹配也会影响安全性能。

Comments Poster at Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15770 2026-08-12 cs.CV cs.LG 版本更新 62%

Concept Labels Are Not Enough: Rethinking Concept Bottleneck Models through Representation Integrity

通过解耦概念瓶颈缓解多媒体识别中的虚假背景偏差

Gaoxiang Huang, Songning Lai, Yutao Yue

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出轻量解耦概念瓶颈模型LDCBM,通过滤波分组损失和联合概念监督提升视觉模式与概念的对齐,实验证明其在概念和分类准确率上优于现有CBMs,且计算复杂度更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07302 2026-08-10 cs.CV cs.AI 新提交 62%

Same Attention, Different Truths: Put Logit-Lens over Visual Attention to Detect and Mitigate LVLM Object Hallucination

相同注意力,不同真相:在视觉注意力上应用Logit-Lens检测并缓解LVLM的物体幻觉

Zichuan Wang, Songlin Yang, Bo Peng, Zhenchen Tang, Yang Li, Beibei Dong, Jing Dong

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) Hong Kong University of Science and Technology(香港科技大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对LVLM的物体幻觉问题,通过Logit Lens分析视觉注意力,揭示两种幻觉机制,提出无需训练的Detect-Mitigate框架,在多个基准上实现最优结果。

Comments CVPR2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15782 2026-08-04 cs.AI cs.CV 版本更新 62%

Mitigating Visual Hallucinations in Multimodal Systems through Retrieval-Augmented Reliability-Aware Inference

通过检索增强的可靠性感知推理缓解多模态系统中的视觉幻觉

Pratheswaran Hariharan, Haiping Xu, Donghui Yan

机构 * University of Massachusetts, Dartmouth(马萨诸塞大学达特茅斯分校)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出一种检索增强的可靠性感知推理框架,利用外部视觉证据库和多个可靠性指标进行决策门控,在不重训练模型的情况下减少视觉幻觉,将接受预测准确率从85.84%提升至88.88%。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05131 2026-08-03 cs.CV cs.AI cs.RO 版本更新 62%

AREA3D: Active Reconstruction Agent with Unified Feed-Forward 3D Perception and Vision-Language Guidance

AREA3D: 带有统一前馈3D感知和视觉-语言引导的主动重建代理

Tianling Xu, Shengzhe Gan, Leslie Gu, Yuelei Li, Fangneng Zhan, Hanspeter Pfister

机构 * Southern University of Science and Technology(南方科技大学) Harvard University(哈佛大学) California Institute of Technology(加州理工学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 AREA3D通过统一前馈3D感知与视觉-语言引导,实现高效主动3D重建,尤其在稀疏视角下提升重建精度。

Journal ref Tianling Xu, Shengzhe Gan, Leslie Gu, Yuelei Li, Fangneng Zhan, Hanspeter Pfister. The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19674 2026-07-23 cs.CR cs.AI cs.LG 新提交 62%

FedLSG: LLM-Enhanced Semantic Calibration for Federated Graph Backdoor Defense

FedLSG:用于联邦图后门防御的大语言模型增强语义校准

Chenyu Zhou, Yabin Peng, Wei Huang, Kunlin Li, Shuaishuai Zhang, Xinyuan Miao

机构 * Southeast University(东南大学) Purple Mountain Laboratories(紫金山实验室) Institute of AI for Industries(人工智能产业研究院) Chinese Academy of Sciences(中国科学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 针对联邦图神经网络易受后门攻击问题,提出FedLSG框架,将大语言模型集成防御,通过图与行为到文本的转换及轻量级师生架构,在不损图完整性时显著提升对后门攻击的抵抗力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14631 2026-07-17 cs.CV cs.AI 新提交 62%

Knowing You at First Glance: Inferring Apparent Personality from Faces

一眼识你:从面部推断表面人格

Shuhuan Chen, Xiangyu Zhu, Weisong Zhao, Haichao Shi, Xiao-Yu Zhang, Zhen Lei

机构 * Institute of Automation, CAS(中国科学院自动化研究所) Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, UCAS(中国科学院大学网络空间安全学院) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science & Innovation, CAS(中国科学院香港创新研究院人工智能与机器人中心) School of Computer Science and Engineering, the Faculty of Innovation Engineering, M.U.S.T(澳门科技大学创新工程学院计算机科学与工程系)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究从面部图像推断表面人格,提出GlanceFace框架,利用视觉语言模型、语义增强模块及不确定性感知学习策略,在基于MBTI的基准测试中表现出色,揭示面部特征与人格特质关系,助力具身智能体交互策略。

Comments Accepted by The 9th Chinese Conference on Pattern Recognition and Computer Vision, PRCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13048 2026-07-16 cs.LG cs.AI stat.ML 新提交 62%

Uncertainty-Aware Sequential Decision Rules for Event-Triggered LLM Invocation in Streaming Systems

流系统中事件触发大语言模型调用的不确定性感知序贯决策规则

Zhaohui Wang

机构 * Viterbi School of Engineering, University of Southern California(南加州大学维特比工程学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究流系统中何时调用大语言模型的问题,将其转化为基于风险的序贯停止问题,证明了相关理论结果。通过在涡轮风扇退化数据上的实验,验证假设、比较基线,得出次线性遗憾、高诊断质量等结论,表明异常分数驱动的风险函数更优。

Comments 18 pages, 5 figures. Accepted to the ECML PKDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10358 2026-07-14 cs.CV cs.AI 新提交 62%

Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift

在域转移下对用于乳腺钼靶成像的基础模型的稳健性进行基准测试

Giang Nguyen, Raghav Mehta, Emma A. M. Stanley, Tian Xia, Thi Hao Nguyen, Hieu Pham, Ben Glocker

机构 * College of Engineering and Computer Science, VinUniversity(工程与计算机科学学院,文大大学) Imperial College London(伦敦帝国理工学院) Radiology Department, Vietnam National Cancer Hospital(越南国家癌症医院放射科) VinUni-Illinois Smart Health Center, VinUniversity(文大大学 - 伊利诺伊智能健康中心,文大大学) The Computer Vision and Medical AI Lab, VinUniversity(计算机视觉与医学人工智能实验室,文大大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究在域转移下乳腺钼靶成像基础模型的稳健性,用统一协议在多数据集上训练评估15种模型主干,发现特定视觉语言模型性能强,DINOv3是有竞争力基线,适应预训练未持续提升泛化,强调数据集级OOD评估是核心标准。

Comments Under Review. Giang Nguyen and Raghav Mehta contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08884 2026-07-14 cs.CV cs.CL cs.LG 版本更新 62%

SpurLens: Automatic Detection of Spurious Cues in Multimodal LLMs

SpurLens:多模态大语言模型中虚假线索的自动检测

Parsa Hosseini, Sumit Nawathe, Mazda Moayeri, Sriram Balasubramanian, Soheil Feizi

机构 * Department of Computer Science University of Maryland(计算机科学系大学马里兰大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 研究多模态大语言模型中虚假偏差,介绍SpurLens管道,利用GPT-4和开放集目标检测器自动识别虚假视觉线索,揭示虚假关联导致的两种失败模式,验证发现并探索缓解策略,呼吁提高评估方法和策略以增强MLLMs可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16515 2026-07-13 cs.CV cs.CR cs.LG 62%

Penny Wise, Pixel Foolish: Bypassing Price Constraints in Multimodal Agents via Visual Adversarial Perturbations

精打细算,却愚弄像素:通过视觉对抗扰动在多模态智能体中绕过价格限制

Jiachen Qian, Zhaolu Kang

机构 * City University of Hong Kong(香港城市大学) Peking University(北京大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 研究发现多模态大语言模型在价格受限环境下易受视觉误导,提出PriceBlind攻击框架,通过语义解耦损失提升图像嵌入精度,实现80%的攻击成功率,并展示鲁棒编码和防御机制对攻击的抑制效果。

Comments 15 pages, 4 figures, 13 tables

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 16059-16073, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06495 2026-07-08 cs.CL cs.AI cs.LG stat.AP 新提交 62%

Pitwall: Faithful Natural-Language Race-Strategy Briefings from a Calibrated Real-Time Monte Carlo Engine

Pitwall:来自校准实时蒙特卡罗引擎的可靠自然语言赛车策略简报

Juan S. Santillana

机构 * Independent Researcher(独立研究者)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究针对体育赛事直播评论生成问题,提出Pitwall系统,将忠实性作为架构属性,通过概率性比赛状态验证声明,控制微调数据,使用校准的蒙特卡罗引擎,实现端到端操作,确保生成的自然语言赛车策略简报可靠。

Comments 21 pages, 2 figures, 6 tables. Live-deployment results from the 2026 Austrian and British Grands Prix. URL: https://pitwall.jsantillana.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03831 2026-07-07 cs.CV cs.AI 新提交 62%

How Do Diffusion Classifiers Decide? A Bias-Centric Evaluation

扩散分类器如何做出决策?以偏差为中心的评估

Saba Fathi, Fardin Ayar, Maryam Abdolali, Ehsan Javanmardi, Manabu Tsukada, Mahdi Javanmardi

机构 * K. N. Toosi University of Technology(伊朗科技大学) Amirkabir University of Technology(伊朗阿米尔卡比尔理工大学) The University of Tokyo(东京大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究扩散分类器如何决策,通过ASOB-Bench从属性绑定、大小顺序偏差和背景依赖三维度评估,发现其偏差特征与视觉语言模型不同,为构建更稳健模型提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31478 2026-07-01 cs.AI cs.CV 新提交 62%

One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution

一次反思不够:通过多假设失败归因进行自我修正的自主研究

Jie Ma, Binfei Chu, Jie Gao, Jinlu Zhang, Yiwei Ma, Yi Tan, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Xiamen University(厦门大学) Hello Inc.(Hello公司) Xiaohongshu Inc.(小红书公司)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出SAGE框架,通过多假设失败归因(MHFA)机制将实验失败恢复转化为结构化因果诊断,显著提升自主研究代理的可靠性和产出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏