arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-07 至 2026-04-07 共收录 396 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 35 篇

2604.03635 2026-04-07 cs.CV cs.AI 79%

A Generative Foundation Model for Multimodal Histopathology

多模态病理生成模型基础框架

Jinxi Xiang, Mingjie Li, Siyu Hou, Yijiang Chen, Xiangde Luo, Yuanfeng Ji, Xiang Zhou, Ehsan Adeli, Akshay Chaudhari, Curtis P. Langlotz, Kilian M. Pohl, Ruijiang Li

机构 * Department of Radiation Oncology, Stanford University School of Medicine(斯坦福大学医学院放射肿瘤学系) Department of Psychiatry and Behavioral Sciences, Stanford University School of Medicine(斯坦福大学医学院精神病学与行为科学系) Department of Statistics and Data Science, Yale University(耶鲁大学统计与数据科学系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系) Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Department of Radiology, Stanford University(斯坦福大学放射学系) Center for Artificial Intelligence in Medicine and Imaging, Stanford University(斯坦福大学医学与影像人工智能中心)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出MuPD模型,通过扩散变压器整合病理图像、分子数据和临床文本,实现跨模态生成任务,提升诊断准确性和数据扩展性。

Comments 33 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03630 2026-04-07 cs.AI q-bio.QM 79%

A Multimodal Foundation Model of Spatial Transcriptomics and Histology for Biological Discovery and Clinical Prediction

一种结合空间转录组学和组织学的多模态基础模型用于生物发现和临床预测

Jinxi Xiang, Siyu Hou, Yuchen Li, Ryan Quinton, Xiaoming Zhang, Feyisope Eweje, Xiangde Luo, Yijiang Chen, Zhe Li, Colin Bergstrom, Ted Kim, Sierra Willens, Francesca Maria Olguin, Matthew Abikenari, Andrew Heider, Sanjeeth Rajaram, Joel Neal, Maximilian Diehn, Xiang Zhou, Ruijiang Li

机构 * Department of Radiation Oncology, Stanford University School of Medicine(斯坦福大学医学院放射肿瘤学系) Department of Statistics and Data Science, Yale University(耶鲁大学统计与数据科学系) Department of Medicine (Oncology), Stanford University School of Medicine(斯坦福大学医学院医学系(肿瘤学)) Department of Pathology, Stanford University School of Medicine(斯坦福大学医学院病理学系) Department of Neurosurgery, Stanford University School of Medicine(斯坦福大学医学院神经外科学系) Stanford Institute for Human-Centered Artificial Intelligence(斯坦福大学以人为本人工智能研究所) Perelman School of Medicine at the University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出STORM模型,整合形态学特征、基因表达和空间上下文,提升空间领域发现并预测肿瘤类型基因表达,提高免疫治疗响应预测和预后诊断。

Comments 29 pages, 5 figures. This manuscript is a work in progress; further updates and revisions will be posted as they become available

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21605 2026-04-07 cs.LG cs.AI cs.CR 79%

SoSBench: Benchmarking Safety Alignment on Six Scientific Domains

SoSBench:在六个科学领域中对安全对齐进行基准测试

Fengqing Jiang, Fengbo Ma, Zhangchen Xu, Yuetai Li, Zixin Rao, Bhaskar Ramasubramanian, Luyao Niu, Bo Li, Xianyan Chen, Zhen Xiang, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of Georgia(佐治亚大学) WWU(西华盛顿大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SoSBench针对高风险科学领域设计,通过3000个基于真实法规的提示评估大模型的安全性,揭示了先进模型在处理危险场景时存在严重的安全对齐缺陷。

Comments Project Page: https://sosbench.github.io/; ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21439 2026-04-07 cs.AI 77%

The Paradox of Robustness: Decoupling Rule-Based Logic from Affective Noise in High-Stakes Decision-Making

鲁棒性悖论:在高风险决策中解耦基于规则的逻辑与情感噪声

Jon Chun, Katherine Elkins

机构 * Kenyon College(凯尼恩学院)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究揭示了大语言模型在高风险决策中对情感噪声的鲁棒性悖论,通过三个领域实验发现模型在逻辑约束下比人类更稳定,但对提示格式敏感。

Comments 47 pages, 14 figures, 23 tables. Substantially revised from v1: added immigration domain extension (14,183 cells), adversarial narrative pilot (2,054 cells), reasoning-trace analysis, scaffolding decomposition. Total: 84,245 valid responses across 13 experiments. Under review at TMLR. Code and data will be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19360 2026-04-07 cs.SE 75%

Compliance Management for Federated Data Processing

联邦数据处理的合规管理

Natallia Kokash, Adam Belloum, Paola Grosso

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种合规导向的联邦数据处理框架,整合了政策即代码、工作流编排和大语言模型辅助的合规管理,以解决跨组织边界的数据访问政策管理难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05856 2026-04-07 cs.HC 75%

"It Talks Like a Patient, But Feels Different": Co-Designing AI Standardized Patients with Medical Learners

它说话像病人,但感觉不同:与医学学习者共同设计AI标准化病人

Zhiqi Gao, Guo Zhu, Huarui Luo, Dongyijie Primo Pan, Haoming Tang, Bingquan Zhang, Jiahuan Pei, Jie Li, Benyou Wang

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文探讨了AI标准化病人在医学沟通培训中的应用,通过调研发现学习者对AI-SP的期望,并提出以学习者为中心的设计需求,强调教学实用性而非对话真实性的重要性。

Journal ref CHI 2026 Posters

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03666 2026-04-07 cs.IR 75%

MMP-Refer: Multimodal Path Retrieval-augmented LLMs For Explainable Recommendation

MMP-Refer: 多模态路径检索增强的可解释推荐LLM

Xiangchen Pan, Wei Wei

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 MMP-Refer通过多模态路径检索增强LLM,提升推荐系统的可解释性,采用联合残差编码获取多模态嵌入,并设计启发式搜索算法获取检索路径,通过轻量级协作适配器映射图编码至LLM语义空间,提升交互信息理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03297 2026-04-07 cs.CV cs.AI cs.LG 73%

XAttnRes: Cross-Stage Attention Residuals for Medical Image Segmentation

XAttnRes:用于医学图像分割的跨阶段注意力残差

Xinyu Liu, Qing Xu, Zhen Chen

机构 * Imperial College London(伦敦帝国学院) University of Nottingham(诺丁汉大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出XAttnRes机制,通过轻量级伪查询注意力实现跨阶段特征聚合,提升医学图像分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04842 2026-04-07 cs.CL 70%

Do No Harm: Exposing Hidden Vulnerabilities of LLMs via Persona-based Client Simulation Attack in Psychological Counseling

勿伤人:通过基于人设的客户端模拟攻击暴露大语言模型的隐藏漏洞

Qingyang Xu, Yaling Shen, Stephanie Fong, Zimu Wang, Yiwen Jiang, Xiangyu Zhao, Jiahe Liu, Zhongxing Xu, Vincent Lee, Zongyuan Ge

机构 * Monash University(莫纳什大学) University of Liverpool(利物浦大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于人设的客户端模拟攻击框架PCSA,通过模拟心理辅导中的客户端对话,揭示大语言模型在心理安全对齐方面的漏洞,实验表明其在七个通用和心理健康专用LLM上表现优于其他基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04325 2026-04-07 cs.CL 70%

Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction

多轮医学诊断基准测试:Hold、Lure 和 Self-Correction

Jinrui Fang, Runhan Chen, Xu Yang, Jian Yu, Jiawei Xu, Ashwin Vinod, Wenqi Shi, Tianlong Chen, Heng Ji, ChengXiang Zhai, Ying Ding, Yuji Zhang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) New York University(纽约大学) The University of Texas Southwestern Medical Center(德克萨斯大学西南医学中心) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过MINT基准测试揭示了大语言模型在多轮证据积累中的行为模式,发现提前回答、自我修正和强诱因影响诊断决策,提出延迟提问和保留关键证据可提升诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15284 2026-04-07 cs.CY cs.AI 70%

Beyond principlism: Practical strategies for ethical AI use in research practices

超越原则主义:科研实践中伦理AI使用的实用策略

Zhicheng Lin

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出以用户为中心、受现实启发的方法,解决AI伦理问题,提出五个具体目标,包括理解模型训练、尊重隐私、避免抄袭、有益应用AI以及透明可重复使用AI,并提出文档指南和培训计划以促进负责任的AI使用。

Comments Published in: AI and Ethics, 2025

Journal ref AI Ethics 5, 2719-2731 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03656 2026-04-07 cs.AI 70%

Beyond Retrieval: Modeling Confidence Decay and Deterministic Agentic Platforms in Generative Engine Optimization

超越检索:在生成引擎优化中建模置信度衰减与确定性代理平台

XinYu Zhao, ChengYou Li, XiangBao Meng, Kai Zhang, XiaoDong Liu

机构 * National University of Singapore(新加坡国立大学) Yishu Research(艺树研究) Fukuoka Institute of Technology(福冈工业大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过确定性多代理意图路由替代传统检索增强生成方法,建模置信度衰减并构建代理信任经纪生态系统,实验证明显著降低垂直任务幻觉率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03498 2026-04-07 cs.AI 70%

Resource-Conscious Modeling for Next- Day Discharge Prediction Using Clinical Notes

面向次日出院预测的资源感知建模

Ha Na Cho, Sairam Sutari, Alexander Lopez, Hansen Bow, Kai Zheng

机构 * University of California, Irvine, Donald Bren School of Information, Department of Informatics(加州大学尔湾分校,唐纳德·布伦信息与计算机科学学院,信息学系) University of California, Irvine, Department of Neurosurgery(加州大学尔湾分校,神经外科系)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了轻量级微调大语言模型和传统文本模型在次日出院预测中的应用,发现TF-IDF与LGBM在平衡性上表现最佳,AUC-ROC达0.80,表明可解释性模型在临床任务中更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04583 2026-04-07 cs.HC 67%

Computational Analysis of Speech Clarity Predicts Audience Engagement in TED Talks

演讲清晰度的计算分析预测TED演讲观众参与度

Roni Segal, Matan Lary, Ralf Schmaelzle, Yossi Ben-Zion

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 研究通过分析1239场TED演讲文本,发现清晰度是观众参与度的主要预测因素,且优于传统可读性指标,为提升公共演讲提供了可扩展的策略。

Comments Roni Segal and Matan Lary contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04139 2026-04-07 cs.HC 67%

Teacher Professional Development on WhatsApp and LLMs: Early Lessons from Cameroon

喀麦隆教师专业发展中的WhatsApp与大语言模型:初步经验

Vikram Kamath Cannanure, Bruno Yinkfu, Douglas Bryan, Mati Amin, Ingmar Weber

专题命中 领域大模型 :LLM(abstract);prompting(abstract)

AI总结 本研究通过喀麦隆的实地试点,比较基于WhatsApp的聊天机器人与在线表单在教师专业发展中的效果,发现聊天机器人在可用性和体验上更优,但受限于网络连接和多语言需求。

Comments Accepted at AIED 2026 (Practitioners Track). Mixed-methods field study (n=47) conducted in Cameroon; 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21926 2026-04-07 eess.IV cs.CV 67%

Comparing SAM 2 and SAM 3 for Zero-Shot Segmentation of 3D Medical Data

比较SAM 2和SAM 3用于3D医学数据的零样本分割

Satrajit Chakrabarty, Ravi Soni

机构 * GE HealthCare(GE医疗)

专题命中 领域大模型 :foundation model(abstract);prompting(abstract)

AI总结 本文比较SAM 2和SAM 3在3D医学数据零样本分割中的性能,发现SAM 3在点击提示下表现更优,且在超声和内窥镜任务中更胜一筹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03264 2026-04-07 cs.CV cs.AI cs.CR 57%

SafeScreen: A Safety-First Screening Framework for Personalized Video Retrieval for Vulnerable Users

SafeScreen: 一种以安全优先的个性化视频检索框架用于易受伤害用户的视频筛选

Wenzheng Zhao, Madhava Kalyan Gadiputi, Fengpei Yuan

机构 * Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 领域大模型 :LLM(abstract);分类 cs.AI

AI总结 SafeScreen通过安全优先机制,在确保个性化视频检索的同时满足个体安全约束,采用自动化流程进行视频的连续审批或拒绝,结合个性化安全标准提取、证据驱动评估和LLM决策,实现实时可解释的视频筛选。

Comments 11 pages, 3 figures, 7 tables. Under review for ACM ICMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11919 2026-04-07 stat.ME cs.AI math.ST stat.TH 57%

A fine-grained look at causal effects in causal spaces

对因果空间中因果效应的细致探讨

Junhyung Park, Yuqing Zhou

机构 * ETH Zürich, Switzerland(瑞士苏黎世联邦理工学院)

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 本文从事件层面探讨因果效应,引入事件和sigma-algebra的定义,证明因果效应与干预措施下的独立性关系,并提出量化措施以评估因果效应的强度与性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05892 2026-04-07 cs.CV cs.AI 57%

Challenges in Deep Learning-Based Small Organ Segmentation: A Benchmarking Perspective for Medical Research with Limited Datasets

深度学习在小器官分割中的挑战:基于有限数据集的医学研究基准视角

Phongsakon Mark Konrad, Andrei-Alexandru Popa, Yaser Sabzehmeidani, Liang Zhong, Madhulika Tripathy, Andrei Constantinescu, Elisa A. Liehn, Serkan Ayvaz

机构 * Centre for Industrial Software, University of Southern Denmark(南丹麦大学工业软件中心) Centre for Industrial Mechanics, University of Southern Denmark(南丹麦大学工业力学中心) Duke-NUS(杜克-新加坡国立大学医学院) National Heart Center Singapore(新加坡国家心脏中心) University of Medicine and Pharmacy Carol Davila Bucharest(布加勒斯特卡罗尔·达维拉医药大学)

专题命中 领域大模型 :foundation model(abstract);分类 cs.AI

AI总结 本文评估了十种深度学习分割模型在有限数据集上的表现,发现经典架构在分布偏移下表现不佳,而基础模型保持稳定,揭示了低数据环境下基准评估的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29845 2026-04-07 cs.IR 50%

Cold-Starts in Generative Recommendation: A Reproducibility Study

生成推荐中的冷启动问题:可重复性研究

Zhen Zhang, Jujia Zhao, Xinyu Ma, Xin Xin, Maarten de Rijke, Zhaochun Ren

专题命中 领域大模型 :language model(abstract)

AI总结 本文研究生成推荐中的冷启动问题,通过统一的冷启动协议评估不同模型的可重复性,探讨冷启动在动态开放平台中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 知识编辑与模型理解 21 篇

2604.03764 2026-04-07 cs.LG cs.AI 88%

Automated Attention Pattern Discovery at Scale in Large Language Models

在大规模大型语言模型中实现自动化注意力模式发现

Jonathan Katzy, Razvan-Mihai Popescu, Erik Mekkes, Arie van Deursen, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析Java代码数据集中的完成场景,提出了一种在大规模大型语言模型中发现重复行为的方法,展示了注意力模式作为可扩展解释信号的潜力,并引入了AP-MAE模型以高效重建掩码注意力模式。

Comments Accepted to TMLR

Journal ref Transactions on Machine Learning Research 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04743 2026-04-07 cs.CL cs.AI cs.SY eess.SY 84%

Hallucination Basins: A Dynamic Framework for Understanding and Controlling LLM Hallucinations

幻觉盆地:一种动态框架用于理解和控制LLM幻觉

Kalyan Cherukuri, Lav R. Varshney

机构 * Illinois Mathematics and Science Academy(伊利诺伊数学与科学学院) AI Innovation Institute, Stony Brook University(石溪大学人工智能创新研究所)

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出几何动态系统框架,通过分析潜在空间中的盆地结构来理解LLM幻觉现象,发现任务依赖性显著影响分离性,并通过任务复杂度和多盆地定理展示几何感知引导可降低幻觉概率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23095 2026-04-07 cs.CV 82%

Revisiting Multimodal Positional Encoding in Vision-Language Models

重新审视视觉-语言模型中的多模态位置编码

Jie Huang, Xuejing Liu, Sibo Song, Ruibing Hou, Hong Chang, Junyang Lin, Shuai Bai

机构 * Qwen Team, Alibaba Group(Qwen团队,阿里巴巴集团) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract)

AI总结 本文分析了多模态Rotary Positional Embedding的核心组件,提出MHRoPE和MRoPE-Interleave两种改进方法,在多种基准测试中表现优异,提升了多模态理解能力。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03556 2026-04-07 cs.CV cs.AI cs.CL 81%

Focus Matters: Phase-Aware Suppression for Hallucination in Vision-Language Models

重点至关重要:面向视觉语言模型中幻觉的相位感知抑制

Sohyeon Kim, Sang Yeon Yoon, Kyeongbo Kong

机构 * Pusan National University(釜山大学) Pukyong National University(釜庆大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种轻量级干预方法,在视觉编码器的聚焦阶段选择性抑制低关注的token,通过单次前向传递统计信息和DPP保留多样视觉线索,减少幻觉的同时保持caption质量,且推理延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07149 2026-04-07 cs.LG cs.AI cs.CL cs.IT math.IT 80%

Measuring Uncertainty in Transformer Circuits with Effective Information Consistency

通过有效信息一致性测量变换器电路中的不确定性

Anatoly A. Krasnovsky

机构 * Innopolis University(因诺波利斯大学) MB3R Lab(MB3R实验室)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出有效信息一致性评分,通过局部雅可比矩阵和激活值计算规范化sheaf不一致性,并结合高斯EI代理评估电路层面因果涌现,以量化变换器电路行为的一致性与可信度。

Journal ref Automatic Documentation and Mathematical Linguistics 59 (Suppl 5), S423-S429 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04383 2026-04-07 cs.AI cs.MA math.OC 79%

Optimizing Service Operations via LLM-Powered Multi-Agent Simulation

通过LLM赋能的多智能体仿真优化服务运营

Yanyuan Wang, Xiaowei Zhang

机构 * Department of Industrial Engineering and Decision Analytics, The Hong Kong University of Science and Technology(香港科技大学工业工程与决策分析系)

专题命中 知识编辑与模型理解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出基于LLM的多智能体仿真框架,通过建模决策依赖的不确定性,优化服务运营的稳态性能,实验证明其在可持续供应链中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03562 2026-04-07 cs.AI 79%

When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling

当自适应奖励有害:因果探测与在LLM引导的LEO卫星调度中的切换-稳定性困境

Yuanhang Li

专题命中 知识编辑与模型理解 :LLM(title,abstract);分类 cs.AI

AI总结 本文研究了在多波束LEO卫星调度中使用自适应奖励设计的挑战,发现固定奖励权重在PPO收敛中表现更优,通过因果探测方法揭示了特定权重的重要性,展示了LLM在通信系统中的应用价值。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03473 2026-04-07 cs.CL cs.AI 79%

Evolutionary Search for Automated Design of Uncertainty Quantification Methods

为不确定性量化方法的自动化设计应用进化搜索

Mikhail Seleznyov, Daniil Korbut, Viktor Moskvoretskii, Oleg Somov, Alexander Panchenko, Elena Tutubalina

机构 * AIRI Skoltech(斯科尔科沃科学技术学院) Amazon(亚马逊) EPFL(瑞士联邦理工学院洛桑) MIPT(莫斯科物理技术学院)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过LLM驱动的进化搜索自动发现无监督的不确定性量化方法,其在原子声明验证任务中优于手动设计的基线方法,且在分布外泛化方面表现稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13130 2026-04-07 cs.CV cs.AI cs.CL 73%

ZINA: Multimodal Fine-grained Hallucination Detection and Editing

ZINA:多模态细粒度幻觉检测与编辑

Yuiga Wada, Kazuki Matsuda, Komei Sugiura, Graham Neubig

机构 * Keio AI Research Center(庆应义塾大学人工智能研究中心) Keio University(庆应义塾大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ZINA方法,用于多模态大语言模型的细粒度幻觉检测与编辑,通过构建VisionHall数据集验证了其在检测和编辑任务中的优越性。

Comments CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04182 2026-04-07 cs.AI 70%

Comparative reversal learning reveals rigid adaptation in LLMs under non-stationary uncertainty

比较性反向学习揭示在非平稳不确定性下LLMs的刚性适应

Haomiaomiao Wang, Tomás E Ward, Lili Zhang

机构 * Insight Research Ireland Centre for Data Analytics, Ireland(爱尔兰洞察研究中心) School of Computing, Dublin City University, Ireland(都柏林城市大学计算机学院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过比较确定性固定转移循环与随机性随机调度,探讨LLMs在非平稳环境下的适应性,发现DeepSeek-V3.2表现出极端的固着现象,而Gemini-3和GPT-5.2适应更快但仍不如人类敏感。

Comments 14 pages, 2 figures, accepted by IPMU 2026, SS04: Explainable AI and Decision-Making Under Uncertainty: Bridging Interpretability and Robustness

详情

展开后加载摘要…

URL PDF HTML 收藏