arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-12 至 2026-08-12 共收录 354 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 27 篇

2608.10039 2026-08-12 cs.LG 新提交 81%

FlowScout: From Execution Feedback to Reliable Tool-Using Agent Workflows

FlowScout:从执行反馈到可靠的工具使用智能体工作流

Shuo Hao, You Lu, Bihuan Chen, Xin Peng

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 FlowScout是从历史任务记录生成工具集成型智能体工作流的执行引导框架,经多任务域评估,其工具调用正确性与执行质量均显著优于PM4Py等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08941 2026-08-12 cs.LG 版本更新 79%

Predictive Entropy as a Joint Screen for Error and Paraphrase Instability in Medical Vision-Language Models

预测熵连接校准与改写敏感性在医疗视觉-语言模型中

Binesh Sadanandan, Vahid Behzadan

机构 * SAIL Lab, University of New Haven(纽黑文大学SAIL实验室)

专题命中 领域大模型 :language model(title,abstract);分类 cs.LG

AI总结 本文研究医疗视觉语言模型在部署中的校准和改写敏感性问题,通过预测熵方法发现决策边界接近性是共同原因,并展示单一熵阈值能有效识别不可靠和改写敏感的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25143 2026-08-12 cs.CV cs.CL 版本更新 79%

TemMed-Bench: Evaluating Temporal Medical Image Reasoning in Vision-Language Models

TemMed-Bench:评估视觉语言模型的时序医学图像推理能力

Junyi Zhang, Jia-Chen Gu, Wenbo Hu, Yu Zhou, Robinson Piramuthu, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL

AI总结 本文提出TemMed-Bench时序医学图像推理基准,评估12个视觉语言模型,发现多数模型缺乏分析患者状况时序变化的能力,多模态检索扩充可显著提升其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10590 2026-08-12 cs.CV 新提交 78%

Rethinking Data Efficiency in Industrial Dense Prediction: Pretraining Coherence, Not Inductive Bias, Determines ViTs Low-Data Advantage

重新思考工业密集预测中的数据效率:决定视觉Transformer(ViTs)低数据优势的是预训练一致性,而非归纳偏置

Haoran Sui, Yaoyuan Jia

机构 * ZTE Corporation(中兴通讯股份有限公司) The University of Hong Kong(香港大学)

专题命中 领域大模型 :pretraining(title,abstract)

AI总结 该研究通过实验发现工业密集预测中ViTs的低数据优势源于预训练一致性而非归纳偏置,提出AlignBlock解决跨架构特征差距,明确数据效率边界并验证了嫁接颈部网络的性能提升。

Comments 14 pages, 10 figures, 17 tables. This paper targets industrial defect detection via vision transformer and CNN alignment grafting

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02998 2026-08-12 cs.CY cs.CR 78%

Integrating Generative AI into Cybersecurity Education: A Study of OCR and Multimodal LLM-assisted Instruction

Karan Patel, Yu-Zheng Lin, Gaurangi Raul, Bono Po-Jen Shih, Matthew W. Redondo, Banafsheh Saber Latibari, Jesus Pacheco, Soheil Salehi, Pratik Satam

专题命中 领域大模型 :LLM(title,abstract)

Comments 9 pages, 3 figures, accepted by IEEE FIE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10505 2026-08-12 cs.AI cs.CL cs.CV 新提交 73%

RadFusion: Towards Threshold-Controllable Radiology Report Generation

RadFusion:迈向阈值可控的放射学报告生成

Ying Jin, Noel C. F. Codella, John Corring, Mu Wei, Dinei Florencio, Eric Horvitz

机构 * Microsoft(微软公司)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 RadFusion框架为放射学报告生成赋予阈值可控性,融合多标签分类器与VQA报告生成器,提升诊断准确率,支持ROC分析,适配不同临床场景,更易通过监管审批。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10045 2026-08-12 cs.LG cs.AI 新提交 73%

Finding the Signal in the Spam: Jointly Learning Rewards and Worker Reliability from Pairwise Comparisons

从垃圾信息中提取有效信号:基于成对比较联合学习奖励与工作者可靠性

Kaustubh Shivshankar Shejole, Tanish Agarwal, Arpit Agarwal, Avishek Ghosh

机构 * IIT Bombay(印度理工学院孟买分校)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一种基于EM算法的方法,联合学习成对比较场景下的物品奖励与工作者可靠性,通过Polya-Gamma潜变量优化模型,在真实与合成数据集上验证了其对垃圾工作者的强鲁棒性。

Comments Accepted at the 42nd Conference on Uncertainty in Artificial Intelligence (UAI 2026), Amsterdam, Netherlands, August 17-21, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08849 2026-08-12 cs.CL cs.AI cs.DB cs.MA cs.SC 版本更新 73%

SatIR: Scalable High-Recall Constraint-Satisfaction-Based Information Retrieval for Clinical Trials Matching

SatIR:可扩展的高召回率约束满足基于信息检索的临床试验匹配

Zikai Zhou, Yufei Jin, Yilin Xu, Yu-Chiang Wang, Chieh-Ju Chao, Monica S. Lam

机构 * Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Samueli Electrical and Computer Engineering, UCLA(UCLA Samueli电气与计算机工程系) Department of Computer Science and Informatics, Emory University(埃默里大学计算机科学与信息学系) Mayo Clinic(梅奥诊所)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SatIR通过将临床试验资格条件和摘要转化为形式约束,结合SMT、关系代数和大语言模型,提升了临床试验匹配的召回率和效率,优于基于相似度的基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09991 2026-08-12 eess.IV cs.CV 新提交 71%

Longitudinal 3D Foundation Modeling for Neoadjuvant Breast Cancer Response Prediction from Serial DCE-MRI

用于从系列动态对比增强磁共振成像(DCE-MRI)预测乳腺癌新辅助治疗反应的纵向三维基础建模

Fidel Omar Tito Cruz, Neda Ghafouri, Zengyan Wang, Pegah Khosravi, Yu Tian, Chen Chen

专题命中 领域大模型 :foundation model(title)

AI总结 本研究提出结合三维基础编码器与时间动态网络的纵向框架,融合系列DCE-MRI与临床数据,在982例乳腺癌患者上实现了较好的pCR预测性能。

Comments Accepted at the Applications of Medical AI (AMAI) Workshop at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10974 2026-08-12 cs.CL 新提交 70%

MUSE: A Full-Text Cross-Domain Knowledge Base of Scientific Problems, Solutions, and Rationales

MUSE:一个包含科学问题、解决方案及原理的全文跨领域知识库

Tsofia Cohen, Tom Hope

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Allen Institute for AI (Ai2)(艾伦人工智能研究所)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究推出MUSE知识库,通过模块化抽取流程构建含3.7万个P-S-R三元组的跨领域资源,实验表明原理监督可提升复杂问题的性能但会损害简单问题的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24226 2026-08-12 cs.IR cs.LG 版本更新 70%

UniScale: Synergistic Entire Space Data and Model Scaling for Search Ranking

联合模型参数缩放与通用域数据集成用于电商搜索排序

Liren Yu, Caiyuan Li, Feiyi Dong, Tao Zhang, Zhixuan Zhang, Dan Ou, Haihong Tang, Bo Zheng

机构 * Taobao \& Tmall Group of Alibaba Hangzhou China Taobao \& Tmall Group of Alibaba Beijing China Taobao \& Tmall Group of Alibaba

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出UniScale框架,通过联合数据缩放(ES$^3$样本构建系统)和模型设计(HHSFT异构层次融合Transformer),解决工业搜索中仅增大模型参数或调整架构带来的性能瓶颈,在电商搜索平台上实现购买量提升1.70%、GMV提升2.04%。

Comments Accepted at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11090 2026-08-12 cs.CY 新提交 67%

Who Uses Open-Weight Models? China and the Shifting Geography of AI in Science

谁在使用开放权重模型?中国与科学领域AI的地理格局变迁

Zackary Okun Dunivin

专题命中 领域大模型 :LLM(abstract,abstract_cn)

AI总结 该研究分析2100万篇论文发现,GPT系列主导AI研究,开放权重模型使用量升至2026年的44.0%,中国机构研究人员采用率是其他机构的2.23倍,推动了开放权重模型的采用,反映AI模型生态的地缘文化重组。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10175 2026-08-12 cs.MA q-fin.PM 新提交 67%

Beyond Cash Flows: A Multi-Agent AI Framework for Valuing Clinical-Stage, Cross-Border Biotechnology

超越现金流:用于临床阶段跨境生物技术估值的多智能体AI框架

Yuhan Fang

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 本文针对临床阶段生物技术估值的现金流假设失效问题,提出多智能体AI框架,其含估值层、跨市场协调层与冲突融合机制,基于作者过往实践确立智能体投资系统设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00642 2026-08-12 cs.AI cs.LG 版本更新 62%

Coachable agents for interactive gameplay

可指导的交互式游戏智能体

Roberto Capobianco, Harm van Seijen, Nolan D. Bard, Neil Burch, Fatima Davelouis, Josh Davidson, Alisa Devlic, Yunshu Du, Ishan Durugkar, Siddhant Gangapurwala, Daniel Hernandez, G. Zacharias Holland, Sahil Jain, Kenta Kawamoto, Raksha Kumaraswamy, Patrick MacAlpine, Dustin R. Morrill, Declan Oller, Francesco Riccio, Akanksha Saran, Craig Sherstan, Kaushik Subramanian, Thomas J. Walsh, Samuel Barrett, Kizza N. Frisbee, Mady Govil, Johannes Günther, Varun R. Kompella, James A. MacGlashan, Maxwell Svetlik, Michael D. Thomure, Jaden B. Travnik, Kevin Waugh, Elahe Aghapour, Florian Fuchs, Andreanne Lemay, Shruti Mishra, Takuma Seno, Peter Stone, Michael Spranger, Peter R. Wurman

机构 * Sony AI, Zurich, Switzerland(索尼AI,苏黎世,瑞士) Sony AI, North America (various locations)(索尼AI,北美(多地)) Sony AI, Tokyo, Japan(索尼AI,东京,日本)

专题命中 领域大模型 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出结合通用价值函数近似器与精心选择的训练场景、学习算法和数据增强的框架,使智能体在复杂领域(如《地平线:西之绝境》、《GT赛车》和类人机器人)中实时展现不同风格,同时保持主任务性能。

Comments Source code: https://github.com/SonyResearch/coachable_agents - Videos: https://drive.google.com/drive/folders/19F5uKziT_zkDurze5sy5iMFD4BHfD3lV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10996 2026-08-12 cs.CL 新提交 57%

ConRub-Med: Reinforcement Learning with Consensus Rubrics for Open-Ended Medical Question Answering

ConRub-Med:面向开放式医学问答的共识准则强化学习

Taojie Zhu, Yuan Xia, Tao Sun, Yizhi Wang, Yan Chen, Qunshan He, Tian Guan, Jian Wang, Jinjie Gu, Junwei Liu, Yonghong He

专题命中 领域大模型 :language model(abstract);分类 cs.CL

AI总结 本研究提出ConRub-Med,通过三模型共识准则与三状态评分优化GRPO策略,在9个医学问答基准中6个排第一,HealthBench-Hard得分优于InfiMed-ORBIT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10522 2026-08-12 cs.CV cs.AI 新提交 57%

Unlocking the Power of Medical Tabular Data via Semantic-Aware Multimodal Pre-training

通过语义感知多模态预训练释放医疗表格数据的力量

Yingsheng Liu, Haiming Li, Jingmin Zhu, Jiajun Sun, Victoria Mar, Monika Janda, H. Peter Soyer, Zongyuan Ge, Zhen Yu

机构 * Faculty of Information Technology, Monash University(莫纳什大学信息技术学院) Monash University(莫纳什大学) The University of Queensland(昆士兰大学)

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 该研究针对医疗表格数据的语义利用不足问题,提出语义感知多模态预训练框架,含重要性感知自适应掩码与软标签离散化模块,在皮肤病学、眼科数据集上实现SOTA,鲁棒性与跨域泛化能力优异。

Comments INTERNATIONAL CONFERENCE ON MEDICAL IMAGE COMPUTING AND COMPUTER ASSISTED INTERVENTION (ORAL presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18577 2026-08-12 cs.CV 版本更新 50%

Attention Without Grounding: Causal Evaluation of Visual Explanations in Medical VLMs

无基础的注意力:医学视觉语言模型中视觉解释的因果评估

Binesh Sadanandan, Vahid Behzadan

机构 * SAIL Lab, University of New Haven(萨伊勒实验室,纽黑文大学)

专题命中 领域大模型 :language model(abstract)

AI总结 研究医学视觉语言模型中视觉解释的因果评估,通过多种方式审核注意力热图忠实度,发现没有评估的VLM满足忠实标准,热图虽视觉上安心但不忠实,临床解释需可控指标和因果扰动而非仅视觉检查。

Comments iMIMIC Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16840 2026-08-12 cs.CV cond-mat.mtrl-sci 版本更新 50%

What DINO saw: ALiBi positional encoding reduces positional bias in Vision Transformers

What DINO saw: ALiBi 位置编码减少视觉变换器中的位置偏差

Moritz Pawlowsky, Antonis Vamvakeros, Alexander Weiss, Anja Bielefeld, Samuel J. Cooper, Ronan Docherty

专题命中 领域大模型 :foundation model(abstract)

AI总结 本文研究了视觉变换器中的位置偏差问题,通过线性探测发现其普遍存在,并通过微调使用ALiBi相对位置编码来减少偏差,证明了无偏特征在复杂显微图像分割中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 知识编辑与模型理解 19 篇

2601.05280 2026-08-12 cs.IT cs.AI cs.LG math.IT 版本更新 88%

On Solomonoff Induction in Large Language Models and the Limits of Self-Improving: The Singularity Is Not Near Without Symbolic Model Synthesis

在大型语言模型中自我改进的极限:没有符号模型合成,奇点并不临近

Hector Zenil

机构 * Algorithmic Dynamics Lab(算法动力实验室) Department of Biomedical Computing(生物医学计算系) School of Biomedical Engineering and Imaging Sciences(生物医学工程与成像科学学院) King’s Institute for AI(国王人工智能研究所) King’s College London(伦敦国王学院) Oxford Immune Algorithmics(牛津免疫算法公司) Oxford University Innovation(牛津大学创新中心) London Institute for Healthcare Engineering(伦敦医疗工程研究所)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究指出大型语言模型在缺乏外部信号时自我改进会退化,提出神经符号整合方法以突破这一限制。

Comments 31 pages. Update: DPI and Levin's non-growth is not violated explanation when it comes to finite learners

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29418 2026-08-12 cs.CV cs.AI 版本更新 88%

Covert Visual Prompt Injection against Commercial Multimodal Large Language Models

对抗性提示注入攻击多模态大语言模型

Meiwen Ding, Song Xia, Chenqi Kong, Xudong Jiang

机构 * Rapid-Rich Object Search Lab, School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院快速丰富目标搜索实验室)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文研究了针对强大闭源多模态大语言模型的不可察觉视觉提示注入攻击,通过界文本叠加嵌入恶意提示并优化视觉扰动,提升攻击性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10836 2026-08-12 cs.SD cs.AI 新提交 87%

Whisper-Aware LLM: Self-Supervised Uncertainty Learning for Robust Whispered Speech Recognition

感知耳语的大语言模型:用于鲁棒耳语语音识别的自监督不确定性学习

Gaopeng Xu, Zhenyu Wang, Zheng Xue, Yinfeng Xia, Haitao Yao

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);分类 cs.AI

AI总结 本文提出Whisper-Aware LLM框架,通过自监督学习量化声学信号缺陷并结合置信融合解码机制,在AISHELL6-Whisper数据集上将耳语语音识别的CER相对降低17%,幻觉率降至4.5%,达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10430 2026-08-12 cs.LG cs.AI 新提交 87%

Actionable Hallucination Detection: Translating Latent Uncertainty into Agentic Critique

可操作的幻觉检测:将潜在不确定性转化为智能体批判

Sanidhya Vijayvargiya, Rahul Lokesh

机构 * Samsung Research America(美国三星研究院)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出Latent Critic轻量级LoRA适配器,可实时检测LLM智能体的幻觉,定位准确率超80%、AUROC达0.966,能拦截幻觉并助力智能体自我修正,效能优于同类基线方法。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11138 2026-08-12 cs.CL cs.AI 新提交 85%

Attention-Path Fragility as an Uncertainty Signal in Large Language Models

注意力路径脆弱性作为大语言模型中的不确定性信号

Minsoo Kim, Sungyoung Ji, Kisung Moon, Ilyong Yoon

专题命中 知识编辑与模型理解 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本研究提出 ASMI 作为大语言模型的不确定性信号,通过掩码注意力头测量子网络间的 BALD 互信息,在基于事实的问答任务中优于基线,可有效识别自信但脆弱的预测。

Comments 19 pages, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01530 2026-08-12 cs.CV 版本更新 85%

Logit Lens Supervision for Patch-Level Explanations in Vision-Language Models

在视觉语言模型中保留局部化补丁语义

Parsa Esmaeilkhani, Longin Jan Latecki

机构 * Department of Computer and Information Sciences, Temple University, Philadelphia, USA(计算机与信息科学系,特兰普大学,费城,美国)

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 为解决视觉语言模型中图像与文本 tokens 信息扩散问题,提出 Logit Lens Loss(LLL)以保留图像 tokens 的局部化语义,提升模型可解释性和分割任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10725 2026-08-12 cs.CV cs.SC 新提交 82%

Rethinking LLM Verification: Evidence Structure, Uncertainty, and Selective Refinement

重新思考大语言模型验证:证据结构、不确定性与选择性优化

Uma Ranjan, Kunal Tilaganji, Aditya Koul, Anurag Mahipal, Dashpreet Singh, Hriday Rana, Manan Jain, Sidharth Gupta, Ajo Babu George, Vineeth Balasubramanian, Nagarajan Natarajan, Amit Sharma

机构 * Indian Institute of Technology Jammu(贾姆穆印度理工学院) Microsoft Research(微软研究院) SCB Dental College and Hospital(SCB牙科学院与医院)

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 该研究针对LLMs医疗应用的安全问题,提出两阶段框架,利用模型弃权信号优化推理,在GPT-5.5、DeepSeek-R1模型及MedReason、MedQA数据集上显著提升了医疗假设验证的准确率。

Comments Findings Track at the Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10434 2026-08-12 cs.AI 新提交 81%

Conversational versus Dashboard Explainable AI for UAV Intrusion Detection: An Empirical Study of Operator Trust and Reliance

无人机入侵检测中对话式与仪表盘式可解释人工智能:操作员信任与依赖的实证研究

Cong Chi Nguyen, Trang Mai Xuan, Vu-Duc Ngo, Kim-Ngan Thi Nguyen, Trong-Nghia Nguyen, Thien Van Luong

机构 * Phenikaa University(菲卡大学) Phenikaa School of Computing(菲卡计算机学院) MobiFone Corporation(MobiFone集团) MobiFone HighTech Center(MobiFone高科技中心) National Economics University(国民经济大学) College of Technology(技术学院)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究对比对话式与仪表盘式XAI界面对无人机入侵检测操作员信任和依赖的影响,发现对话式界面可用性更高但易引发过度依赖,为未来XAI系统设计提供启示。

Comments 12 pages, 3 figures, EIDT conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09248 2026-08-12 cs.AI 版本更新 81%

Emotion2Skill: Model-Internal Emotion Signals for Adaptive Skill Selection and Evolution

Emotion2Skill:用于自适应技能选择与演化的模型内部情绪信号

Bohan Lin, Hejia Geng, Xinyi Xie, Heng Zhou, Qinghua Xing, Bo Liu, Chen Zhang, Yudong Zhang

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 Emotion2Skill框架提取LLM内部情绪向量,将其融入技能选择与演化,在WebShop、ALFWorld上用Qwen3模型实现显著性能提升,验证了情绪表征作为智能体决策信号的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00422 2026-08-12 cs.AI 版本更新 81%

TrAC: Trace-Conditioned Answer Consistency for Efficient Uncertainty Quantification in LLMs

TrAC:用于大语言模型高效不确定性量化的轨迹条件答案一致性

Dahai Yu, Lin Jiang, Rongchao Xu, Guang Wang

机构 * Florida State University(佛罗里达州立大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型推理轨迹与答案不一致的问题,提出TrAC框架,结合主动与被动信号实现高效不确定性量化,在数学推理基准上提升了AUROC并降低了AURC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10131 2026-08-12 cs.CV cs.LG 新提交 79%

P3CA: Encoder-Agnostic Interpretation of Vision Foundation Model Embeddings via Spatial Probing

P3CA:通过空间探测实现与编码器无关的视觉基础模型嵌入解释

Amoon Jamzad, Dilakshan Srikanthan, Faranak Akbarifar, Nooshin Maghsoodi, Parvin Mousavi

机构 * School of Computing, Queen’s University(女王大学计算学院)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 针对视觉基础模型嵌入难以解释的问题,提出与编码器无关的P3CA方法,通过空间提示实现局部探测,在多类数据上验证其可揭示局部结构、提升病理判别能力等贡献。

Comments 10 pages, 5 figures, 1 table. Accepted at the iMIMIC Workshop, MICCAI 2026. This arXiv version is the pre-peer-review author manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31087 2026-08-12 cs.CL cs.AI 版本更新 79%

When Reranking Hurts: Uncertainty-Based Gating for Few-Shot Reranking

当重排序有害时:基于不确定性的门控机制用于少样本重排序

Orian Dabod, Amir DN Cohen, Gabriel Stanovsky

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) OriginAI

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对少样本选择中重排序可能降低性能的问题,提出无训练门控重排序方法,基于模型不确定性决定是否重排序,在8个LLM上降低15%-80%计算成本并提升平均性能达2%。

详情

展开后加载摘要…

URL PDF HTML 收藏