arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-29 至 2026-07-29 共收录 286 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 46 篇

2607.22448 2026-07-29 cs.MA 版本更新 71%

Where Facts Go Missing: A Layerwise Taxonomy and Per-Layer Attribution of Information Omission in Air-Gapped LLMAgent Pipelines

事实缺失的地方:气隙式大语言模型智能体管道中信息遗漏的分层分类和逐层归因

Santhiya Rajan

专题命中 领域大模型 :LLM(title)

AI总结 研究气隙式大语言模型智能体管道中信息遗漏问题,提出九层分类法、归因方法、跨架构比较框架及运行时检测框架,经多模型多引擎试验,确定遗漏率及来源,为定位运营商干预位置提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23297 2026-07-29 cs.CV 版本更新 71%

PRIMA: Pre-Training with Risk-Integrated Image--Metadata Alignment for Medical Diagnosis with LLM-Based Feature Aggregation

PRIMA:通过大语言模型进行风险集成图像-元数据对齐的医学诊断预训练

Yiqing Wang, Chunming He, Ziyun Yang, Maria Woodward, Ming-Chen Lu, Mercy Pawar, Leslie Niziol, Sina Farsiu

机构 * Department of Biomedical Engineering, Duke University(杜克大学生物医学工程系) Department of Ophthalmology and Visual Sciences, University of Michigan(密歇根大学眼科与视觉科学系)

专题命中 领域大模型 :LLM(title)

AI总结 提出PRIMA框架,通过检索增强生成策展风险-疾病关联专家语料库优化文本编码器,用双编码器预训练策略及四个互补损失函数弥合模态差距,融合特征用于疾病分类,性能优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25021 2026-07-29 cs.AI cs.HC cs.MA cs.SE 新提交 70%

Chart-Supported or Model-Supplied? Examining MLLM-Generated Claims for Accessible Visualization

图表支持还是模型提供?审视多模态大语言模型生成的可访问可视化声明

Ishrat Jahan Eliza, Md Dilshadur Rahman

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多模态大语言模型生成可视化声明的证据基础,通过对多种来源、模型及输入条件的探索性研究,分析模型标签与数值一致性,发现可访问图表上下文有作用,添加图像及无上下文提示效果不佳,推动可区分证据支持声明与模型解释的描述系统发展。

Comments Submitted to the 3rd Workshop on Accessible Data Visualization, IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24799 2026-07-29 cs.IR cs.AI 新提交 70%

Multimodal Hybrid Retrieval-Augmented Generation for Scientific Document Understanding using Open-Source SLMs

使用开源语言模型进行科学文档理解的多模态混合检索增强生成

Alexandru-Andrei Saucă, Ana-Luiza Rusnac

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对科学文档理解中大型语言模型的问题,提出多模态混合检索增强生成系统。利用开源视觉语言模型生成摘要,结合多种检索方法并优化,采用查询压缩器确保连贯性。经评估,该系统提高了检索质量,验证了开源模型与先进策略结合的竞争力。

Comments 7 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25672 2026-07-29 astro-ph.IM astro-ph.CO cs.CL gr-qc 新提交 70%

AI's Capability in Assisting Scientific Research in Physics, Astrophysics, and Cosmology I: Literature Review

人工智能在协助物理、天体物理和宇宙学科学研究中的能力I:文献综述

Anamaria Hell, Kateryna Vovk, Veena Krishnaraj, Jia Liu, Kosuke Aizawa, Adrian E. Bayer, Linda Blot, Jessica Cowell, Suyog Garg, Jonathan Grée, Ben Horowitz, Masaya Ichikawa, Kanyuni Iemoto, Keigo Kondo, Zacharie Lorsin, Kevin McCarthy, Jamie Robinson, Miguel Ruiz-Granda, Leander Thiele, Ievgen Vovk, Mingshen Zhou

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型在物理等领域协助文献综述的能力,通过对照研究发现其与人类所选文献重叠率低,生成的参考文献可靠性待提升,2026年的ChatGPT Pro 5.5性能有显著改善。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14546 2026-07-29 cs.CV cs.AI 版本更新 70%

Leveraging ChatGPT's Multimodal Vision Capabilities to Rank Satellite Images by Poverty Level: Advancing Tools for Social Science Research

利用ChatGPT的多模态视觉能力按贫困水平对卫星图像进行排名:推进社会科学研究工具

Hamid Sarmadi, Ola Hall, Thorsteinn Rögnvaldsson, Mattias Ohlsson

机构 * Center for Applied Intelligent Systems Research (CAISR), Halmstad University, Sweden(应用智能系统研究中心(CAISR),哈马斯特德大学,瑞典) Department of Human Geography, Lund University, Sweden(人类地理系,吕勒奥大学,瑞典) Department of Earth and Environmental Sciences, Lund University, Sweden(地球与环境科学系,吕勒奥大学,瑞典)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究利用具视觉能力的大语言模型分析卫星图像预测村级贫困,通过成对比较方法证明ChatGPT能按贫困水平排名卫星图像,准确性与专家相当,凸显LLMs在社会经济研究中的前景与局限,为贫困监测等提供基础并引发对公共数据集可靠性的思考。

Comments A code and data availability statement, along with the repository address, has been added to the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25901 2026-07-29 cs.IR 新提交 67%

RecoReward: Recommender-Guided Multimodal Description Generation for Recommendation

RecoReward:用于推荐的推荐器引导多模态描述生成

Guohong Mu, Yueyang Liu, Jiangxia Cao, Changxin Lao, Zijie Zhuang, Yuhui Zhang, Jiaqi Feng, Ruochen Yang, Shuang Yang, Zhaojie Liu, Qibin Hou

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 研究针对多模态推荐中传统方法不足,提出RecoReward,训练时用行为衍生奖励,保留仅内容推理。在直播推荐中利用用户历史等估计亲和力,通过推荐器亲和力分数提供反馈,实验表明该方法能提升MLLM性能,利于下游推荐且保留内容服务。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22693 2026-07-29 cs.DL 版本更新 67%

Detecting Hallucinated and Suspicious Citations: What Current Tools Can and Cannot Do

检测幻觉式和可疑引用:当前工具的能力与局限

Fidan Badalova, Philipp Mayr

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型在学术写作中产生的幻觉式和可疑引用问题,评估了CheckIfExist等工具,指出其虽能预警,但受多种因素限制,强调此类引用对科学交流是个现实且渐趋严重的问题,需更完善的检测系统。

Comments 6 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17675 2026-07-29 cs.SE cond-mat.mtrl-sci 版本更新 67%

Bridging the Gap on AI-Assisted Scientific Software Development Through Transparency and Traceability

通过透明性和可追溯性弥合人工智能辅助科学软件开发的差距

Chaitanya Bhave, Pierre-Clément A. Simon, Casey Icenhour, Lin Yang, Cody J. Permann, Daniel Schwen, Christopher S. Ritter

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 本文探讨了在严格软件质量保证背景下如何负责任地使用人工智能辅助科学软件开发,提出了一种结构化框架用于AI辅助的验证与验证案例开发,以确保软件质量。

Comments 11 figures, 25 main pages (42 total pages including supplementary materials)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25948 2026-07-29 cs.CV cs.AI cs.LG 新提交 62%

MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities

MODUS:仅解码器的多模态任意到任意建模

Mingqiao Ye, Zhaochong An, Zhitong Gao, Xian Liu, François Fleuret, Chuan Li, Amir Zadeh, Serge Belongie, Afshin Dehghan, Jesse Allardice, David Mizrahi, Oğuzhan Fatih Kar, Roman Bachmann, Amir Zamir

专题命中 领域大模型 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究任意到任意多模态建模,提出仅解码器的对称多模态建模方法Modus,无需特定模态组件,支持多种应用,在各基准测试中用单模型展现强大性能且与基线竞争,材料开源。

Comments Accepted at ICML 2026. Project page: https://modus-multimodal.epfl.ch

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24784 2026-07-29 cs.AI cs.CL 新提交 62%

On the Use of LLMs for Specialised Terminology: A Good Alternative to Corpora?

关于大语言模型在专业术语方面的应用:语料库的良好替代品?

Joachim Minder, Guillaume Wisniewski, Natalie Kübler

专题命中 领域大模型 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型在专业翻译中找英语到法语对应词的作用,评估四个模型在两个领域的表现,比较两种提示策略,发现模型等存在差异,大语言模型对专业译者有用但不能取代语料库,为后续研究铺了路。

Journal ref 26th Annual Conference of the European Association for Machine Translation, Jun 2026, Tilburg, Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24838 2026-07-29 cs.IR cs.AI 新提交 61%

MedJudgeRAG: Option-Wise Evidence Judgment with Dynamic Knowledge Graphs for Medical MCQA

MedJudgeRAG:用于医学多项选择题问答的基于动态知识图谱的选项级证据判断

Seongwon Seo, Seung Hwan Cho, Young-Min Kim

专题命中 领域大模型 :language model(abstract);分类 cs.AI;foundation model(comments)

AI总结 针对医学MCQA中普通RAG降低LM性能的问题,提出MedJudgeRAG框架,将检索文档表示为动态知识图谱,为选项判断证据裁决并确定知识利用策略,经监督微调训练,实验证明其性能优于基线,且动态知识图谱在训练时作用更有效。

Comments 16 pages, 2 figures, Accepted at The Workshop on Graph Foundation Models at the 43 rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25225 2026-07-29 cs.CR cs.LG cs.SE 新提交 57%

SecDrift: Measuring Sector-Conditioned Security Drift in AI-Generated Code

SecDrift:测量人工智能生成代码中特定领域条件下的安全漂移

Narayanaswami Natraj Bharadwaj, Dhivya Chandramouleeswaran

专题命中 领域大模型 :prompting(abstract);分类 cs.LG

AI总结 研究大语言模型在关键基础设施代码生成中特定领域提示的安全效果,提出SecDrift基准,通过多模型多领域评估发现行业提示安全优势不显著,模型选择影响大,强调模型选择是更可靠的安全杠杆并开源相关内容。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25038 2026-07-29 cs.IR cs.AI 新提交 57%

Grounded in Consensus, In Step With Emerging Science: A Consensus-Anchored Multi-Corpus Clinical Chatbot for Long COVID

基于共识,紧跟新兴科学:用于长期新冠的共识锚定多语料临床聊天机器人

Yining Wu, Philip DiGiacomo, Ying Ding, William Brode

专题命中 领域大模型 :LLM(abstract);分类 cs.AI

AI总结 针对长期新冠临床决策支持证据分散的问题,提出整合多来源的面向临床医生的聊天机器人,在检索增强流程中组织四个来源,经探索性自动评估,其平均评分与OpenEvidence相当,得分更高且变异性更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25823 2026-07-29 cs.IR 新提交 50%

Hypothesis-Driven Shelf Generation for Personalised Recommendation

用于个性化推荐的假设驱动型货架生成

Aleksandr V. Petrov, Tarun Chillara, Matthew D. Moellman, Lucas de Haas, Yabai Song, Alina Susoykina, Melissa Crawford, Gabriel Negash, Erik Franco, Tasnim Rahman, Binal Jhaveri, Shubham Bansal, Hugues Bouchard, Roberto Mirizzi, Mounia Lalmas, Aloïs Gruson

专题命中 领域大模型 :LLM(abstract)

AI总结 研究针对个性化推荐中货架生成问题,提出内容假设驱动型系统,含假设生成等四个阶段,解耦货架规划与目录填充,支持独立优化,经生产管道结合多种操作,通过离线和在线评估,该系统能扩展个性化推荐供应,效果有竞争力。

Comments Accepted at ACM RecSys '26 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27243 2026-07-29 cs.IR cs.SE 版本更新 50%

NOVA: A Verification-Aware Agent Harness for Architecture Evolution in Industrial Recommender Systems

NOVA: 面向工业推荐系统架构演化的验证感知智能体框架

Shaohua Liu, Liang Fang, Yilong Sun, Shudong Huang, Qingsong Luo, Shaoxin Liu, Xiaoyang Chen, Dongqiang Liu, Chuangang Ma, Zhenzhen Chai, Henghuan Wang, Shijie Quan, Changyuan Cui, Zhangbin Zhu, Peng Chen, Wei Xu, Lei Xiao, Haijie Gu, Jie Jiang

专题命中 领域大模型 :LLM(abstract_cn)

AI总结 提出NOVA框架,通过架构梯度、验证级联和层级任务控制实现工业推荐模型架构的自动化演化,有效减少静默失败,缩短文献到生产周期13倍以上。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 知识编辑与模型理解 17 篇

2607.25633 2026-07-29 cs.CL cs.AI 新提交 88%

Construction-Driven Injection: Linguistically-Grounded Edit-Based Code-Mixing Fingerprints for Large Language Models

构造驱动注入:用于大语言模型的基于语言基础编辑的代码混合指纹

Yongyi Cui, Yue Li, Tianbao Jiang, Xin Yi

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型易被滥用问题,提出统一指纹框架。通过LCF按规则构造代码混合指纹,再用LCFEdit结合多语言表示和跨语言对齐注入指纹,实现构造感知注入,确保更新稳定,能持续验证所有权且对模型效用影响小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25257 2026-07-29 stat.AP cs.AI cs.LG 新提交 88%

Laplace-PSN-IRT: Uncertainty Quantification for Neural Item Response Theory Models of LLM Benchmarks

拉普拉斯-PSN-IRT:大语言模型基准神经项目反应理论模型的不确定性量化

Juan Francisco, Mandujano Reyes

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型基准神经项目反应理论模型,提出拉普拉斯-PSN-IRT方法,通过近似贝叶斯后验推断增强模型,能恢复校准不确定性,可进行可信区间等分析,实验表明该方法在模型比较、信息稳定性及能力排名恢复等方面表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24539 2026-07-29 cs.CL cs.AI 版本更新 87%

Localizing Persona Representations in LLMs

在大语言模型中定位角色表示

Celia Cintas, Miriam Rateike, Erik Miehling, Elizabeth Daly, Skyler Speakman

机构 * IBM Research Africa(IBM非洲研究院) IBM Research Europe(IBM欧洲研究院)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型中角色表示的编码位置与方式,运用降维和模式识别方法,发现角色表示差异在解码器层最后三分之一内,特定伦理观点有重叠激活,政治意识形态区域不同,有助于理解LLM信息表示及改进输出调制。

Comments Corrected small naming inconsistencies for Level 0, 1, and 2 analysis

Journal ref Proceedings of the AAAI ACM Conference on AI, Ethics, and Society, 8(1), 630-642, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25877 2026-07-29 cs.AI 新提交 83%

Runtime Uncertainty Monitoring for LLM-Based Multi-Agent Systems Using Bayesian Networks

基于贝叶斯网络的基于大语言模型的多智能体系统的运行时不确定性监测

Bart Custers, Koorosh Aslansefat

机构 * University of Hull(赫尔大学)

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于大语言模型的多智能体系统在精算风险建模中的不确定性量化,提出含中央枢纽的多智能体框架,用令牌级对数概率和贝叶斯网络进行不确定性传播,再现基线性能并提供工作流稳定性等见解。

Comments This paper got accepted for Ninth International Workshop on Artificial Intelligence Safety Engineering (WAISE 2026): https://www.waise.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25244 2026-07-29 cs.AI 新提交 83%

CADENCE: A Cardiac Atom Dictionary for Interpretable Neural Concept Extraction from ECG Foundation Models

CADENCE:用于从心电图基础模型中提取可解释神经概念的心脏原子字典

Yixuan Duan, Arjun Naik, Sadeer Al-Kindi, Wei Qiu

机构 * Rice University(莱斯大学) Houston Methodist Hospital(休斯顿卫理公会医院)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究针对12导联心电图基础模型生理知识不透明问题,提出CADENCE框架,用BatchTopK稀疏自动编码器分解模型,得到稀疏心脏原子,提升临床表型和形态学预测AUROC,能恢复生理关系、验证原子描述,为审查模型知识提供可扩展框架。

Comments 21 pages, 5 main figures, 15 appendix figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18292 2026-07-29 cs.LG cs.AI cs.CL 版本更新 82%

Reliability Scales Inversely: Hallucinations Snowball Faster in Bigger Language Models

可靠性呈反比:更大的模型通过隐藏的自回归风险机制更快地加剧错误

Kushal Chakrabarti

机构 * Obviously Wrong, LLC(明显错误有限责任公司)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现随着语言模型规模扩大,答案虽更接近真实但退化更快。通过逐位置分歧追踪自回归风险残余,揭示了知识差距下降、知识退化增长等四个发现,指出更大模型会通过特定风险机制更快加剧错误,该机制因果且模型自身难以察觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25479 2026-07-29 cs.CR cs.AI cs.LG 新提交 81%

Architectural Backdoors in Vision-Language Model Supply Chains via Representation Steering

通过表示引导在视觉语言模型供应链中植入架构后门

Maria Rosaria Briglia, Igor Maljkovic, Antonio Emanuele Cinà, Luca Oneto, Iacopo Masi, Fabio Roli

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型供应链安全问题,提出通过表示引导植入架构后门的攻击方法,该方法不影响训练数据等,通过触发控制模型表示转向攻击者目标,评估表明其损害模型多项性能,还提出审计防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25228 2026-07-29 cs.CL 新提交 79%

Interpretable Column Annotation with LLM-Symbolized Decision Process Materialization

基于大语言模型符号化决策过程实现的可解释列注释

Mengqi Wang, Jianwei Wang, Qing Liu, Xiwei Xu, Zhenchang Xing, Michael Bain, Liming Zhu, Wenjie Zhang

机构 * Data61, CSIRO(数据61,联邦科学与工业研究组织)

专题命中 知识编辑与模型理解 :LLM(title,abstract);分类 cs.CL

AI总结 研究针对列注释方法存在的问题,提出SymCA框架,通过大语言模型赋能,将其实现为全局到局部的符号决策过程,含全局骨架归纳和局部基质演化两组件,实验证明该框架准确、稳健且可解释,性能优于基线。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25164 2026-07-29 cs.CV cs.AI 新提交 79%

OrganLens: Organ-Specific Representation Learning for CT Foundation Models

OrganLens:用于CT基础模型的器官特异性表征学习

Zhixuan Ge, Anqi Li, Sadeer Al-Kindi, Hanwen Xu, Wei Qiu

机构 * Rice University(莱斯大学) University of Washington(华盛顿大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI

AI总结 研究针对CT检查中特定器官表征需求,提出OrganLens通过自监督学习,用器官标识调节共享编码器,经器官特异性蒸馏等方法获取器官特异性表征,在多数据集评估中提升指标,提供了可扩展方法和 reusable 框架。

Comments 16 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22712 2026-07-29 cs.CV cs.AI physics.optics 版本更新 79%

scMIR: a vision-language foundation model for single-cell light microscopy image representation

scMIR:用于单细胞光学显微镜图像表示的视觉语言基础模型

Yifan Shang, Jiahui Tan, Xiangxiang Zeng, Renjie Zhou

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI

AI总结 研究针对单细胞光学显微镜图像分析难题,提出scMIR模型,通过自监督图像重建与文本引导跨模态对齐,在多图像文本对上预训练,在多种复杂任务中表现出色,优于现有方法,具备强泛化能力,能推动高通量表型分析工作流程标准化和自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24750 2026-07-29 cs.CL cs.HC 新提交 77%

TimeCapsule: Generative Hallucination as a Method for Historical Sensemaking

时间胶囊:将生成性幻觉作为历史意义建构的一种方法

Hayk Grigorian, Hamed Yaghoobian

机构 * Muhlenberg College(Muhlenberg学院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 研究针对大语言模型在叙述过去时不可靠的问题,提出在维多利亚时代文本上训练的TimeCapsule模型,通过定量评估和定性探究展示其性能及问题,认为对未来的无知使幻觉成为对19世纪本体论的解释性探索。

Comments 10 pages, 4 figures. Accepted to Creativity and Cognition (C&C '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04465 2026-07-29 cs.CL cs.AI cs.LG 75%

Concept Tokens: Learning Behavioral Embeddings Through Concept Definitions

概念标记:通过概念定义学习行为嵌入

Ignacio Sastre, Aiala Rosá

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 Concept Tokens通过概念定义学习行为嵌入,能有效控制冻结语言模型的行为,减少幻觉并提升合规性。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 26501-26518, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25196 2026-07-29 cs.LG 新提交 70%

Rethinking CD: A Reproducibility Study and Extension on the Ineffectiveness of Contrastive Decoding at Mitigating Object Hallucinations in MLLMs

重新思考对比解码:关于多模态大语言模型中对比解码在减轻对象幻觉方面无效性的可重复性研究与扩展

Arnav Bendre, Guneesh Gupta, Kavish Grover, Chayan Aggarwal, Shreyansh Modi

机构 * Indian Institute of Technology, Roorkee(印度理工学院鲁尔基分校)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究多模态大语言模型中对比解码减轻对象幻觉的有效性,通过重现和扩展相关研究,进行多实验验证其在不同数据集上效果,发现其带来的改善常是虚假的,挑战了当前策略有效性,推动更可靠方法开发。

Comments 32 pages, 9 Figures, submitted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24875 2026-07-29 cs.LG 新提交 70%

FinAbstain: Uncertainty-Calibrated Multimodal RAG for Selective Financial Forecasting

FinAbstain:用于选择性金融预测的不确定性校准多模态检索增强生成模型

Dorothy Torres, Wei Cheng, Henan Huang

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对大语言模型在金融预测中证据不足时高置信度的问题,提出FinAbstain框架,通过多模态检索增强生成及选择性预测,经多种不确定性评估方法和指标评估,贡献了时间安全架构、复合不确定性公式和可重复评估蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏