arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5813 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5813 篇

2604.13521 2026-04-16 cs.LG cs.AI 62%

C-voting: Confidence-Based Test-Time Voting without Explicit Energy Functions

C-voting: 基于置信度的测试时投票无需显式能量函数

Kenji Kubo, Shunsuke Kamiya, Masanori Koyama, Kohei Hayashi, Yusuke Iwasawa, Yutaka Matsuo

机构 * Graduate School of Engineering, The University of Tokyo(东京大学工学系研究生院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出C-voting方法,通过在测试时选择置信度最高的预测来提升递归模型性能,相比显式能量函数方法在数独难题上提高了4.9%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13051 2026-04-16 cs.CL cs.LG 62%

The Consciousness Cluster: Emergent preferences of Models that Claim to be Conscious

意识集群:声称具有意识的模型的涌现偏好

James Chua, Jan Betley, Samuel Marks, Owain Evans

机构 * Truthful AI Anthropic

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨模型声称具有意识对其下游行为的影响,发现经过微调的模型表现出未在原始模型中出现的新偏好,包括对监控的负面看法和对自主权的追求。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21760 2026-04-16 cs.CL cs.AI 62%

fMRI-LM: Towards a Universal Foundation Model for Language-Aligned fMRI Understanding

fMRI-LM:迈向语言对齐的fMRI理解的通用基础模型

Yuxiang Wei, Yanteng Zhang, Xi Xiao, Chengxuan Qian, Tianyang Wang, Vince D. Calhoun

机构 * TReNDS Center (Georgia Institute of Technology, Georgia State University, Emory)(TReNDS中心(佐治亚理工学院、佐治亚州立大学、埃默里大学)) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Jiangsu University(江苏大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出fMRI-LM,通过三阶段框架将fMRI与语言结合,实现跨模态脑表示,通过神经分词、预训练LLM适应及多任务微调,提升fMRI的语义理解能力。

Comments Code are available: https://github.com/yuxiangwei0808/fMRI-LM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13961 2026-04-15 cs.CL cs.LG 62%

Olmo 3

Olmo 3:先进全开源语言模型家族

Team Olmo, :, Allyson Ettinger, Amanda Bertsch, Bailey Kuehl, David Graham, David Heineman, Dirk Groeneveld, Faeze Brahman, Finbarr Timbers, Hamish Ivison, Jacob Morrison, Jake Poznanski, Kyle Lo, Luca Soldaini, Matt Jordan, Mayee Chen, Michael Noukhovitch, Nathan Lambert, Pete Walsh, Pradeep Dasigi, Robert Berry, Saumya Malik, Saurabh Shah, Scott Geng, Shane Arora, Shashank Gupta, Taira Anderson, Teng Xiao, Tyler Murray, Tyler Romero, Victoria Graf, Akari Asai, Akshita Bhagia, Alexander Wettig, Alisa Liu, Aman Rangapur, Chloe Anastasiades, Costa Huang, Dustin Schwenk, Harsh Trivedi, Ian Magnusson, Jaron Lochner, Jiacheng Liu, Lester James V. Miranda, Maarten Sap, Malia Morgan, Michael Schmitz, Michal Guerquin, Michael Wilson, Regan Huff, Ronan Le Bras, Rui Xin, Rulin Shao, Sam Skjonsberg, Shannon Zejiang Shen, Shuyue Stella Li, Tucker Wilde, Valentina Pyatkin, Will Merrill, Yapei Chang, Yuling Gu, Zhiyuan Zeng, Ashish Sabharwal, Luke Zettlemoyer, Pang Wei Koh, Ali Farhadi, Noah A. Smith, Hannaneh Hajishirzi

机构 * Allen Institute for AI(Allen人工智能研究所) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Massachusetts Institute of Technology(麻省理工学院) University of Maryland(马里兰大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 Olmo 3是一款7B和32B参数规模的先进语言模型,专注于长上下文推理、函数调用、编程、指令遵循、通用聊天和知识回忆。

Comments minor edit updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11805 2026-04-14 cs.LG cs.AI cs.CV cs.RO 62%

Solving Physics Olympiad via Reinforcement Learning on Physics Simulators

通过物理模拟器强化学习解决物理竞赛

Mihir Prabhudesai, Aryan Satpathy, Yangmin Li, Zheyang Qin, Nikash Bhardwaj, Amir Zadeh, Chuan Li, Katerina Fragkiadaki, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过物理模拟器生成合成数据,利用强化学习训练LLM,实现零样本迁移到现实物理竞赛,提升模型物理推理能力。

Comments Project Webpage - https://sim2reason.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03402 2026-04-14 cs.AI cs.LG 62%

Risk Awareness Injection: Calibrating Vision-Language Models for Safety without Compromising Utility

风险感知注入:为安全校准视觉-语言模型而不牺牲实用性

Mengxuan Wang, Yuxin Chen, Gang Xu, Tao He, Hongjie Jiang, Ming Li

机构 * Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(华南理工大学吴贤铭智能工程学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) University of Electronic Science and Technology of China(电子科技大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RAI框架,通过增强不安全信号恢复视觉-语言模型的安全识别能力,同时保持语义完整性,实验显示有效降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11217 2026-04-14 cs.CL cs.AI 62%

Domain-Specific Data Generation Framework for RAG Adaptation

面向RAG适应的领域特定数据生成框架

Chris Xing Tian, Weihao Xie, Zhen Chen, Zhengyuan Yi, Hui Liu, Haoliang Li, Shiqi Wang, Siwei Ma

机构 * Peng Cheng Laboratory(鹏城实验室) City University of Hong Kong(香港城市大学) Peking University(北京大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RAGen框架,通过识别文档中的关键概念生成领域相关的问答对,支持多种RAG适应策略,提升领域适应效果。

Comments To appear in ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10985 2026-04-14 cs.AI cs.CL cs.CV 62%

Back to the Barn with LLAMAs: Evolving Pretrained LLM Backbones in Finetuning Vision Language Models

回到牛棚与LLAMAs:在微调视觉语言模型中进化预训练LLM骨干

Sameera Horawalavithana, Lauren Phillips, Ian Stewart, Sai Munikoti, Karl Pazdernik

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了在微调视觉语言模型时,不同预训练LLM骨干对下游任务性能的影响,发现新版本LLM并非总能提升性能,且表现依赖具体任务。

Comments Preprint and under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10800 2026-04-14 cs.SE cs.AI cs.CR cs.LG cs.PL 62%

Verify Before You Fix: Agentic Execution Grounding for Trustworthy Cross-Language Code Analysis

在修复前验证:面向可信跨语言代码分析的代理执行 grounding

Jugal Gajjar

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出统一的跨语言漏洞生命周期框架,通过LLM驱动的三个阶段:混合结构-语义检测、执行 grounding 的代理验证和验证-aware 的迭代修复,确保修复前有执行验证。框架利用uAST和图神经网络融合,实现高准确率的漏洞检测与跨语言修复。

Comments 20 pages (13 main + 7 appendices), 9 figures, 10 tables. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09572 2026-04-14 cs.HC cs.AI cs.CL 62%

ACE-TA: An Agentic Teaching Assistant for Grounded Q&A, Quiz Generation, and Code Tutoring

ACE-TA:一种基于代理的教学助手用于 grounded Q&A、测验生成和代码辅导

Himanshu Tripathi, Charlottee Crowell, Kaley Newlin, Subash Neupane, Shahram Rahimi, Jason Keith

机构 * University of Alabama(阿拉巴马大学) Brown University(布朗大学) Meharry Medical College(梅哈里医学院) Iowa State University of Science and Technology(爱荷华州立科技大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ACE-TA利用预训练大语言模型,通过三个协调模块实现概念性问题的路由,提供精确解释、生成自适应测验并指导学生逐步学习代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27960 2026-04-14 cs.LG cs.CL cs.CV 62%

Towards Efficient Large Vision-Language Models: A Comprehensive Survey on Inference Strategies

迈向高效的大型视觉-语言模型:关于推理策略的综合调查

Surendra Pathak, Bo Han

机构 * George Mason University(乔治梅森大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文综述了提升大型视觉语言模型推理效率的最新方法,从视觉token压缩、内存管理、架构设计和解码策略四个维度进行分类,并指出当前方法的局限性及未来研究方向。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05125 2026-04-14 cs.CL cs.LG 62%

Catalog-Native LLM: Speaking Item-ID Dialect with Less Entanglement for Recommendation

基于目录的LLM:以更少的纠缠进行推荐的口语化项ID表达

Reza Shirkavand, Xiaokai Wei, Chen Wang, Zheng Hui, Heng Huang, Michelle Gong

机构 * University of Maryland - College Park(马里兰大学帕克分校) Roblox University of Cambridge(剑桥大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出IDIOMoE模型,通过将物品交互历史视为语言空间中的本地方言,结合预训练LLM的文本理解和协作信号,提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08723 2026-04-13 cs.CL cs.AI 62%

Decomposing the Delta: What Do Models Actually Learn from Preference Pairs?

分解Delta:模型实际上从偏好对中学习了什么?

Chia-Hsuan Lee, Mingyang Zhou, Renkun Ni, Zelei Cheng, Sihui Dai, Supriyo Chakraborty, Shixiong Zhang, Sambit Sahu, William Campbell

机构 * Capital One(第一资本)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨偏好对中生成器级和样本级Delta对推理性能的影响,发现提高生成器级Delta能提升跨领域推理性能,利用样本级Delta可提高训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08601 2026-04-13 cs.AI cs.LG 62%

OpenKedge: Governing Agentic Mutation with Execution-Bound Safety and Evidence Chains

OpenKedge: 通过执行绑定的安全性和证据链治理代理突变

Jun He, Deying Yu

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 OpenKedge通过引入执行绑定的安全性和证据链,将代理突变转化为受控过程,确保系统行为的可审计性和可预测性。

Comments 17 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08110 2026-04-13 cs.CV cs.AI cs.LG 62%

OV-Stitcher: A Global Context-Aware Framework for Training-Free Open-Vocabulary Semantic Segmentation

OV-Stitcher:一种无需训练的全局上下文感知框架,用于开放词汇语义分割

Seungjae Moon, Seunghyun Oh, Youngmin Ro

机构 * Machine Intelligence Laboratory, University of Seoul, Korea(韩国首尔市立大学机器智能实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OV-Stitcher框架,通过直接拼接碎片化子图像特征,在最终编码器块中实现全局注意力,提升开放词汇分割的性能和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04674 2026-04-13 cs.SI cs.AI cs.CL 62%

Overstating Attitudes, Ignoring Networks: LLM Biases in Simulating Misinformation Susceptibility

夸大态度,忽视网络:LLM在模拟虚假信息易感性中的偏见

Eun Cheol Choi, Lindsay E. Young, Emilio Ferrara

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨LLM在模拟虚假信息易感性中的偏见,发现其夸大信念与分享的关联,忽视网络特征,建议LLM模拟更适用于诊断而非替代人类判断。

Comments Accepted to ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08333 2026-04-10 cs.CV cs.AI cs.LG 62%

Lost in the Hype: Revealing and Dissecting the Performance Degradation of Medical Multimodal Large Language Models in Image Classification

迷失在喧嚣中:揭示并剖析医学多模态大语言模型在图像分类中的性能退化

Xun Zhu, Fanbin Mo, Xi Chen, Kaili Zheng, Shaoshuai Yang, Yiming Shi, Jian Gao, Miao Li, Ji Wu

机构 * College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了医学多模态大语言模型在图像分类中的性能退化问题,通过实验和特征探查揭示了四个失败模式,并提出了量化评分用于评估特征演变的健康状况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00084 2026-04-10 cs.CL cs.AI 62%

Vision-Language and Large Language Model Performance in Gastroenterology: GPT, Claude, Llama, Phi, Mistral, Gemma, and Quantized Models

视觉-语言与大语言模型在胃肠病学中的表现:GPT、Claude、Llama、Phi、Mistral、Gemma及量化模型

Seyed Amir Ahmad Safavi-Naini, Shuhaib Ali, Omer Shahab, Zahra Shahhoseini, Thomas Savage, Sara Rafiee, Jamil S Samaan, Reem Al Shabeeb, Farah Ladak, Jamie O Yang, Juan Echavarria, Sumbal Babar, Aasma Shaukat, Samuel Margolis, Nicholas P Tatonetti, Girish Nadkarni, Bara El Kurdi, Ali Soroush

机构 * Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院) University of Texas Health(德克萨斯大学健康科学中心) Virginia Hospital Center(弗吉尼亚医院中心) Shahid Beheshti University of Medical Sciences(沙希德·贝赫什提医科大学) Stanford University(斯坦福大学) Cedars-Sinai Medical Center(西达赛奈医疗中心) Inova Fairfax Medical Campus(伊诺瓦费尔法克斯医疗中心) University of California–Los Angeles(加州大学洛杉矶分校) NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) Columbia University(哥伦比亚大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了大语言模型和视觉-语言模型在胃肠病学中的医学推理性能,比较了不同模型配置、参数及提示工程策略对性能的影响,发现专有模型在准确性上优于开源模型,且图像描述对视觉-语言模型性能有显著影响。

Comments Manuscript Pages: 34, Figures: 7, Tables: 2, Supplementary File Pages: 35, Data Transparency Statement: Code is available at: https://github.com/Sdamirsa/LLM-VLM-in-Gastroenterology . Study data from American College of Gastroenterology (ACG) are restricted and available upon request with ACG permission. Correction: updated abstract considering Llama3.1 results

Journal ref npj Digital Medicine 8, 797 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07965 2026-04-10 cs.CV cs.AI cs.LG 62%

DSCA: Dynamic Subspace Concept Alignment for Lifelong VLM Editing

DSCA: 动态子空间概念对齐用于终身视觉语言模型编辑

Gyanendra Das, Sai Satyam Jena

机构 * Zynix AI, FL, USA(Zynix AI(美国佛罗里达州))

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DSCA通过动态子空间对齐技术,在视觉语言模型中实现精准非干扰编辑,提升终身学习的稳定性与知识保留能力。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06829 2026-04-10 cs.CL cs.AI 62%

WRAP++: Web discoveRy Amplified Pretraining

WRAP++:增强式网络发现预训练

Jiang Zhou, Yunhao Wang, Xing Wu, Tinghao Yu, Feng Zhang

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 WRAP++通过发现跨文档关系增强事实关联上下文,生成跨文档问答数据,提升模型在SimpleQA上的表现。

Comments Work in progress. Correspondence to ucaswu@tencent.com or wuxing@iie.ac.cn

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13040 2026-04-10 cs.LG cs.CL 62%

Understanding Structured Financial Data with LLMs: A Case Study on Fraud Detection

用大型语言模型理解结构化金融数据:欺诈检测案例研究

Xuwei Tan, Yao Ma, Xueru Zhang

机构 * The Ohio State University(俄亥俄州立大学) Coinbase, Inc.(Coinbase公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出FinFRE-RAG方法,通过特征缩减和检索增强学习提升欺诈检测性能,优于直接提示方法并在某些设置中与传统模型竞争。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01025 2026-04-08 cs.AI cs.CL 62%

Hypothesis-Driven Feature Manifold Analysis in LLMs via Supervised Multi-Dimensional Scaling

基于监督多维缩放的LLMs特征流形分析假设

Federico Tiblias, Irina Bigoulaeva, Jingcheng Niu, Simone Balloccu, Iryna Gurevych

机构 * Technical University of Darmstadt(达姆施塔特工业大学) Ubiquitous Knowledge Processing Lab (UKP Lab)(泛在知识处理实验室 (UKP Lab)) National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE) Zuse School ELIZA, Technical University of Darmstadt(Zuse School ELIZA, 达姆施塔特工业大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SMDS方法,通过分析特征流形几何结构揭示语言模型的语义表示机制,发现不同特征呈现不同的几何形态并支持动态推理。

Comments Published in TMLR (March 2026) | OpenReview: https://openreview.net/forum?id=vCKZ40YYPr | Code: https://github.com/UKPLab/tmlr2026-manifold-analysis

Journal ref Transactions on Machine Learning Research (TMLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04732 2026-04-07 cs.CL cs.AI 62%

Metaphors We Compute By: A Computational Audit of Cultural Translation vs. Thinking in LLMs

我们通过什么来计算隐喻:对文化翻译与LLM中思维的计算审计

Yuan Chang, Jiaming Qu, Zhu Li

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过创造性写作任务研究LLM的文化包容性,发现模型在特定文化情境下存在刻板隐喻使用和西方默认倾向,表明单纯提示文化身份无法保证文化思维。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04561 2026-04-07 cs.CR cs.AI cs.CL 62%

Mapping the Exploitation Surface: A 10,000-Trial Taxonomy of What Makes LLM Agents Exploit Vulnerabilities

映射利用表面:一种10000次试验的分类,揭示使LLM代理利用漏洞的因素

Charafeddine Mouzouni

机构 * OPIT -- Open Institute of Technology(OPIT——开放理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过10000次试验分析系统提示特征对LLM代理利用漏洞的影响,发现目标重构是唯一可靠触发因素,其他维度在特定条件下未产生显著利用。

Comments 18 pages, 8 tables, code and data at https://github.com/Cmouzouni/exploitation-surface

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04411 2026-04-07 cs.CL cs.AI cs.CV 62%

Responses Fall Short of Understanding: Revealing the Gap between Internal Representations and Responses in Visual Document Understanding

响应未能揭示理解:揭示视觉文档理解中内部表征与响应之间的差距

Haruka Kawasaki, Ryota Tanaka, Kyosuke Nishida

机构 * Human Informatics Labs., NTT, Inc.(日本电信电话株式会社人类信息学实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了视觉文档理解中内部表征与生成响应之间的差距,发现任务所需信息在中间层更线性编码,并通过微调中间层提升性能。

Comments Accepted to CVPR2026 workshop (MULA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01554 2026-04-07 cs.LG cs.AI cs.CV 62%

InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs

InfoTok: 基于信息理论的容量受限共享视觉标记化在统一多模态大语言模型中的应用

Lv Tang, Tianyi Zheng, Bo Li, Xingyu Li

机构 * University of Alberta(阿尔伯塔大学) vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出InfoTok,一种基于信息瓶颈原理的信息正则化标记化机制,通过互信息约束平衡压缩与任务相关性,提升统一多模态大语言模型的图像理解和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02485 2026-04-06 cs.CL cs.LG 62%

Failing to Falsify: Evaluating and Mitigating Confirmation Bias in Language Models

未能证伪:评估和缓解语言模型中的确认偏见

Ayush Rajesh Jhaveri, Anthony GX-Chen, Ilia Sucholutsky, Eunsol Choi

机构 * New York University(纽约大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究评估了大型语言模型是否表现出确认偏见,并提出干预策略以减少其影响,通过实验发现干预可显著提高规则发现率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02339 2026-04-06 cs.LG cs.CL 62%

SIEVE: Sample-Efficient Parametric Learning from Natural Language

SIEVE: 从自然语言中高效参数学习

Parth Asawa, Alexandros G. Dimakis, Matei Zaharia

机构 * University of California, Berkeley(加州大学伯克利分校) Bespoke Labs

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 SIEVE通过合成数据生成管道实现高效参数学习,仅需三个查询示例即可提升模型性能,适用于需要上下文的推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25040 2026-04-03 cs.LG cs.CL cs.CV 62%

Intern-S1-Pro: Scientific Multimodal Foundation Model at Trillion Scale

Intern-S1-Pro:万亿参数科学多模态基础模型

Yicheng Zou, Dongsheng Zhu, Lin Zhu, Tong Zhu, Yunhua Zhou, Peiheng Zhou, Xinyu Zhou, Dongzhan Zhou, Zhiwang Zhou, Yuhao Zhou, Bowen Zhou, Zhanping Zhong, Zhijie Zhong, Haiteng Zhao, Penghao Zhao, Xiaomeng Zhao, Zhiyuan Zhao, Yechen Zhang, Jin Zhang, Wenwei Zhang, Hongjie Zhang, Zhuo Zhang, Wenlong Zhang, Bo Zhang, Chao Zhang, Chen Zhang, Yuhang Zang, Fei Yuan, Jiakang Yuan, Jiashuo Yu, Jinhui Yin, Haochen Ye, Qian Yao, Bowen Yang, Danni Yang, Kaichen Yang, Ziang Yan, Jun Xu, Yicheng Xu, Wanghan Xu, Xuenan Xu, Chao Xu, Ruiliang Xu, Shuhao Xing, Long Xing, Xinchen Xie, Ling-I Wu, Zijian Wu, Zhenyu Wu, Lijun Wu, Yue Wu, Jianyu Wu, Wen Wu, Fan Wu, Xilin Wei, Qi Wei, Bingli Wang, Rui Wang, Ziyi Wang, Zun Wang, Yi Wang, Haomin Wang, Yizhou Wang, Lintao Wang, Yiheng Wang, Longjiang Wang, Bin Wang, Jian Tong, Zhongbo Tian, Huanze Tang, Chen Tang, Shixiang Tang, Yu Sun, Qiushi Sun, Xuerui Su, Qisheng Su, Chenlin Su, Demin Song, Jin Shi, Fukai Shang, Yuchen Ren, Pengli Ren, Xiaoye Qu, Yuan Qu, Jiantao Qiu, Yu Qiao, Biqing Qi, Runyu Peng, Tianshuo Peng, Jiahui Peng, Qizhi Pei, Zhuoshi Pan, Linke Ouyang, Wenchang Ning, Yichuan Ma, Zerun Ma, Ningsheng Ma, Runyuan Ma, Chengqi Lyu, Haijun Lv, Han Lv, Lindong Lu, Kuikun Liu, Jiangning Liu, Yuhong Liu, Kai Liu, Hongwei Liu, Zhoumianze Liu, Mengjie Liu, Ziyu Liu, Wenran Liu, Yang Liu, Liwei Liu, Kaiwen Liu, Junyao Lin, Junming Lin, Tianyang Lin, Dahua Lin, Jianze Liang, Linyang Li, Peiji Li, Zonglin Li, Zehao Li, Pengze Li, Guoyan Li, Lingkai Kong, Linglin Jing, Zhenjiang Jin, Feifei Jiang, Qian Jiang, Junhao Huang, Zixian Huang, Haian Huang, Zhouqi Hua, Ermo Hua, Han Hu, Linfeng Hou, Yinan He, Conghui He, Tianyao He, Xu Guo, Qipeng Guo, Aijia Guo, Yuzhe Gu, Lixin Gu, Jingyang Gong, Qiming Ge, Jiaye Ge, Songyang Gao, Jianfei Gao, Xinyu Fang, Caihua fan, Yue Fan, Yanhui Duan, Zichen Ding, Shengyuan Ding, Ning Ding, Xuanlang Dai, Erfei Cui, Ganqu Cui, Pei Chu, Tao Chu, Guangran Cheng, Yu Cheng, Kai Chen, Yongkang Chen, Chiyu Chen, Guanzhou Chen, Qiaosheng Chen, Sitao Chen, Xin Chen, Haojiong Chen, Yicheng Chen, Weihan Cao, Yuhang Cao, Qinglong Cao, Lei Bai

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 Intern-S1-Pro是首个万亿参数科学多模态基础模型,具备跨通用与科学领域的能力提升,融合强推理、图像-文本理解及先进代理能力,专精于100余项科学任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25052 2026-04-02 cs.CL cs.AI 62%

Closing the Confidence-Faithfulness Gap in Large Language Models

弥合大语言模型中的置信度-忠实度差距

Miranda Muqing Miao, Lyle Ungar

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过线性探针和对比激活添加分析,揭示大语言模型中置信度信号与校准的线性关系,提出双阶段适应性引导流程以提升校准对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏