arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 431 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 431 篇

2604.10048 2026-06-09 cs.IR 版本更新 75%

HARPO: Hierarchical Agentic Reasoning for User-Aligned Conversational Recommendation

HARPO:面向用户对齐的对话推荐的分层代理推理

Subham Raj, Aman Vaibhav Jha, Mayank Anand, Sriparna Saha

专题命中 领域大模型 :LLM(abstract,abstract_cn);preference optimization(abstract)

AI总结 HARPO通过分层代理推理框架优化多维推荐质量,结合上下文依赖的偏好学习、 deliberative树搜索和领域无关的推理抽象,提升推荐质量与用户对齐性。

Comments Accepted at the Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24481 2026-06-08 cs.AI cs.CL cs.LG 版本更新 75%

Multi-Agent Reasoning with Consistency Verification Improves Uncertainty Calibration in Medical MCQA

基于一致性验证的多智能体推理改进医学多项选择题问答中的不确定性校准

John Ray B. Martinez

机构 * Department of Data Science and Analytics(数据科学与分析系)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出多智能体框架,结合领域专家智能体与两阶段验证及S分数加权融合,在医学MCQA中显著降低校准误差并提升判别能力。

Comments 20 pages, 6 figures. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16742 2026-08-07 cs.AI cs.CL 版本更新 74%

CT Open: An Open-Access, Uncontaminated, Live Platform for the Open Challenge of Clinical Trial Outcome Prediction

CT Open: 一个开放获取、无污染、实时平台,用于临床试验结果预测的开放挑战

Jianyou Wang, Youze Zheng, Longtian Bao, Hanyuan Zhang, Qirui Zheng, Yuhan Chen, Yang Zhang, Matthew Feng, Maxim Khan, Aditya K. Sehgal, Christopher D. Rosin, Ramamohan Paturi, Umber Dube, Leon Bergen

机构 * Laboratory for Emerging Intelligence, University of California, San Diego(新兴智能实验室,加州大学圣地亚哥分校) Department of Dermatology, University of California, San Diego(皮肤科系,加州大学圣地亚哥分校) Elsevier

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI;language model(comments)

AI总结 本文介绍CT Open平台,通过开放挑战预测临床试验结果,采用自动化方法解决数据污染问题,提供训练集和测试基准,推动AI在现实结果预测中的应用。

Comments Published at Conference on Language Modeling (COLM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09538 2026-08-14 cs.CL cs.AI 版本更新 73%

TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Research Ability

TCS-BENCH:评估最先进生成式AI理论计算机科学研究能力的基准

Vincent Cohen-Addad, Dimitris Paparas, Ernest van Wijland, Max Springer, Julien Canitrot-Paradis, Honghao Lin, David Woodruff, Adarsh Kumarappan, Rajesh Jayaram, Rudrajit Das, Lalit Jain, Ola Svensson, Silvio Lattanzi, Mislav Balunovic, Theophane Weber, Vahab Mirrokni

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究人员推出TCS-Bench基准,基于STOC、FOCS、SODA论文的定理证明任务评估LLMs,结合验证智能体,参考验证器在专家标注集准确率超90%,为评估生成式AI的TCS研究能力提供工具

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17228 2026-08-14 cs.AI cs.LG 版本更新 73%

MatchMiner-AI: Open-source, Privacy-preserving Cancer Clinical Trial Matching using Artificial Intelligence

MatchMiner-AI:癌症临床试验匹配的开源解决方案

Jennifer Altreuter, Pavel Trukhanov, Morgan A. Paul, Michael J. Hassett, Irbaz B. Riaz, Muhammad Umar Afzal, Arshad A. Mohammed, Ayub Umair, Huan He, Chueh Husan Hsu, Sarah Sammons, James Lindsay, Emily Mallaber, Harry R. Klein, Gufran Gungor, Matthew Galvin, Michael Deletto, Sabrina Y. Camp, Stephen C. Van Nostrand, James Provencher, Joyce Yu, Naeem Tahir, Jonathan Wischhusen, Olga Kozyreva, Taylor Ortiz, Hande Tuncer, Jad El Masri, Alys Malcolm, Tali Mazor, Ethan Cerami, Kenneth L. Kehl

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 MatchMiner-AI通过开源平台基于合成EHR数据实现隐私保护的临床试验匹配AI解决方案,显著提升患者与试验匹配的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08849 2026-08-12 cs.CL cs.AI cs.DB cs.MA cs.SC 版本更新 73%

SatIR: Scalable High-Recall Constraint-Satisfaction-Based Information Retrieval for Clinical Trials Matching

SatIR:可扩展的高召回率约束满足基于信息检索的临床试验匹配

Zikai Zhou, Yufei Jin, Yilin Xu, Yu-Chiang Wang, Chieh-Ju Chao, Monica S. Lam

机构 * Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Samueli Electrical and Computer Engineering, UCLA(UCLA Samueli电气与计算机工程系) Department of Computer Science and Informatics, Emory University(埃默里大学计算机科学与信息学系) Mayo Clinic(梅奥诊所)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SatIR通过将临床试验资格条件和摘要转化为形式约束,结合SMT、关系代数和大语言模型,提升了临床试验匹配的召回率和效率,优于基于相似度的基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25459 2026-08-05 cs.CL cs.LG 版本更新 73%

SimulRAG: Simulator-based RAG for Grounding LLMs in Long-form Scientific QA

SimulRAG:基于模拟器的检索增强生成(RAG)框架,用于将大型语言模型(LLMs)落地到长篇科学问答任务中

Haozhou Xu, Dongxia Wu, Matteo Chinazzi, Ruijia Niu, Rose Yu, Yi-An Ma

机构 * University of California San Diego(加州大学圣迭戈分校) Stanford University(斯坦福大学) Northeastern University(东北大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对LLMs在长篇科学问答中易幻觉的问题,本文提出SimulRAG框架,引入UE+SBA机制,发布相关基准,实验表明其信息量与事实性较基线分别提升30.4%、16.3%

Comments Haozhou Xu and Dongxia Wu are co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07107 2026-08-04 cs.AI cs.CL 版本更新 73%

MENTOR: A Metacognition-Driven Self-Evolution Framework for Uncovering and Mitigating Implicit Domain Risks in LLMs

MENTOR: 一种元认知驱动的自我进化框架,用于发现和缓解大语言模型中的隐式领域风险

Liang Shan, Kaicheng Shen, Wen Wu, Zhenyu Ying, Chaochao Lu, Yan Teng, Jingqi Huang, Qingshan Liu, Guangze Ye, Guoqing Wang, Jie Zhou, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai AI Lab, Shanghai Innovation Institute(上海人工智能实验室,上海创新研究院)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在特定领域(如教育、金融、管理)中存在的隐式安全风险,提出基于元认知自我评估和动态规则知识图谱的MENTOR框架,通过激活级引导信号有效降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10647 2026-07-30 cs.CL cs.AI cs.CY cs.HC 版本更新 73%

The Reliability of LLMs for Medical Diagnosis: An Examination of Consistency, Manipulation, and Contextual Awareness

大语言模型在医疗诊断中的可靠性:一致性、可操纵性与情境感知能力的检验

Krishna Subedi

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究检验Google Gemini 2.0 Flash与OpenAI ChatGPT-4o的医疗诊断可靠性,发现二者虽一致性达100%,但易受无关信息操纵,且情境响应存在差异,提示其医疗应用需临床监督与结构化保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19341 2026-07-29 cs.LG cs.AI 版本更新 73%

Structured Scaling of AI Discovery Across Diverse Scientific Domains

基于评估的科学发现扩展

Haotian Ye, Haowei Lin, Jingyi Tang, Yizhen Luo, Rahul Thapa, Caiyin Yang, Chang Su, Rui Yang, Ruihua Liu, Rundao Li, Zeyu Li, Pengwei Sun, Chong Gao, Dachao Ding, Guangrong He, Miaolei Zhang, Lina Sun, Wenyang Wang, Yuchen Zhong, Zhuohao Shen, Puheng Li, Pan Lu, Bianxiao Cui, Di He, Jianzhu Ma, Junfeng Li, Hexi Baoyin, Yejin Choi, Stefano Ermon, Xiaowen Chu, Tongyang Li, Yuzhi Xu, James Zou

机构 * Wizard Intelligence Learning Lab, Stanford University(智能巫师学习实验室,斯坦福大学) Peking University(北京大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 领域大模型 :LLM(abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SimpleTES框架,通过并行探索、反馈驱动精炼和局部选择,提升评估驱动的发现循环效率,解决科学发现扩展问题,展示在21个科学问题上超越基线模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02722 2026-07-21 cs.AI cs.LG 版本更新 73%

Enhancing LLMs' Clinical Reasoning with Real-World Data from a Nationwide Sepsis Registry

利用全国脓毒症登记处的真实世界数据增强大语言模型的临床推理能力

Junu Kim, Chaeeun Shim, Sungjin Park, Su Yeon Lee, Gee Young Suh, Chae-Man Lim, Seong Jin Choi, Song Mi Moon, Kyoung-Ho Song, Eu Suk Kim, Hong Bin Kim, Sejoong Kim, Chami Im, Dong-Wan Kang, Yong Soo Kim, Hee-Joon Bae, Sung Yoon Lim, Han-Gil Jeong, Edward Choi

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Microsoft(微软) Asan Medical Center, University of Ulsan College of Medicine(釜山大学医学院阿桑医疗中心) Samsung Medical Center, Sungkyunkwan University School of Medicine(成均馆大学医学院三星医疗中心) Seoul National University Bundang Hospital, Seoul National University College of Medicine(首尔国立大学医学院首尔国立大学医院)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究旨在增强大语言模型临床推理能力,利用全国脓毒症登记处数据构建问题,通过强化学习微调模型得到C-Reason,该模型在域内测试集表现出色,推理能力能推广到不同任务和疾病,为开发通用临床推理模型提供思路。

Comments Accepted at MLHC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04593 2026-07-20 cs.IR cs.AI cs.CL 版本更新 73%

Ruling Out to Rule In: Contrastive Hypothesis Retrieval for Medical Question Answering

排除谬误以确认正确:面向医疗问答的对比假设检索

Byeolhee Kim, Min-Kyung Kim, Young-Hak Kim, Tae-Joon Jeon

机构 * Asan Medical Center(峨山医疗中心) Yonsei University(延世大学) University of Ulsan College of Medicine(蔚山大学医学院)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出对比假设检索框架CHR,通过生成正确和错误假设来提升医疗问答系统检索效果,实验显示在多个基准测试中优于现有方法,有效减少硬负样本污染。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13572 2026-07-17 cs.CL cs.AI 版本更新 73%

ArogyaSutra: A Multi-Agent Framework for Multimodal Medical Reasoning in Indic Languages

ArogyaSutra:面向印度语言的多模态医学推理的多智能体框架

Tanmoy Kanti Halder, Akash Ghosh, Subhadip Baidya, Arijit Roy, Sriparna Saha

机构 * Indian Institute of Technology Patna(印度理工学院巴特那分校) Indian Institute of Technology Kanpur(印度理工学院坎普尔分校) Prasannadeb Women’s College(普拉萨纳德布女子学院)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对印度语言医疗场景中多模态大语言模型性能不足的问题,提出多模态医学问答数据集ArogyaBodha和基于演员-评论家的多智能体框架ArogyaSutra,通过工具接地与双记忆机制提升多语言医学推理准确性。

Comments Accepted for publication in IJCAI,2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00761 2026-07-17 cs.AI cs.CL 版本更新 73%

L-MARS: Legal Multi-Agent System with Agentic Search and Citation-Faithfulness Audit

L-MARS:具有协调推理和代理搜索的法律多智能体工作流

Boqin Yuan, Ziqi Wang

机构 * University of Southern California(南加州大学) University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 L-MARS是一种多代理检索框架,通过分解查询为结构化子问题,利用代理网络搜索获取证据,并通过验证代理过滤结果,从而在法律问答中实现高准确率。

Comments Accepted at the AI4Law Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05510 2026-07-14 cs.AI cs.CL 版本更新 73%

Severity-Aware Curriculum Learning with Multi-Model Response Selection for Medical Text Generation

基于严重性感知的课程学习与多模型响应选择用于医疗文本生成

Ahmed Alansary, Molham Mohamed, Ali Hamdi

机构 * Faculty of Computer Science(计算机科学学院) MSA University(MSA大学) Giza, Egypt(埃及吉扎)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种结合课程学习策略和相关性响应选择的多模型框架,通过三阶段课程训练和五个大语言模型独立训练,在MAQA数据集上实现医疗文本生成性能提升。

Comments 6 pages, 3 figures, IMSA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22294 2026-07-13 cs.CL cs.AI 版本更新 73%

SLIDERS: Systematic Reviews via Automated Evidence Synthesis and Reconciliation

上下文从不够长:用于长文档集可扩展问答的结构化推理

Harshit Joshi, Priyank Shethia, Jadelynn Dao, Monica S. Lam

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出SLIDERS框架,通过结构化推理解决长文档集问答问题,利用关系数据库和SQL实现可扩展推理,优于现有基准。

Comments 53 pages (10 main), preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10886 2026-07-10 cs.LG cs.AI 版本更新 73%

LoKA: Low-precision Kernel Applications for Recommendation Models At Scale

LoKA:大规模推荐模型中的低精度核应用

Liang Luo, Yinbin Ma, Quanyu Zhu, Vasiliy Kuznetsov, Yuxin Chen, Neng Shi, Jian Jiao, Jiecao Yu, Buyun Zhang, Tongyi Tang, Xiaohan Wei, Yanli Zhao, Zeliang Chen, Yuchen Hao, Venkatesh Ranganathan, Sandeep Parab, Yantao Yao, Maxim Naumov, Chunzhi Yang, Shen Li, Ellie Wen, Wenlin Chen, Santanu Kolay, Chunqiang Tang

机构 * Meta AI

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 LoKA通过三个原则实现低精度计算在大规模推荐模型中的应用,包括在真实分布下评估安全区域、与硬件协同设计提升效率、以及跨核库调度最大化收益。

Comments Accepted to ISCA'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10946 2026-07-10 cs.IT cs.AI cs.LG eess.SP math.IT 版本更新 73%

ToDMA: Large Model-Driven Massive Token Communications for Semantic Multiple Access

ToDMA:用于语义多址接入的大模型驱动海量令牌通信

Li Qiao, Mahdi Boloursaz Mashhadi, Zhen Gao, Robert Schober, Deniz Gündüz

机构 * The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学) University of Surrey(Surrey大学) Friedrich-Alexander-University Erlangen-Nurnberg(埃森哲-亚琛工业大学) Imperial College London(伦敦帝国理工学院)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ToDMA,一种大模型驱动的语义多址接入方案,将无源随机接入与上下文感知令牌处理结合,用于海量令牌通信。通过压缩感知检测令牌及估计信道状态信息,利用上下文模型恢复冲突令牌,能降低接入延迟并保持令牌恢复与语义重建质量。

Comments Submitted to IEEE journals

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16065 2026-06-29 cs.LG cs.AI math.ST stat.ML stat.TH 版本更新 73%

Can Generative Artificial Intelligence Survive Data Contamination? Theoretical Guarantees under Contaminated Recursive Training

生成式人工智能能否在数据污染中幸存?污染递归训练下的理论保证

Kevin Wang, Hongqian Niu, Didong Li

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文首次严格证明在温和条件下,即使模型递归训练于自身生成的数据,仍能收敛到真实数据分布,并揭示了数据限制与模型限制之间的相变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09960 2026-06-26 cs.LG cs.AI 版本更新 73%

Limited Reference, Reliable Generation: A Two-Component Framework for Tabular Data Generation in Low-Data Regimes

有限参考,可靠生成:低数据场景下的表格数据生成双组件框架

Mingxuan Jiang, Keyang Chen, Yongxin Wang, Yongsheng Zhao, Ziyue Dai, Yicun Liu, Zeping Li, Qiuyang Zhang, Hongyi Nie, Hongbin Zhu, Sen Liu, Guangnan Ye, Hongfeng Chai

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) Institute of Financial Technology, Fudan University(复旦大学金融技术研究院) Northwestern Polytechnical University(西北工业大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出ReFine框架,通过从可解释模型提取符号规则嵌入提示引导生成,并采用双粒度过滤减少局部冗余,在低数据场景下实现稳健的表格数据生成,平均提升7.48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03476 2026-06-24 cs.LG cs.AI cs.MA cs.NA math.NA physics.comp-ph 版本更新 73%

ATHENA: Agentic Team for Hierarchical Evolutionary Numerical Algorithms

ATHENA:分层进化数值算法的智能团队

Juan Diego Toscano, Daniel T. Chen, George Em Karniadakis

机构 * Division of Applied Mathematics, Brown University(布朗大学应用数学系)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ATHENA通过知识驱动的诊断流程,实现科学计算与科学机器学习的自动化,结合专家蓝图和组合空间,生成高精度数值解和稳定求解器,达到10^-14的验证误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16378 2026-06-23 cs.CL cs.LG 版本更新 73%

Reciprocal Co-Training (RCT): Coupling Gradient-Based and Non-Differentiable Models via Reinforcement Learning

互惠协同训练(RCT):通过强化学习耦合基于梯度和非可微模型

Yunshuo Tian, Akayou Kitessa, Tanuja Chitnis, Yijun Zhao

机构 * Department of Computer and Information Science, Fordham University(福特汉姆大学计算机与信息科学系) Department of Neurology, Mass General Brigham(麻省总医院神经科)

专题命中 领域大模型 :LLM(abstract_cn);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出互惠协同训练框架,通过强化学习耦合大语言模型与随机森林分类器,实现双向适应,提升医疗数据集上两种模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13514 2026-06-23 cs.CL cs.AI 版本更新 73%

ProMed: Shapley Information Gain Guided Reinforcement Learning for Proactive Medical LLMs

ProMed:基于Shapley信息增益引导的强化学习用于主动式医疗大语言模型

Hongxin Ding, Baixiang Huang, Yue Fang, Weibin Liao, Xinke Jiang, Jinyang Zhang, Yinghao Zhu, Zheng Li, Liantao Ma, Junfeng Zhao, Yasha Wang

机构 * National Engineering Research Center of Software Engineering, Peking University, China(软件工程国家工程研究中心,北京大学,中国) School of Computer Science, Peking University, Beijing, China(北京大学计算机学院,北京,中国) Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) Peking University Information Technology Institute, Tianjin Binhai, China(北京大学信息技术研究所,天津滨海,中国) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出ProMed框架,通过Shapley信息增益奖励引导强化学习,使医疗大语言模型从被动回答转向主动提问,在部分信息医疗基准上平均提升6.29%。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18401 2026-06-16 cs.CL cs.AI 版本更新 73%

SkillsVote: Lifecycle Governance of Agent Skills from Collection, Recommendation to Evolution

SkillsVote: 代理技能的生命周期治理从收集、推荐到进化

Hongyi Liu, Haoyan Yang, Tao Jiang, Bo Tang, Feiyu Xiong, Yuyu Luo, Zhiyu Li

机构 * Harbin Institute of Technology(哈尔滨理工大学) Soochow University(苏州大学) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出SkillsVote框架,通过生命周期治理管理代理技能,从收集和推荐到进化,提升模型在终端基准和SWE-Bench Pro上的性能。

Comments 71 pages, 12 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11982 2026-06-11 astro-ph.IM cs.AI cs.CV cs.LG 版本更新 73%

Semantic search for 100M+ galaxy images using AI-generated captions

基于AI生成描述的1亿+星系图像语义搜索

Nolan Koblischke, Liam Parker, Francois Lanusse, Jo Bovy, Irina Espejo, Shirley Ho

机构 * New York University(纽约大学) University of Toronto(多伦多大学) Dunlap Institute for Astronomy & Astrophysics(达伦普天文与天体物理研究所) University of California, Berkeley(加州大学伯克利分校) Center for Data Science(数据科学中心) Lawrence Berkeley National Lab(伯克利国家实验室) Flatiron Institute(Flatiron研究所) Université Paris-Saclay(巴黎-萨克莱大学) CEA(法国原子能委员会) CNRS(法国国家科学研究中心) AIM(应用数学研究所) Princeton University(普林斯顿大学)

专题命中 领域大模型 :language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出利用视觉语言模型生成星系图像描述,并对比对齐预训练天文学基础模型,构建可搜索嵌入,实现大规模星系图像的语义搜索,在稀有现象发现上取得最先进性能。

Comments ApJ, in press

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22448 2026-07-29 cs.MA 版本更新 71%

Where Facts Go Missing: A Layerwise Taxonomy and Per-Layer Attribution of Information Omission in Air-Gapped LLMAgent Pipelines

事实缺失的地方:气隙式大语言模型智能体管道中信息遗漏的分层分类和逐层归因

Santhiya Rajan

专题命中 领域大模型 :LLM(title)

AI总结 研究气隙式大语言模型智能体管道中信息遗漏问题,提出九层分类法、归因方法、跨架构比较框架及运行时检测框架,经多模型多引擎试验,确定遗漏率及来源,为定位运营商干预位置提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23297 2026-07-29 cs.CV 版本更新 71%

PRIMA: Pre-Training with Risk-Integrated Image--Metadata Alignment for Medical Diagnosis with LLM-Based Feature Aggregation

PRIMA:通过大语言模型进行风险集成图像-元数据对齐的医学诊断预训练

Yiqing Wang, Chunming He, Ziyun Yang, Maria Woodward, Ming-Chen Lu, Mercy Pawar, Leslie Niziol, Sina Farsiu

机构 * Department of Biomedical Engineering, Duke University(杜克大学生物医学工程系) Department of Ophthalmology and Visual Sciences, University of Michigan(密歇根大学眼科与视觉科学系)

专题命中 领域大模型 :LLM(title)

AI总结 提出PRIMA框架,通过检索增强生成策展风险-疾病关联专家语料库优化文本编码器,用双编码器预训练策略及四个互补损失函数弥合模态差距,融合特征用于疾病分类,性能优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.08786 2026-08-17 cs.CY cs.AI 版本更新 70%

Why we need an AI-resilient society

为什么我们需要一个AI韧性社会

Thomas Bartz-Beielstein

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨AI对社会的影响,提出通过认知主权、可测量控制和部分自主性构建AI韧性框架,以应对AI带来的系统性风险。

Comments Version 3. 21 pages. For associated TEDx video, see this https URL (https://youtu.be/f6c2ngp7rqY)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09959 2026-08-14 physics.ao-ph cs.LG 版本更新 70%

AIFS-TC: A simple correction competitive with the operational frontier for tropical cyclone intensity forecasting

AIFS-TC:一种可与业务前沿水平媲美的热带气旋强度预报简单修正方法

Anna Allen, Wessel P. Bruinsma, Michael Maier-Gerber, Harrison Cook, Matthew Chantry, Richard E. Turner

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究提出AIFS-TC修正方法,基于开源AIFS-Single模型,可在12小时至7天时效内媲美业务前沿的热带气旋强度预报性能,且由Claude Fable 5自主设计,凸显智能体编码在预警系统研发中的潜力。

Comments 6 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19799 2026-08-14 cs.AI hep-lat 版本更新 70%

PhysMaster: Building an Autonomous AI Physicist for Theoretical and Computational Physics Research

PhysMaster:构建一个自主的AI物理学家用于理论和计算物理学研究

Tingjia Miao, Wenkai Jin, Jinxin Tan, Muhua Zhang, Xianghe Pang, Zexi Liu, Yuwen Du, Tian Jin, Tu Guo, Zhengliang Zhang, Jingkun Liu, Yuelin Hu, Jiejun Zhang, Yunjie Huang, Yuhan Wang, Wenbo Li, Yinuo Gao, Shuo Chen, Rui Ye, Yuzhi Zhang, Linfeng Zhang, Kun Chen, Wei Wang, Weinan E, Siheng Chen

机构 * School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) School of Physics and Astronomy(物理天文学院) State Key Laboratory of Dark Matter Physics(暗物质物理国家重点实验室) Tsung-Dao Lee Institute(李政道研究所) Zhiyuan College(智源学院) Institute of Theoretical Physics(理论物理研究所) Chinese Academy of Sciences(中国科学院) DP Technology(DP技术)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 PhysMaster通过结合抽象推理与数值计算,利用LANDAU数据宇宙提升决策可靠性,实现理论与计算物理学研究的自动化与自主发现。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏