arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-24 至 2026-03-24 共收录 90 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 90 篇

2512.19735 2026-03-24 cs.LG 92%

Improving Fairness of Large Language Model-Based ICU Mortality Prediction via Case-Based Prompting

通过基于案例的提示提升基于大语言模型的ICU死亡预测公平性

Gangxiong Zhang, Yongchao Long, Yuxi Zhou, Yong Zhang, Shenda Hong

机构 * School of Computer Science and Engineering, Tianjin University of Technology, Tianjin, China(天津理工大学计算机科学与工程学院) Institute for Artificial Intelligence, Peking University, Beijing, China(北京大学人工智能研究院) DCST, BNRist, RIIT, Institute of Internet Industry, Tsinghua University, Beijing, China(清华大学信息产业研究院) National Institute of Health Data Science, Peking University, Beijing, China(北京大学健康数据科学国家研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

AI总结 本文提出一种临床适应性提示框架,通过整合去偏策略和历史误判案例,提升ICU死亡预测的公平性和性能,实验显示AUROC和AUPRC显著提升,预测差异大幅减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21022 2026-03-24 cs.AI cs.CL cs.LG 90%

Knowledge Boundary Discovery for Large Language Models

大型语言模型的知识边界发现

Ziquan Wang, Zhongqi Lu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出KBD框架,通过强化学习探索LLM的知识边界,通过自动生成可答与不可答问题识别边界,验证了方法的有效性。

Comments 9 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22214 2026-03-24 cs.CR cs.AI cs.LG 90%

Evaluating the Reliability and Fidelity of Automated Judgment Systems of Large Language Models

评估大型语言模型自动判断系统的可靠性和准确性

Tom Biskupski, Stephan Kleber

机构 * Ravensburg-Weingarten University of Applied Sciences(拉文堡-魏金根应用科学大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文评估了大型语言模型作为自动质量评估器的适用性,通过测试37种不同规模的对话型LLM与5种不同判断提示的组合,展示了其在特定任务中与人类评估的高相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17561 2026-03-24 cs.CL cs.AI 90%

LexInstructEval: Lexical Instruction Following Evaluation for Large Language Models

LexInstructEval: 用于大语言模型的词汇指令遵循评估

Huimin Ren, Yan Liang, Baiqiao Su, Chaobo Sun, Hengtong Lu, Kaike Zhang, Chen Wei

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LexInstructEval,通过形式化规则语法系统,系统生成多样化数据集并提供透明评估工具,以评估大语言模型对复杂词汇指令的遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08626 2026-03-24 cs.LG cs.RO 89%

RoboMorph: Evolving Robot Morphology using Large Language Models

RoboMorph: 使用大语言模型进化机器人形态

Kevin Qiu, Władysław Pałucki, Krzysztof Ciebiera, Paweł Fijałkowski, Marek Cygan, Łukasz Kuciński

机构 * University of Warsaw(华沙大学) IDEAS NCBR Nomagic Polish Academy of Sciences(波兰科学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG

AI总结 RoboMorph利用大语言模型和进化算法自动生成和优化模块化机器人设计,通过结构化语法探索设计空间,结合最佳-shot提示策略和强化学习评估,在四种地形中发现多种适应性形态,展示LLM与进化选择结合的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20313 2026-03-24 cs.SE cs.AI 89%

Semantic Tool Discovery for Large Language Models: A Vector-Based Approach to MCP Tool Selection

面向大语言模型的语义工具发现:基于向量的方法用于MCP工具选择

Sarat Mudunuri, Jian Wan, Ally Qin, Srinivasan Manoharan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出基于向量检索的语义工具发现架构,通过语义索引和动态选择机制,显著降低工具调用的token消耗,提升效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20204 2026-03-24 cs.CY cs.AI 89%

Measuring Research Convergence in Interdisciplinary Teams Using Large Language Models and Graph Analytics

利用大型语言模型和图分析测量跨学科团队中的研究收敛性

Wenwen Li, Yuanyuan Tian, Sizhe Wang, Amber Wutich, Paul Westerhoff, Sarah Porter, Anais Roque, Jobayer Hossain, Patrick Thomson, Rhett Larson, Michael Hanemann

机构 * School of Geographical Sciences and Urban Planning, Arizona State University, Tempe, AZ(地理科学与城市规划学院,亚利桑那州立大学,Tempe, AZ) School of Human Evolution and Social Change, Arizona State University, Tempe, AZ(人类进化与社会变革学院,亚利桑那州立大学,Tempe, AZ) School of Sustainable Engineering and the Built Environment, Arizona State University, Tempe, AZ(可持续工程与环境学院,亚利桑那州立大学,Tempe, AZ) Kyl Center for Water Policy, Arizona State University, Tempe, AZ(水政策凯尔中心,亚利桑那州立大学,Tempe, AZ) Nicholas School of the Environment, Duke University, Durham, NC(环境学院,杜克大学,Durham, NC) Sandra Day O'Connor College of Law, Arizona State University, Tempe, AZ(索尔·达·奥康纳法学院,亚利桑那州立大学,Tempe, AZ) Center for Environmental Economics and Sustainability Policy, School of Sustainability, Arizona State University, Tempe, AZ(环境经济学与可持续政策中心,可持续性学院,亚利桑那州立大学,Tempe, AZ)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出一种多层AI驱动框架,通过大型语言模型、图可视化和人类在回路评估,分析跨学科团队研究观点的共享、影响与整合,展示其在研究收敛性分析中的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15093 2026-03-24 eess.SP cs.IT math.IT 89%

Beam Prediction Based on Multimodal Large Language Models

基于多模态大语言模型的波束预测

Tianhao Mao, Le Liang, Jie Yang, Xiao Li, Shi Jin, Geoffrey Ye Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出基于多模态大语言模型的波束预测框架,通过融合RGB图像和LiDAR点云等异构数据,提升动态环境下波束预测精度与通信性能,实验表明其在波束准确性和通信性能上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20514 2026-03-24 cs.CL cs.AI 88%

Evaluating Large Language Models on Historical Health Crisis Knowledge in Resource-Limited Settings: A Hybrid Multi-Metric Study

在资源有限环境中评估大型语言模型对历史健康危机知识的评估:一种混合多指标研究

Mohammed Rakibul Hasan

机构 * organization= Department of Electrical \& Computer Engineering , addressline= North South University , city= Dhaka , country= Bangladesh

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究评估GPT-4、Gemini Pro、Llama 3和Mistral-7B在低资源环境下对新冠、登革热、尼帕病毒和登革热等健康危机问题的处理能力,通过语义相似度、专家评估和NLI方法分析模型表现,揭示LLM在流行病学历史和健康危机知识表示中的优缺点。

Comments Comments: 20 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20882 2026-03-24 cs.IR cs.AI cs.CL cs.LG 88%

RubricRAG: Towards Interpretable and Reliable LLM Evaluation via Domain Knowledge Retrieval for Rubric Generation

RubricRAG: 通过领域知识检索实现可解释且可靠的LLM评估

Kaustubh D. Dhole, Eugene Agichtein

机构 * Department of Computer Science(计算机科学系) Emory University(埃默里大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出RubricRAG,通过领域知识检索生成可解释的评估 rubric,提升LLM评估的透明性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14395 2026-03-24 cs.AI 88%

Massive Editing for Large Language Models Based on Dynamic Weight Generation

基于动态权重生成的大型语言模型大规模编辑

Wentao Wan, Qiqing Lao, Zhiwei Xie, Hefeng Wu, Runnan Lin, Liang Lin, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出基于动态权重生成的大型语言模型大规模编辑方法,通过动态权重神经元提升知识编辑的可靠性、通用性和局部性指标。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14977 2026-03-24 cs.RO cs.AI 87%

SVBRD-LLM: Self-Verifying Behavioral Rule Discovery for Autonomous Vehicle Identification

SVBRD-LLM:自主车辆识别的自验证行为规则发现

Xiangyu Li, Tianyi Wang, Junfeng Jiao, Christian Claudel, Zhaomiao Guo

机构 * Fariborz Maseeh Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校土木、建筑与环境工程学院) School of Architecture, The University of Texas at Austin(德克萨斯大学奥斯汀分校建筑学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出SVBRD-LLM框架,通过零样本大语言模型提取可解释的行为规则,用于自主车辆识别,实现了90.0%的准确率和93.3%的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27543 2026-03-24 cs.CL cs.AI 86%

DialectalArabicMMLU: Benchmarking Dialectal Capabilities in Arabic and Multilingual Language Models

阿拉伯方言MMLU:评估阿拉伯语和多语言模型在阿拉伯方言上的能力

Malik H. Altakrori, Nizar Habash, Abed Alhakim Freihat, Younes Samih, Kirill Chirkunov, Muhammed AbuOdeh, Radu Florian, Teresa Lynn, Preslav Nakov, Alham Fikri Aji

机构 * IBM Research AI(IBM人工智能研究院) New York University Abu Dhabi(纽约大学迪拜分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出阿拉伯方言MMLU基准,通过手动翻译和适应3000个多项选择题答案对至五个主要方言,评估大语言模型在阿拉伯方言上的推理和理解能力,揭示方言泛化中的持续差距。

Comments 9 pages, 10 tables, accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24358 2026-03-24 cs.SE cs.CL 85%

Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation

通过代理驱动的标注和评估自动评估代码代理

Lingyue Fu, Bolun Zhang, Hao Guan, Yaoming Zhu, Lin Qiu, Weiwen Liu, Xuezhi Cao, Xunliang Cai, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出代理驱动的基准构建流程,引入PRDBench包含50个真实Python项目,通过专门模型提升评估准确性,验证了框架的可扩展性和鲁棒性。

Comments Accepted by AAMAS 2026

Journal ref Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), Paphos, Cyprus, May 25-29, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20636 2026-03-24 cs.CL cs.CE 85%

A Modular LLM Framework for Explainable Price Outlier Detection

一个模块化的LLM框架用于可解释的价格异常检测

Shadi Sartipi, John Wu, Sina Ghotbi, Nikhita Vedula, Shervin Malmasi

机构 * Amazon.com, Inc.(亚马逊公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一个基于LLM的框架,通过产品检测和比较进行价格异常判断,实现75%以上的人工审核一致率,优于零样本和检索基于的LLM方法。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18486 2026-03-24 cs.CL cs.CY 85%

Different Demographic Cues Yield Inconsistent Conclusions About LLM Personalization and Bias

不同的人口统计线索导致对LLM个性化和偏见的结论不一致

Manuel Tonneau, Neil K. R. Seghal, Niyati Malhotra, Sharif Kazemi, Victor Orozco-Olvera, Ana María Muñoz Boudet, Lakshmi Subramanian, Samuel P. Fraiberger, Sharath Chandra Guntuku, Valentin Hofmann

机构 * World Bank(世界银行) University of Oxford(牛津大学) New York University(纽约大学) University of Pennsylvania(宾夕法尼亚大学) LMU Munich(慕尼黑大学) Allen Institute for AI(人工智能研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过1480万个提示测试了人口统计线索对LLM响应的影响,发现同一群体的不同线索导致响应变化不一致,偏见结论不稳定,揭示了身份线索与语言信号的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20293 2026-03-24 cs.AI 85%

LLM-Enhanced Energy Contrastive Learning for Out-of-Distribution Detection in Text-Attributed Graphs

基于大语言模型的能量对比学习的文本属性图中分布外检测

Xiaoxu Ma, Dong Li, Minglai Shao, Xintao Wu, Chen Zhao

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LECT方法,结合大语言模型和能量对比学习,在文本属性图中实现节点级分布外检测,提升分类准确性和鲁棒性。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00004 2026-03-24 cs.IR cs.CL cs.DL cs.LG 85%

C$^2$-Cite: Contextual-Aware Citation Generation for Attributed Large Language Models

C$^2$-Cite: 基于上下文感知的引用生成方法用于带属性的大语言模型

Yue Yu, Ting Bai, HengZhi Lan, Li Qian, Li Peng, Jie Wu, Wei Liu, Jian Luan, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.LG

AI总结 本文提出C$^2$-Cite框架,通过整合引用标记与参考内容的语义关系,提升引用生成质量与响应正确性。

Comments WSDM26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10744 2026-03-24 cs.AI cs.CV 83%

Explore with Long-term Memory: A Benchmark and Multimodal LLM-based Reinforcement Learning Framework for Embodied Exploration

探索与长期记忆:一个基准和基于多模态LLM的强化学习框架用于具身探索

Sen Wang, Bangwei Liu, Zhenkun Gao, Lizhuang Ma, Xuhong Wang, Yuan Xie, Xin Tan

机构 * East China Normal University(东华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LMEE框架,通过多模态LLM强化学习促进终身学习,构建LMEE-Bench基准评估具身探索过程与结果,采用MemoryExplorer方法提升记忆检索与主动探索能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20276 2026-03-24 cs.AI 83%

Me, Myself, and $π$ : Evaluating and Explaining LLM Introspection

我、我自己和π:评估和解释LLM内省

Atharv Naphade, Samarth Bhargav, Sean Lim, Mcnair Shah

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种内省的分类体系,通过Introspect-Bench评估套件验证了LLM的内省能力,并展示了前沿模型在预测自身行为上的优势。

Comments 20 pages, 12 figures, ICLR 2026 Workshop: From Human Cognition to AI Reasoning: Models, Methods, and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02426 2026-03-24 cs.CL cs.AI 82%

Comparative Analysis of AI Agent Architectures for Entity Relationship Classification

面向实体关系分类的AI代理架构比较分析

Maryam Berijanian, Kuldeep Singh, Amin Sehati

机构 * Michigan State University(密歇根州立大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文比较了三种基于大语言模型的AI代理架构在实体关系分类中的性能,发现多代理协作优于少样本提示方法,接近微调模型性能。

Journal ref Proceedings of the 18th International Conference on Agents and Artificial Intelligence, Volume 1: ICAART, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21251 2026-03-24 cs.NI eess.SP 82%

WirelessBench: A Tolerance-Aware LLM Agent Benchmark for Wireless Network Intelligence

WirelessBench: 一种面向无线网络智能的容忍感知LLM代理基准

Jingwen Tong, Fang Liu, Linkai Xv, Shiliang Lu, Kangqi Li, Yiqian Zhang, Yijie Song, Zeyang Xue, Jun Zhang

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract)

AI总结 WirelessBench提出一种容忍感知的LLM无线代理基准,通过三层认知体系和三个设计原则,解决现有基准在连续故障和灾难性错误检测上的不足,提升无线网络管理的自主性。

Comments This paper is submitted to a possiable journal for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20287 2026-03-24 cs.IR 82%

Report-based Recommendations for Policy Making and Agency Operations: Dataset and LLM Evaluation

基于报告的政策制定与机构运营推荐:数据集与LLM评估

Aleksandra Edwards, Thomas Edwards, Jose Camacho-Collados, Alun Preece

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出基于报告生成政策建议的新任务,构建首个评估框架,展示先进LLM在生成建议中的潜力。

Comments The paper has been accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20229 2026-03-24 cs.CY cs.AI 81%

Characterizing the ability of LLMs to recapitulate Americans' distributional responses to public opinion polling questions across political issues

刻画LLMs在不同政治议题上再现美国人对公共意见调查问题分布性反应的能力

Eric Gong, Nathan E. Sanders, Bruce Schneier

机构 * Harvard College(哈佛大学学院) Berkman-Klein Center, Harvard University(伯克曼-克莱因中心,哈佛大学) Harvard Kennedy School(哈佛肯尼迪学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种框架,通过直接提示LLM预测多项选择政治问题的响应分布,相比传统方法更准确且成本更低,且在不同人口统计学和问题上表现更系统可预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20433 2026-03-24 cs.SD cs.AI cs.CL eess.AS 81%

ALICE: A Multifaceted Evaluation Framework of Large Audio-Language Models' In-Context Learning Ability

ALICE:大型音频-语言模型上下文学习能力的多维评估框架

Yen-Ting Piao, Jay Chiehen Liao, Wei-Tang Chien, Toshiki Ogimoto, Shang-Tse Chen, Yun-Nung Chen, Chun-Yi Lee, Shao-Yuan Lo

机构 * National Taiwan University, Taiwan(台湾国立成功大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ALICE框架,通过三阶段评估六个LALMs在音频条件下的上下文学习能力,发现上下文示例虽能提升格式合规性,但难以改善核心任务表现,揭示了跨模态整合的潜在局限。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11128 2026-03-24 cs.CL cs.AI 81%

Theory-Grounded Evaluation of Human-Like Fallacy Patterns in LLM Reasoning

基于理论的LLM推理中人类似 fallacy 模式的评估

Andrew Keenan Richardson, Ryan Othniel Kearns, Sean Moss, Vincent Wang-Mascianica, Philipp Koralus

机构 * The Laboratory for Human-Centered AI, Institute for Ethics in AI, Faculty of Philosophy, University of Oxford, UK(以人为中心的人工智能实验室,人工智能伦理研究所,哲学学院,牛津大学,英国) Oxford Internet Institute, University of Oxford, UK(牛津互联网研究所,牛津大学,英国) School of Computer Science, University of Birmingham, UK(计算机科学学院,伯明翰大学,英国)

专题命中 评测与基准 :LLM(title);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过ETR理论和PyETR工具,评估LLM推理错误是否符合人类fallacy模式,发现模型能力与错误类型相关,且反转前提顺序可减少fallacy生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21975 2026-03-24 cs.CR cs.AI cs.CL cs.LG 80%

SecureBreak -- A dataset towards safe and secure models

SecureBreak -- 一个面向安全和安全模型的数据集

Marco Arazzi, Vignesh Kumar Kembu, Antonino Nocera

机构 * Department of Electrical, Computer Biomedical Engineering, University of Pavia, Italy\ .

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SecureBreak数据集,用于检测由安全对齐残余弱点引起的有害大语言模型输出,通过手动标注确保可靠性,并在多个风险类别中有效检测不安全内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22179 2026-03-24 cs.AI 79%

MARCUS: An agentic, multimodal vision-language model for cardiac diagnosis and management

MARCUS:一种用于心脏诊断和管理的代理式多模态视觉-语言模型

Jack W O'Sullivan, Mohammad Asadi, Lennart Elbe, Akshay Chaudhari, Tahoura Nedaee, Francois Haddad, Michael Salerno, Li Fe-Fei, Ehsan Adeli, Rima Arnaout, Euan A Ashley

机构 * Division of Cardiology, Department of Medicine, Stanford University(斯坦福大学心脏病学系) Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Department of Medicine, Radiology, and Pediatrics, UCSF(旧金山大学医学系、放射学与儿科学系) Bakar Institute, UCSF(Bakar研究所,旧金山大学) UCSF–UC Berkeley Joint Program in Computational Precision Health(旧金山大学-伯克利计算精准健康联合计划) Department of Radiology, Stanford University(斯坦福大学放射学系) Department of Psychiatry and Behavioral Sciences, Stanford University(斯坦福大学精神病学与行为科学系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系) Department of Biology, Stanford University(斯坦福大学生物学系)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 MARCUS通过多模态视觉-语言模型实现心电图、超声和心脏磁共振成像的端到端解读,其多代理架构在心脏诊断中表现出优于前沿模型的准确率和自由文本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21170 2026-03-24 cs.LG 79%

Pruned Adaptation Modules: A Simple yet Strong Baseline for Continual Foundation Models

剪枝适应模块:一种简单却强大的连续基础模型基线

Elif Ceren Gok Yildirim, Murat Onur Yildirim, Joaquin Vanschoren

机构 * AMOR/e Lab, Eindhoven University of Technology(埃因霍温理工大学AMOR/e实验室)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出剪枝适应模块(PAM),通过冻结大部分预训练ResNet参数,利用稀疏任务特定层实现可扩展的连续学习,显著降低持续学习成本并减少遗忘。

Comments Published at CPAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16960 2026-03-24 cs.CR cs.AI 79%

Adversarial attacks against Modern Vision-Language Models

对抗现代视觉-语言模型的攻击

Alejandro Paredes La Torre

机构 * Duke University(杜克大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究开放源码视觉-语言模型在模拟真实预部署环境中的对抗鲁棒性,评估两种模型在三种梯度攻击下的表现,发现其存在显著的安全差异。

详情

展开后加载摘要…

URL PDF HTML 收藏