arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-05 至 2026-03-05 共收录 59 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 59 篇

2603.03846 2026-03-05 cs.CL 89%

Benchmarking Motivational Interviewing Competence of Large Language Models

对大型语言模型动机访谈能力的评估

Aishwariya Jha, Prakrithi Shivaprakash, Lekhansh Shukla, Animesh Mukherjee, Prabhat Chand, Pratima Murthy

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文评估了大型语言模型在真实世界临床转录中的动机访谈能力,发现LLM在MITI框架下表现良好,甚至在复杂反思和问题比率上优于人类专家。

Comments 17 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16852 2026-03-05 cs.CL 89%

Meenz bleibt Meenz, but Large Language Models Do Not Speak Its Dialect

梅恩语仍为梅恩语,但大语言模型并不说它的方言

Minh Duc Bui, Manuel Mager, Peter Herbert Kann, Katharina von der Wense

机构 * Johannes Gutenberg University Mainz, Germany(莱茵河畔摩泽尔大学) Marburg University, Germany(马堡大学) University of Colorado Boulder, USA(科罗拉多大学波德分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究首次探讨梅恩语的NLP应用,发现大语言模型在生成方言词汇定义和生成方面表现不佳,需更多资源和研究支持。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04306 2026-03-05 stat.CO 89%

Theory Discovery in Social Networks: Automating ERGM Specification with Large Language Models

社交网络中的理论发现:利用大语言模型自动化ERGM规范

Yidan Sun, Mayank Kejriwal

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出Forge框架,利用大语言模型自动化ERGM规范,通过验证可行性与稳定性约束,提升社交网络形成机制的建模效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03508 2026-03-05 cs.CL cs.AI 88%

Raising Bars, Not Parameters: LilMoo Compact Language Model for Hindi

提升标准,而非参数:Hindi语言的LilMoo紧凑语言模型

Shiza Fatimah, Aniket Sen, Sophia Falk, Florian Mai, Lucie Flek, Nicholas Kluge Corrêa

机构 * Bonn-Aachen International Center for Information Technology (b-it) / CAISA Lab(波恩-亚琛国际信息科技中心(b-it)/ CAISA实验室) Lamarr Institute for Machine Learning and Artificial Intelligence(拉玛尔人工智能与机器学习研究所) Bonn Sustainable AI Lab(波恩可持续AI实验室) Helmholtz-Institut für Strahlen- und Kernphysik(海德堡辐射与核物理研究所)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);foundation model(abstract);pretraining(abstract)

AI总结 LilMoo是一个6亿参数的Hindi语言模型,通过透明可重复的训练流程,在有限计算环境下超越多语言基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04033 2026-03-05 cs.CL 87%

Who Judges the Judge? Evaluating LLM-as-a-Judge for French Medical open-ended QA

谁评判法官?评估LLM作为法官在法语医学开放性问答中的表现

Ikram Belmadani, Oumaima El Khettari, Pacôme Constant dit Beaufils, Richard Dufour, Benoit Favre

机构 * Aix-Marseille Univ., CNRS, LIS UMR 7020(艾克斯-马赛大学,法国国家科学研究中心,LIS UMR 7020) Nantes Univ., École Centrale Nantes, CNRS, LS2N, UMR 6004(南特大学,中央理工学院南特校区,法国国家科学研究中心,LS2N,UMR 6004) Nantes Université, CHU Nantes, PHU 11: Santé Publique, Clinique des données, INSERM, CIC 1413(南特大学,南特大学医院,PHU 11:公共卫生,数据诊所,法国国家卫生与医学研究院,CIC 1413) Nantes Université, CNRS, INSERM, L’institut du thorax(南特大学,法国国家科学研究中心,法国国家卫生与医学研究院,胸科研究所) Université Grenoble Alpes, CNRS, INRIA, Grenoble INP, LIG UMR 5217(格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,INRIA,格勒诺布尔INP,LIG UMR 5217)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本研究评估了LLM在法语医学开放性问答中作为评判者的有效性,发现领域适应模型在与专家注释一致方面表现最佳,并通过微调和GRPO提升了性能。

Comments Accepted in HeaLing Workshop - EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03330 2026-03-05 cs.CL cs.AI 87%

Certainty robustness: Evaluating LLM stability under self-challenging prompts

确定性鲁棒性:在自我挑战提示下评估LLM的稳定性

Mohammadreza Saadat, Steve Nemzer

机构 * TELUS Digital(TELUS数字公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI

AI总结 本文提出确定性鲁棒性基准,评估LLM在自我挑战提示下的稳定性与适应性平衡,揭示模型在交互压力下的可靠性差异。

Comments 20 pages, 7 tables Benchmark and evaluation study of large language models

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07321 2026-03-05 cs.CL cs.AI cs.LG 87%

ObfusQAte: A Proposed Framework to Evaluate LLM Robustness on Obfuscated Factual Question Answering

ObfusQAte:一种用于评估LLM在模糊事实问答上的鲁棒性的框架

Shubhra Ghosh, Abhilekh Borah, Aditya Kumar Guru, Kripabandhu Ghosh

机构 * Indian Institute of Technology Patna(印度帕纳布理工大学) Manipal University Jaipur(贾伊普尔曼尼帕尔大学) Indian Institute of Science Education and Research Kolkata(印度科学教育与研究学院科利卡塔)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ObfusQAte框架用于评估LLM在模糊事实问答任务中的鲁棒性,通过多级模糊化方法考察LLM在命名实体、干扰项和上下文过载三个维度上的表现。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01534 2026-03-05 cs.LG cs.AI cs.CL 87%

Preference Leakage: A Contamination Problem in LLM-as-a-judge

偏好泄露:作为判断者的LLM中的污染问题

Dawei Li, Renliang Sun, Yue Huang, Ming Zhong, Bohan Jiang, Jiawei Han, Xiangliang Zhang, Wei Wang, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Notre Dame(诺丁汉大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出偏好泄露问题,揭示LLM作为判断者时因数据生成器与评估者相关性导致的偏见,并通过实验验证其普遍存在性和检测难度。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03790 2026-03-05 cs.CL cs.AI 86%

T2S-Bench & Structure-of-Thought: Benchmarking and Prompting Comprehensive Text-to-Structure Reasoning

T2S-Bench 及 Structure-of-Thought:基准测试与提示的综合文本到结构推理

Qinsi Wang, Hancheng Ye, Jinhee Kim, Jinghan Ke, Yifei Wang, Martin Kuo, Zishan Shao, Dongting Li, Yueqian Lin, Ting Jiang, Chiyue Wei, Qi Qian, Wei Wen, Helen Li, Yiran Chen

机构 * duke(杜克大学) meta

专题命中 评测与基准 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Structure-of-Thought和T2S-Bench,通过显式文本结构化提升模型文本处理性能,实验表明其在多个任务中显著提升准确率。

Comments Dataset and Code have been released at https://t2s-bench.github.io/T2S-Bench-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03321 2026-03-05 cs.CL cs.AI 86%

DIALEVAL: Automated Type-Theoretic Evaluation of LLM Instruction Following

DIALEVAL: 大型语言模型指令遵循的自动类型理论评估

Nardine Basta, Dali Kaafar

机构 * Macquarie University, Australia(麦考瑞大学,澳大利亚)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DIALEVAL通过双LLM代理实现复杂指令的自动类型理论评估,提升对话场景下的评估准确性与人类判断一致性。

Comments PAKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03319 2026-03-05 cs.CL cs.AI 86%

Automated Concept Discovery for LLM-as-a-Judge Preference Analysis

用于LLM-as-a-Judge偏好分析的自动化概念发现

James Wedgwood, Chhavi Yadav, Virginia Smith

机构 * Department of Computer Science(计算机科学系) Carnegie-Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种自动化方法,用于发现LLM判断偏好的驱动因素,通过比较不同概念提取方法,验证了LLM在敏感请求上的偏好,并揭示了新的趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04217 2026-03-05 cs.CL 85%

When Do Language Models Endorse Limitations on Human Rights Principles?

语言模型何时会支持人权原则的限制?

Keenan Samway, Nicole Miu Takagi, Rada Mihalcea, Bernhard Schölkopf, Ilias Chalkidis, Daniel Hershcovich, Zhijing Jin

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Jinesis AI Lab, University of Toronto & Vector Institute(Jinesis AI实验室,多伦多大学及向量研究所) University of Michigan(密歇根大学) University of Copenhagen(哥本哈根大学) EuroSafeAI

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 本文研究了语言模型在人权原则限制上的偏见,发现模型在不同语言和提示下表现出系统性差异,揭示了AI在高风险互动中的伦理挑战。

Comments EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04212 2026-03-05 cs.SE cs.CL 85%

Code Fingerprints: Disentangled Attribution of LLM-Generated Code

代码指纹:解耦的LLM生成代码归因

Jiaxun Guo, Ziyuan Yang, Mengyu Sun, Hui Wang, Jingfeng Lu, Yi Zhang

机构 * School of Cyber Science and Engineering, Sichuan University, Chengdu, China(四川大学计算机科学与工程学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出DCAN网络,通过解耦语义与风格信息,实现对LLM生成代码的多模型归因。

Comments 11 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04191 2026-03-05 cs.AI 85%

Towards Realistic Personalization: Evaluating Long-Horizon Preference Following in Personalized User-LLM Interactions

迈向真实个性化:评估个性化用户-LLM交互中的长周期偏好跟随

Qianyun Guo, Yibo Li, Yue Liu, Bryan Hooi

机构 * National University of Singapore, Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RealPref提出一个评估个性化用户-LLM交互中长周期偏好跟随的基准,揭示LLM在长上下文和隐性偏好下的表现下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04123 2026-03-05 cs.CL 85%

FINEST: Improving LLM Responses to Sensitive Topics Through Fine-Grained Evaluation

FINEST: 通过细粒度评估改进LLM对敏感话题的响应

Juhyun Oh, Nayeon Lee, Chani Jung, Jiho Jin, Junho Myung, Jongwon Lee, Taeui Song, Alice Oh

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FINEST通过细粒度评估分类法,改进LLM对敏感话题的响应,显著减少错误率并提升帮助性与安全性。

Comments Accepted to EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06512 2026-03-05 cs.CV cs.AI 85%

Merlin: A Computed Tomography Vision-Language Foundation Model and Dataset

Merlin:一种计算断层扫描视觉-语言基础模型和数据集

Louis Blankemeier, Ashwin Kumar, Joseph Paul Cohen, Jiaming Liu, Longchao Liu, Dave Van Veen, Syed Jamal Safdar Gardezi, Hongkun Yu, Magdalini Paschali, Zhihong Chen, Jean-Benoit Delbrouck, Eduardo Reis, Robbie Holland, Cesar Truyts, Christian Bluethgen, Yufu Wu, Long Lian, Malte Engmann Kjeldskov Jensen, Sophie Ostmeier, Maya Varma, Jeya Maria Jose Valanarasu, Zhongnan Fang, Zepeng Huo, Zaid Nabulsi, Diego Ardila, Wei-Hung Weng, Edson Amaro Junior, Neera Ahuja, Jason Fries, Nigam H. Shah, Greg Zaharchuk, Marc Willis, Adam Yala, Andrew Johnston, Robert D. Boutin, Andrew Wentland, Curtis P. Langlotz, Jason Hom, Sergios Gatidis, Akshay S. Chaudhari

机构 * Stanford University(斯坦福大学) Stanford Center for Artificial Intelligence in Medicine and Imaging(斯坦福大学医学与成像人工智能中心) Department of Electrical Engineering(电气工程系) University of California Berkeley(加州大学伯克利分校) Department of Radiology(放射科) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Hospital Israelita Albert Einstein(以色列特医院阿尔伯特·爱因斯坦医院)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 Merlin是一种基于3D视觉-语言模型的医学影像分析工具,通过多阶段预训练框架,实现了对腹部CT扫描、电子健康记录和放射科报告的综合学习,提升了医学影像分析的自动化水平。

Comments Nature (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05449 2026-03-05 cs.HC 85%

Bloom: Designing for LLM-Augmented Behavior Change Interactions

Bloom:为LLM增强的行为改变交互设计

Matthew Jörke, Defne Genç, Valentin Teutschbein, Shardul Sapkota, Sarah Chung, Paul Schmiedmayer, Maria Ines Campero, Abby C. King, Emma Brunskill, James A. Landay

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Bloom通过整合LLM的健康教练聊天机器人,探索LLM在促进长期健康行为改变中的作用,发现其在心理层面的积极影响优于短期身体活动提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03314 2026-03-05 cs.CL cs.AI cs.LG 83%

Towards Self-Robust LLMs: Intrinsic Prompt Noise Resistance via CoIPO

迈向自适应鲁棒大语言模型:通过CoIPO实现内在提示噪声抵抗力

Xin Yang, Letian Li, Abudukelimu Wuerkaixi, Xuxin Cheng, Cao Liu, Ke Zeng, Xunliang Cai, Wenyuan Jiang

机构 * Zhejiang University(浙江大学) Tsinghua University(清华大学) Meituan LongCat Interaction Team(美团LongCat交互团队) ETH Zürich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出CoIPO方法,通过对比学习提升大语言模型对提示噪声的内在鲁棒性,实验表明其在NoisyPromptBench上表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22730 2026-03-05 cs.CL 83%

Extending Czech Aspect-Based Sentiment Analysis with Opinion Terms: Dataset and LLM Benchmarks

扩展捷克基于方面的情感分析:数据集和大语言模型基准

Jakub Šmíd, Pavel Přibáň, Pavel Král

机构 * Department of Computer Science and Engineering(计算机科学与工程系) NTIS -- New Technologies for the Information Society(信息社会新技术)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种针对捷克语的ABSA数据集和翻译对齐方法,通过实验展示了其在低资源语言中的应用效果和改进。

Comments Accepted for the 15th edition of the Language Resources and Evaluation Conference (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20704 2026-03-05 cs.CL cs.AI cs.CR 81%

Text2VLM: Adapting Text-Only Datasets to Evaluate Alignment Training in Visual Language Models

Text2VLM: 将文本-only数据集适应于评估视觉语言模型对齐训练

Gabriel Downer, Sean Craven, Damian Ruck, Jake Thomas

机构 * Advai

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 Text2VLM通过将文本-only数据集转换为多模态格式,评估VLMs对提示注入攻击的鲁棒性,并揭示模型对齐中的关键弱点。

Comments 9 pages, 9 figures. Jake Thomas served as Editor for this manuscript

Journal ref Proceedings of the 2025 Conference on Applied Machine Learning for Information Security, Proceedings of Machine Learning Research PMLR Vol 299 pp 28 41

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03315 2026-03-05 cs.CL cs.AI cs.LG 80%

M-QUEST -- Meme Question-Understanding Evaluation on Semantics and Toxicity

M-QUEST -- 周期性问题理解评估在语义和毒性上

Stefano De Giorgis, Ting-Chih Chen, Filip Ilievski

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 M-QUEST提出一个语义框架和基准,用于自动提取迷因知识,评估模型在毒性理解上的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04354 2026-03-05 cs.LG 79%

Out-of-distribution transfer of PDE foundation models to material dynamics under extreme loading

偏分布转移:PDE基础模型在极端加载下的材料动力学应用

Mahindra Rautela, Alexander Most, Siddharth Mansingh, Aleksandra Pachalieva, Bradley Love, Daniel O Malley, Alexander Scheinker, Kyle Hickmann, Diane Oyen, Nathan Debardeleben, Earl Lawrence, Ayan Biswas

机构 * AOT-IC Group(AOT-IC组) CAI Division EES Divison(EES division) XCP Division HPC Division Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本研究评估了两种PDE基础模型在极端加载材料动力学中的偏分布转移性能,通过终端状态预测任务验证其在不同训练集大小下的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03633 2026-03-05 cs.CR cs.AI 79%

Goal-Driven Risk Assessment for LLM-Powered Systems: A Healthcare Case Study

面向目标的风险评估用于LLM驱动系统:一个医疗案例研究

Neha Nagaraja, Hayretdin Bahsi

机构 * School of Informatics, Computing, and Cyber Systems(信息学、计算与网络系统学院) Northern Arizona University(北亚利桑那大学) Department of Software Science(软件科学系) Tallinn University of Technology(塔林技术大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出了一种面向目标的风险评估方法,用于评估LLM驱动系统的安全风险,通过攻击树详细分析威胁向量和攻击路径,以提升医疗系统等复杂系统的安全性。

Comments To appear in the HealthSec Workshop at the 2025 IEEE Annual Computer Security Applications Conference (ACSAC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03441 2026-03-05 cs.CL cs.AI 79%

CareMedEval dataset: Evaluating Critical Appraisal and Reasoning in the Biomedical Field

CareMedEval 数据集:评估生物医学领域中的批判性评估与推理

Doria Bonzi, Alexandre Guiggi, Frédéric Béchet, Carlos Ramisch, Benoit Favre

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CareMedEval数据集用于评估生物医学领域中LLM的批判性评估与推理能力,揭示了现有模型在专业领域中的局限性。

Comments Accepted at LREC 2026. To access the dataset, see https://github.com/bonzid/CareMedEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03323 2026-03-05 cs.CL cs.AI 79%

Discern Truth from Falsehood: Reducing Over-Refusal via Contrastive Refinement

辨别真伪:通过对比细化减少过度拒绝

Yuxiao Lu, Lin Xu, Yang Sun, Wenjun Li, Jie Shi

机构 * Huawei Technologies co. ltd(华为技术有限公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DCR方法,通过对比细化减少LLM的过度拒绝问题,同时保持安全性和通用能力。

Comments 10 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03303 2026-03-05 cs.CL cs.AI 79%

HumanLM: Simulating Users with State Alignment Beats Response Imitation

HumanLM: 通过状态对齐模拟用户优于响应模仿

Shirley Wu, Evelyn Choi, Arpandeep Khatua, Zhanghan Wang, Joy He-Yueya, Tharindu Cyril Weerasooriya, Wei Wei, Diyi Yang, Jure Leskovec, James Zou

机构 * Stanford University(斯坦福大学) New York University(纽约大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HumanLM通过状态对齐模拟用户,优于响应模仿,显著提升对齐分数和真实用户相似性。

Comments 27 pages, 17 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03302 2026-03-05 cs.CL cs.AI cs.IR 79%

Developing an AI Assistant for Knowledge Management and Workforce Training in State DOTs

为州交通部门的知识管理和员工培训开发人工智能助手

Divija Amaram, Lu Gao, Gowtham Reddy Gudla, Tejaswini Sanjay Katale

机构 * Department of Computer Science, University of Houston(计算机科学系,休斯顿大学) Department of Civil and Environmental Engineering, University of Houston(土木与环境工程系,休斯顿大学) Ph.D Department of Civil and Environmental Engineering, University of Houston(土木与环境工程系,休斯顿大学) Engineering Data Science, University of Houston(工程数据科学,休斯顿大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种多代理架构的RAG框架,用于州交通部门的知识管理和决策支持,通过整合文档检索与大语言模型生成,提升信息检索与响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08714 2026-03-05 cs.CV cs.CL cs.LG 79%

Generating Fine Details of Entity Interactions

生成实体交互的细节

Xinyi Gu, Jiayuan Mao

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种基于多模态大语言模型的方法,通过分解和细化过程提升图像中实体交互细节的生成质量。

Comments EMNLP 2025. Project Page: https://detailscribe.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03637 2026-03-05 cs.CV cs.AI cs.CR 77%

Image-based Prompt Injection: Hijacking Multimodal LLMs through Visually Embedded Adversarial Instructions

基于图像的提示注入:通过视觉嵌入的对抗性指令劫持多模态大语言模型

Neha Nagaraja, Lan Zhang, Zhilong Wang, Bo Zhang, Pawan Patil

机构 * Northern Arizona University(北亚利桑那大学)

专题命中 评测与基准 :large language model(abstract,comments);language model(abstract,comments);分类 cs.AI

AI总结 研究提出基于图像的提示注入攻击方法,通过视觉嵌入对抗性指令,成功操控多模态大语言模型输出,揭示了该攻击的有效性和潜在威胁。

Comments 7 pages, published in 2025 3rd International Conference on Foundation and Large Language Models (FLLM), Vienna, Austria

Journal ref 2025 3rd International Conference on Foundation and Large Language Models (FLLM), Vienna, Austria, 2025, pp. 916-922

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09937 2026-03-05 cs.AI cs.DC 77%

Why Do AI Agents Systematically Fail at Cloud Root Cause Analysis?

为何AI代理在云根因分析中系统性失败?

Taeyoon Kim, Woohyeok Park, Hoyeong Yun, Kyungyong Lee

机构 * Hanyang University(汉阳大学) OKESTRO Co., Ltd.(OKESTRO公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文分析了基于LLM的云根因分析代理在推理、通信和环境交互中的系统性故障,揭示了幻觉数据和不完全探索等普遍问题,并通过改进通信协议减少故障率。

详情

展开后加载摘要…

URL PDF HTML 收藏