arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-24 至 2026-03-24 共收录 437 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 90 篇

2506.11128 2026-03-24 cs.CL cs.AI 81%

Theory-Grounded Evaluation of Human-Like Fallacy Patterns in LLM Reasoning

基于理论的LLM推理中人类似 fallacy 模式的评估

Andrew Keenan Richardson, Ryan Othniel Kearns, Sean Moss, Vincent Wang-Mascianica, Philipp Koralus

机构 * The Laboratory for Human-Centered AI, Institute for Ethics in AI, Faculty of Philosophy, University of Oxford, UK(以人为中心的人工智能实验室,人工智能伦理研究所,哲学学院,牛津大学,英国) Oxford Internet Institute, University of Oxford, UK(牛津互联网研究所,牛津大学,英国) School of Computer Science, University of Birmingham, UK(计算机科学学院,伯明翰大学,英国)

专题命中 评测与基准 :LLM(title);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过ETR理论和PyETR工具,评估LLM推理错误是否符合人类fallacy模式,发现模型能力与错误类型相关,且反转前提顺序可减少fallacy生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21975 2026-03-24 cs.CR cs.AI cs.CL cs.LG 80%

SecureBreak -- A dataset towards safe and secure models

SecureBreak -- 一个面向安全和安全模型的数据集

Marco Arazzi, Vignesh Kumar Kembu, Antonino Nocera

机构 * Department of Electrical, Computer Biomedical Engineering, University of Pavia, Italy\ .

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SecureBreak数据集,用于检测由安全对齐残余弱点引起的有害大语言模型输出,通过手动标注确保可靠性,并在多个风险类别中有效检测不安全内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22179 2026-03-24 cs.AI 79%

MARCUS: An agentic, multimodal vision-language model for cardiac diagnosis and management

MARCUS:一种用于心脏诊断和管理的代理式多模态视觉-语言模型

Jack W O'Sullivan, Mohammad Asadi, Lennart Elbe, Akshay Chaudhari, Tahoura Nedaee, Francois Haddad, Michael Salerno, Li Fe-Fei, Ehsan Adeli, Rima Arnaout, Euan A Ashley

机构 * Division of Cardiology, Department of Medicine, Stanford University(斯坦福大学心脏病学系) Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Department of Medicine, Radiology, and Pediatrics, UCSF(旧金山大学医学系、放射学与儿科学系) Bakar Institute, UCSF(Bakar研究所,旧金山大学) UCSF–UC Berkeley Joint Program in Computational Precision Health(旧金山大学-伯克利计算精准健康联合计划) Department of Radiology, Stanford University(斯坦福大学放射学系) Department of Psychiatry and Behavioral Sciences, Stanford University(斯坦福大学精神病学与行为科学系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系) Department of Biology, Stanford University(斯坦福大学生物学系)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 MARCUS通过多模态视觉-语言模型实现心电图、超声和心脏磁共振成像的端到端解读,其多代理架构在心脏诊断中表现出优于前沿模型的准确率和自由文本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21170 2026-03-24 cs.LG 79%

Pruned Adaptation Modules: A Simple yet Strong Baseline for Continual Foundation Models

剪枝适应模块:一种简单却强大的连续基础模型基线

Elif Ceren Gok Yildirim, Murat Onur Yildirim, Joaquin Vanschoren

机构 * AMOR/e Lab, Eindhoven University of Technology(埃因霍温理工大学AMOR/e实验室)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出剪枝适应模块(PAM),通过冻结大部分预训练ResNet参数,利用稀疏任务特定层实现可扩展的连续学习,显著降低持续学习成本并减少遗忘。

Comments Published at CPAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16960 2026-03-24 cs.CR cs.AI 79%

Adversarial attacks against Modern Vision-Language Models

对抗现代视觉-语言模型的攻击

Alejandro Paredes La Torre

机构 * Duke University(杜克大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究开放源码视觉-语言模型在模拟真实预部署环境中的对抗鲁棒性,评估两种模型在三种梯度攻击下的表现,发现其存在显著的安全差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20513 2026-03-24 cs.IR cs.AI 79%

ReBOL: Retrieval via Bayesian Optimization with Batched LLM Relevance Observations and Query Reformulation

ReBOL:通过批量LLM相关性观察和查询重述进行检索

Anton Korikov, Scott Sanner

机构 * University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 ReBOL通过引入多模态贝叶斯优化和查询重述技术,改进检索阶段的召回率和排名质量,优于现有LLM重排序基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21359 2026-03-24 cs.CL cs.AI cs.CY 79%

Benchmarking Bengali Dialectal Bias: A Multi-Stage Framework Integrating RAG-Based Translation and Human-Augmented RLAIF

印地语方言偏见评估:整合基于RAG的翻译和人类增强的RLAIF的多阶段框架

K. M. Jubair Sami, Dipto Sumit, Ariyan Hossain, Farig Sadeque

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个多阶段框架,通过基于RAG的翻译和人类增强的RLAIF评估九种印地语方言的偏见。研究发现方言差异导致性能下降,模型规模增加不总是缓解偏见。

Comments 12 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20976 2026-03-24 cs.LG cs.AI cs.HC 79%

Detection of adversarial intent in Human-AI teams using LLMs

利用大语言模型检测人类-人工智能团队中的对抗意图

Abed K. Musaffar, Ambuj Singh, Francesco Bullo

机构 * Department of Mechanical Engineering, University of California at Santa Barbara(加州大学圣巴巴拉分校机械工程系) Department of Computer Science, University of California at Santa Barbara(加州大学圣巴巴拉分校计算机科学系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大语言模型在人类-人工智能团队中作为防御监督者的潜力,通过分析交互痕迹检测恶意行为,发现LLM能实时识别恶意行为,且无需任务特定信息,表明了任务无关防御的可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20799 2026-03-24 cs.CL cs.LG 79%

RLVR Training of LLMs Does Not Improve Thinking Ability for General QA: Evaluation Method and a Simple Solution

基于可验证奖励的强化学习训练不会提升大语言模型的通用问答能力:评估方法和一个简单解决方案

Kaiyuan Li, Jing-Cheng Pang, Yang Yu

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文评估了基于可验证奖励的强化学习是否能提升大语言模型在通用问答任务中的推理能力,发现其效果不如可验证任务,并提出START方法提升问答质量和回答质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19740 2026-03-24 cs.CV 78%

LEMON: A Large Endoscopic MONocular Dataset and Foundation Model for Perception in Surgical Settings

LEMON:一个大规模内窥镜单目数据集和用于手术场景感知的基础模型

Chengan Che, Chao Wang, Tom Vercauteren, Sophia Tsoka, Luis C. Garcia-Peraza-Herrera

机构 * Department of Informatics, King’s College London, UK(伦敦国王学院信息学院)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出LEMON数据集,通过新型聚合管道收集4K手术视频,提供938小时高质量内容,包含两项新任务。基于该数据集的LemonFM基础模型在多个任务中表现优异,显著提升手术识别和分割性能。

Comments Accepted at CVPR2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09695 2026-03-24 cs.CL 77%

Emotionally Charged, Logically Blurred: AI-driven Emotional Framing Impairs Human Fallacy Detection

情绪强烈、逻辑模糊:AI驱动的情绪框架损害人类谬误检测

Yanran Chen, Lynn Greschner, Roman Klinger, Michael Klenk, Steffen Eger

机构 * NLLG, University of Technology Nuremberg (UTN)(神经语言学与认知科学实验室,图恩大学(UTN)) Fundamentals of Natural Language Processing, University of Bamberg, Germany(自然语言处理基础,巴姆堡大学,德国) Ethics and Philosophy of Technology, Delft University of Technology, Netherlands(技术伦理与哲学,代尔夫特理工大学,荷兰)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了情绪框架如何影响人类谬误检测,发现AI驱动的情绪框架使F1评分平均降低14.5%,情绪愉悦比恐惧或悲伤更能提升说服力。

Comments EACL 2026 Main Camera-ready; Figure 4 and typo fixed

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18529 2026-03-24 cs.CL 77%

Instructional Text Across Disciplines: A Survey of Representations, Downstream Tasks, and Open Challenges Toward Capable AI Agents

跨学科指令文本:对表示、下游任务和有能力AI代理的综述

Abdulfattah Safa, Tamta Kapanadze, Arda Uzunoğlu, Gözde Gül Şahin

机构 * KUIS AI Lab, Koç University, Istanbul, Türkiye(KUIS AI实验室,科克大学,伊斯坦布尔,土耳其) Koç University, Istanbul, Türkiye(科克大学,伊斯坦布尔,土耳其) Johns Hopkins University, Baltimore, USA(约翰霍普金斯大学,巴尔的摩,美国) Friedrich-Alexander-Universität Erlangen-Nürnberg, Germany(埃尔兰根-纽伦堡弗里德里希-亚历山大大学,德国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL

AI总结 本文综述了指令文本的表示方法、下游任务及挑战,旨在为AI代理提供统一视角,填补不同研究方向间的空白。

Comments Pre-CoLI print. Accepted for publication in Computational Linguistics (MIT Press). Advance online publication. March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21329 2026-03-24 cs.IR cs.AI 77%

COINBench: Moving Beyond Individual Perspectives to Collective Intent Understanding

COINBench: 超越个体视角到集体意图理解

Xiaozhe Li, Tianyi Lyu, Siyi Yang, Yizhao Yang, Yuxi Gong, Jinxuan Huang, Ligao Zhang, Zhuoyi Huang, Qingwen Liu

机构 * Tongji University(同济大学) Stanford University(斯坦福大学) CurrentsAI Research(CurrentsAI研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 COINBench通过动态实时更新的基准测试,评估大语言模型在消费者领域集体意图理解能力,揭示当前模型在复杂意图合成分析深度上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20807 2026-03-24 cs.CL 77%

BenchBench: Benchmarking Automated Benchmark Generation

BenchBench:自动化基准生成的评估

Yandan Zheng, Haoran Luo, Zhenghong Lin, Wenjin Liu, Luu Anh Tuan

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 BenchBench通过三阶段流程评估自动化基准生成能力,生成16.7K问题并评估模型-问题响应质量,揭示基准设计与回答能力的弱相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17710 2026-03-24 cs.SI cs.CL 77%

Does Geo-co-location Matter? A Case Study of Public Health Conversations during COVID-19

地理定位是否重要?新冠疫情中公共卫生对话的案例研究

Paiheng Xu, Louiqa Raschid, Vanessa Frias-Martinez

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨地理定位对社交媒体对话的影响,通过分析新冠数据集发现地理定位与高参与度相关,情感词汇更常见于地理定位对话,结合统计分析与LLM方法验证了结论。

Comments ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20572 2026-03-24 cs.LG 77%

LJ-Bench: Ontology-Based Benchmark for U.S. Crime

LJ-Bench:基于本体的美国犯罪评估基准

Hung Yun Tseng, Wuzhen Li, Blerina Gkotse, Grigorios Chrysos

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 LJ-Bench是首个基于本体的全面基准,用于评估LLM对多种非法活动的鲁棒性,揭示LLM在不同犯罪类别中的脆弱性。

Comments Accepted at Transactions on Machine Learning Research in March, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00319 2026-03-24 cs.CL cs.AI cs.LG cs.SI 75%

Detecting AI-Generated Content in Academic Peer Reviews

在学术同行评审中检测人工智能生成内容

Siyuan Shen, Kai Wang

机构 * University of Pennsylvania(宾夕法尼亚大学) Children’s Hospital of Philadelphia(费城儿童医院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过检测模型分析ICLR和Nature Communications同行评审中AI生成内容的时间演变,发现2022年后AI生成内容显著增加,2025年ICLR和NC分别有20%和12%的评审被归类为AI生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21416 2026-03-24 cs.SD 75%

Enterprise Sales Copilot: Enabling Real-Time AI Support with Automatic Information Retrieval in Live Sales Calls

企业销售助手:通过自动信息检索实现实时AI支持的现场销售通话

Jielin Qiu, Liangwei Yang, Ming Zhu, Wenting Zhao, Zhiwei Liu, Juntao Tan, Zixiang Chen, Roshan Ram, Akshara Prabhakar, Rithesh Murthy, Shelby Heinecke, Caiming Xiong, Silvio Savarese, Huan Wang

机构 * Salesforce AI Research(Salesforce AI研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出SalesCopilot,通过实时AI助手自动检测客户问题并检索产品数据库信息,提升销售效率。系统在保险销售场景中实现2.8秒响应,比手动搜索快14倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21190 2026-03-24 cs.AR 75%

DS2SC-Agent: A Multi-Agent Automated Pipeline for Rapid Chiplet Model Generation

DS2SC-Agent: 一种多智能体自动化流水线用于快速芯片片建模

Yiwei Wu, Yifan Wu, Yunhao Xiong, Dengwei Zhao, Jiaxuan Shen, Jianfei Jiang, Guanghui He, Shikui Tu, Yanan Sun

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出DS2SC-Agent,一种多智能体自动化流水线,用于从原始数据表直接生成SystemC芯片片模型,解决传统手动建模耗时且易出错的问题,通过高效协作框架实现自动化流程。

Comments 9 pages,5figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21019 2026-03-24 cs.CR cs.SE 75%

SkillProbe: Security Auditing for Emerging Agent Skill Marketplaces via Multi-Agent Collaboration

SkillProbe:通过多智能体协作实现新兴智能体技能市场places的安全审计

Zihan Guo, Zhiyu Chen, Xiaohang Nie, Jianghao Lin, Yuanjian Zhou, Weinan Zhang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 针对LLM智能体生态系统中技能市场面临的安全挑战,提出SkillProbe框架,通过多智能体协作实现技能审计,揭示高流行技能的安全性不足及系统性风险。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21524 2026-03-24 cs.CL cs.AI 73%

CatRAG: Functor-Guided Structural Debiasing with Retrieval Augmentation for Fair LLMs

CatRAG:基于检索增强生成的 functor 引导的结构去偏方法用于公平大语言模型

Ravi Ranjan, Utkarsh Grover, Mayur Akewar, Xiaomin Lin, Agoritsa Polyzou

机构 * Florida International University(佛罗里达国际大学) University of South Florida(佛罗里达州立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CatRAG 通过整合 functor 与检索增强生成,实现结构去偏,提升公平性。在三个开源 LLM 上,其准确率提升达 40%,偏见分数降至接近零。

Comments 9 pages, 4 figures, and accepted in IJCNN 2026 (part of IEEE WCCI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21654 2026-03-24 cs.CR cs.AI 70%

Towards Secure Retrieval-Augmented Generation: A Comprehensive Review of Threats, Defenses and Benchmarks

迈向安全的检索增强生成:对威胁、防御和基准的全面综述

Yanming Mu, Hao Hu, Feiyang Li, Qiao Yuan, Jiang Wu, Zichuan Liu, Pengcheng Liu, Mei Wang, Hongwei Zhou, Yuling Liu

机构 * State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室) Information Engineering University(信息工程大学) Henan Key Laboratory of Information Security(河南省信息安全重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文综述了检索增强生成系统中的安全威胁、防御方法及评估基准,系统分析了数据污染、对抗攻击等核心威胁,并提出双视角的防御技术分类,为未来研究提供统一基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05027 2026-03-24 cs.AI 70%

S5-SHB Agent: Society 5.0 enabled Multi-model Agentic Blockchain Framework for Smart Home

S5-SHB代理:面向社会5.0的多模型代理区块链框架用于智能家居

Janani Rangila, Akila Siriweera, Incheon Paik, Keitaro Naruse, Isuru Jayanada, Vishmika Devindi

机构 * KD University(KD大学) University of Aizu(东亚大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出S5-SHB代理框架,通过多代理协调和居民控制治理,解决智能家居中适应性共识、智能多代理协调和居民可控治理的问题。

Comments 15 pages, 15 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02960 2026-03-24 cs.AI 70%

Architecting Trust in Artificial Epistemic Agents

在人工智能认知代理中构建信任

Nahema Marchal, Stephanie Chan, Matija Franklin, Manon Revel, Geoff Keeling, Roberta Fischli, Bilva Chandra, Iason Gabriel

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了大规模语言模型作为认知代理的影响,提出通过构建信任、对齐人类认知目标和加强社会认知基础设施,确保AI系统的可靠性与包容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19961 2026-03-24 cs.CL cs.IR 70%

Unlocking Multimodal Document Intelligence: From Current Triumphs to Future Frontiers of Visual Document Retrieval

解锁多模态文档智能:从当前成就到视觉文档检索的未来前沿

Yibo Yan, Jiahao Huo, Guanbo Feng, Mingdong Ou, Yi Cao, Xin Zou, Shuliang Liu, Yuanhuiyi Lyu, Yu Huang, Jungang Li, Kening Zheng, Xu Zheng, Philip S. Yu, James Kwok, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算) Hong Kong University of Science and Technology(香港科技大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文综述了视觉文档检索领域,探讨了多模态大语言模型时代下的方法演进与挑战,提出未来发展方向。

Comments Under review. This version updates the relevant works released before 15 March, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19248 2026-03-24 cs.CV cs.AI 70%

No Need For Real Anomaly: MLLM Empowered Zero-Shot Video Anomaly Detection

无需真实异常:MLLM赋能的零样本视频异常检测

Zunkai Dai, Ke Li, Jiajia Liu, Jie Yang, Yuanyuan Qiao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Northwestern Polytechnical University(西北工业大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LAVIDA框架,利用多模态大语言模型和异常暴露采样器,解决视频异常检测中数据稀少和语义理解不足的问题,实现零样本下的帧级和像素级异常检测最优性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21280 2026-03-24 cs.CY cs.AI 70%

WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making

WARBENCH:评估大语言模型在军事决策中的综合基准

Zongjie Li, Chaozheng Wang, Yuchong Xie, Pingchuan Ma, Shuai Wang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Chinese University of Hong Kong(香港中文大学) Zhejiang University of Technology(浙江工业大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出WARBENCH基准,揭示现有大语言模型在军事决策中存在结构性缺陷,包括战术推理崩溃、法律违规率高、量化降维导致性能下降等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08455 2026-03-24 cs.CL 70%

Bot Meets Shortcut: How Can LLMs Aid in Handling Unknown Invariance OOD Scenarios?

机器人与捷径:大型语言模型如何帮助处理未知不变性OOD场景?

Shiyan Zheng, Herun Wan, Minnan Luo, Junhang Huang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了现有社交机器人检测器在真实场景中的鲁棒性不足问题,提出基于大语言模型的缓解策略,通过对抗数据增强提升模型在捷径学习场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05824 2026-03-24 cs.CL 70%

Multi-Session Client-Centered Treatment Outcome Evaluation in Psychotherapy

多会话以客户为中心的治疗结果评估

Hongbin Na, Tao Shen, Shumao Yu, Ling Chen

机构 * Australian AI Institute, University of Technology Sydney, Australia(澳大利亚人工智能研究所,悉尼技术大学,澳大利亚) KU Leuven, Belgium(鲁汶大学,比利时)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出IPAEval框架,通过整合跨会话客户情境评估与会话聚焦客户动态评估,从客户视角自动化评估治疗结果,实验显示其在多会话跟踪症状严重度和治疗效果方面优于基线方法。

Comments Accepted at LREC 2026. Camera-ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20316 2026-03-24 cs.IR cs.AI 70%

Bypassing Document Ingestion: An MCP Approach to Financial Q&A

绕过文档摄入:一种MCP方法用于金融问答

Sasan Mansouri, Edoardo Pilla, Mark Wahrenburg, Fabian Woebbeking

机构 * University of Groningen(Groningen大学) Goethe University Frankfurt(法兰克福歌德大学) Martin Luther University Halle-Wittenberg(哈雷-维滕贝格马丁路德大学) Halle Institute for Economic Research (IWH)(哈雷经济研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究MCP在金融问答中的可靠性,通过构建定制MCP服务器测试FinDER基准,发现其在多步数值问题上准确率达80.4%,为金融问答提供基线并揭示其局限性。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏