arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-19 至 2026-03-19 共收录 255 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 77 篇

2603.17683 2026-03-19 cs.AI cs.LG 86%

Sensi: Learn One Thing at a Time -- Curriculum-Based Test-Time Learning for LLM Game Agents

Sensi:一次学一项——基于课程的学习式测试时间学习用于LLM游戏代理

Mohsen Arjmandi

机构 * Independent Researcher (CTO, evolutionID)(独立研究者(CTO, evolutionID))

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Sensi通过结构化测试时间学习机制,提升LLM游戏代理在未知环境中的学习效率,其核心方法包括双玩家架构、课程学习系统和数据库作为控制平面,显著提高了样本效率。

Comments Preprint. 18 pages, 5 figures, 2 tables. Independent research. Code and Colab demo coming soon on GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24384 2026-03-19 cs.CL cs.AI 86%

HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment

HarmMetric Eval: 对LLM有害性评估的度量和裁判进行基准测试

Langqi Yang, Tianhang Zheng, Yixuan Chen, Kedong Xiu, Hao Zhou, Wangze Ni, Lei Chen, Zhan Qin, Kui Ren

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) Pretraining Team, xAI(预训练团队,xAI) Hong Kong University of Science and Technology (GuangZhou)(香港科技大学(广州))

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HarmMetric Eval,用于评估有害性度量和裁判的质量,发现传统参考型指标在细粒度评估中表现优于LLM裁判,改进的裁判通过结合细粒度标准和参考型指标提升了效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17680 2026-03-19 cs.CV cs.AI 85%

WeatherReasonSeg: A Benchmark for Weather-Aware Reasoning Segmentation in Visual Language Models

WeatherReasonSeg:一种用于视觉语言模型中天气感知推理分割的基准测试

Wanjun Du, Zifeng Yuan, Tingting Chen, Fucai Ke, Beibei Lin, Shunli Zhang

机构 * Beijing Jiaotong University(北京交通大学) National University of Singapore(新加坡国立大学) Monash University(墨尔本大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出WeatherReasonSeg基准测试,评估视觉语言模型在恶劣天气下的推理分割能力,通过合成和真实数据集分析天气对模型性能的影响,发现天气严重程度与模型性能呈单调下降关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17172 2026-03-19 cs.LG 85%

Noise-Response Calibration: A Causal Intervention Protocol for LLM-Judges

噪声响应校准:一种用于LLM判官的因果干预协议

Maxim Khomiakov, Jes Frellsen

机构 * Technical University of Denmark(丹麦技术大学) Normal Computing Corporation(Normal Computing公司) Pioneer Centre for Artificial Intelligence(人工智能先锋中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于受控输入干预的校准协议,通过信号噪声比扰动和词法扰动评估LLM判官在不同模态下的表现,揭示了文本与表格数据在噪声下的差异行为。

Comments Published as a conference paper at CAO Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06396 2026-03-19 cs.AI cs.CR 85%

Efficient LLM Safety Evaluation through Multi-Agent Debate

通过多智能体辩论实现高效的LLM安全评估

Dachuan Lin, Guobin Shen, Zihao Yang, Tianrong Liu, Dongcheng Zhao, Yi Zeng

机构 * Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Super Alignment(北京安全人工智能与超对齐重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) CSE, The Chinese University of Hong Kong(香港中文大学电子工程系) University of Chinese Academy of Sciences(中国科学院大学) Department of Mathematics, The Chinese University of Hong Kong(香港中文大学数学系) Long-term AI(长期人工智能)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出多智能体辩论框架,利用HAJailBench基准测试,提升LLM安全评估的可靠性与经济性,验证了少量辩论轮次即可获得显著效果。

Comments 15 pages, 5 figures, 10 tables. Updated abstract to fix an incconsistency issue with the main paper: HAJailBench size (12,000 -> 11,100)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10204 2026-03-19 cs.SE cs.LG 85%

Code Roulette: How Prompt Variability Affects LLM Code Generation

代码掷骰子:提示变化如何影响LLM代码生成

Andrei Paleyes, Radzim Sendyka, Diana Robinson, Christian Cabrera, Neil D. Lawrence

机构 * University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究探讨提示变化对LLM代码生成质量的影响,提出评估流程以量化模型对输入变化的敏感性,通过实验验证方法有效性。

Comments Extended version of the paper accepted to LLM4Code @ ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04893 2026-03-19 cs.CV cs.AI 85%

SCAM: A Real-World Typographic Robustness Evaluation for Multimodal Foundation Models

SCAM:多模态基础模型的现实世界字形鲁棒性评估

Justus Westerhoff, Erblina Purelku, Jakob Hackstein, Jonas Loos, Leo Pinetzki, Erik Rodner, Lorenz Hufe

机构 * BLISS e.V.(BLISS协会) Berliner Hochschule für Technik (BHT)(柏林技术大学) Technische Universität Berlin(柏林技术大学) KI Werkstatt, Hochschule für Technik und Wirtschaft Berlin (HTW)(柏林技术经济学院) Merantix Momentum(Merantix Momentum公司) Fraunhofer Heinrich-Hertz-Institut, Berlin, Germany(柏林弗劳恩霍夫 Heinrich-Hertz 研究所)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SCAM数据集,用于评估多模态基础模型对字形攻击的鲁棒性,发现训练数据和模型架构影响攻击敏感性,且大语言模型基座可降低攻击影响。

Comments Accepted at CVPR 2025 Workshop EVAL-FoMo-2

Journal ref Journal of Data-centric Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21679 2026-03-19 cs.CL 84%

ReviewScore: Misinformed Peer Review Detection with Large Language Models

ReviewScore:利用大语言模型进行误信同行评审检测

Hyun Ryu, Doohyuk Jang, Hyemin S. Lee, Joonhyun Jeong, Gyeongman Kim, Donghyeon Cho, Gyouk Chu, Minyeong Hwang, Hyeongwon Jang, Changhun Kim, Haechan Kim, Jina Kim, Joowon Kim, Yoonjeon Kim, Kwanhyung Lee, Chanjae Park, Heecheol Yun, Gregor Betz, Eunho Yang

机构 * KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院) KRAFTON(KRAFTON公司) AITRICS(AITRICS研究院) KIT(卡尔斯鲁厄理工学院)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL

AI总结 本文提出ReviewScore方法,通过检测同行评审中的错误前提和可回答问题来识别低质量评审。利用大语言模型评估评审点的误信程度,实验显示模型在评估一致性上表现中等,但仍有改进空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17017 2026-03-19 cs.CL cs.AI 84%

LLM NL2SQL Robustness: Surface Noise vs. Linguistic Variation in Traditional and Agentic Settings

LLM NL2SQL鲁棒性:传统与智能设置中表面噪声与语言变异的比较

Lifu Tu, Rongguang Wang, Tao Sheng, Sujjith Ravi, Dan Roth

机构 * Oracle AI

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了NL2SQL系统在表面噪声和语言变异下的鲁棒性,发现传统和智能设置中模型表现各异,揭示了实现鲁棒NL2SQL系统的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13417 2026-03-19 cs.AI cs.CL 84%

Assessing LLM Reasoning Through Implicit Causal Chain Discovery in Climate Discourse

通过气候 discourse 中的隐含因果链发现评估 LLM 推理

Liesbeth Allein, Nataly Pineda-Castañeda, Andrea Rocci, Marie-Francine Moens

机构 * Department of Computer Science, KU Leuven(卢森堡大学计算机科学系) Institute of Argumentation, Linguistics, and Semiotics (IALS)(论证、语言学与象征学研究所)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过隐含因果链发现任务评估 LLM 的因果推理能力,发现其生成的因果步骤数量和粒度存在差异,但主要依赖关联模式匹配而非真实因果推理。

Comments LREC 2026, appendix to be found in ACL anthology

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17522 2026-03-19 cs.CL cs.AI 83%

Detecting the Machine: A Comprehensive Benchmark of AI-Generated Text Detectors Across Architectures, Domains, and Adversarial Conditions

检测机器:跨架构、领域和对抗条件的AI生成文本检测器全面基准

Madhav S. Baidya, S. S. Baidya, Chirag Chawla

机构 * Indian Institute of Technology (BHU)(印度理工学院 (BHU)) Indian Institute of Technology Guwahati(印度理工学院古瓦哈蒂)

专题命中 评测与基准 :LLM(abstract,comments);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出跨HC3和ELI5两个语料库的全面基准,评估不同检测方法在领域转移和对抗鲁棒性上的表现,发现Transformer模型在分布内表现优异但易受领域偏移影响,XGBoost模型在可解释性上表现良好。

Comments ~30 pages, 10+ figures. Code available at: https://github.com/MadsDoodle/Human-and-LLM-Generated-Text-Detectability-under-Adversarial-Humanization

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23562 2026-03-19 cs.LG cs.AI cs.CL 82%

VL-RouterBench: A Benchmark for Vision-Language Model Routing

VL-RouterBench:一种用于视觉-语言模型路由的基准测试

Zhehao Huang, Baijiong Lin, Jingyuan Zhang, Jingying Wang, Yuhang Liu, Ning Lu, Tao Li, Xiaolin Huang

机构 * Institute of Image Processing and Pattern Recognition, Shanghai Jiao Tong University(1 图像处理与模式识别研究所,上海交通大学) The Hong Kong University of Science and Technology (Guangzhou)(2 香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(3 香港科学与技术大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出VL-RouterBench,用于系统评估视觉-语言模型路由系统的能力,通过构建质量与成本矩阵,评估10种路由方法并发现显著的路由改进空间,揭示了路由架构改进的潜力。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17952 2026-03-19 cs.CL 81%

Gender Disambiguation in Machine Translation: Diagnostic Evaluation in Decoder-Only Architectures

机器翻译中的性别歧义化解:解码器-only架构的诊断评估

Chiara Manna, Hosein Mohebbi, Afra Alishahi, Frédéric Blain, Eva Vanmassenhove

机构 * Research Center for Cognitive Science and Artificial Intelligence(认知科学与人工智能研究中心) Tilburg School of Humanities and Digital Sciences(蒂尔堡人文与数字科学学院) Tilburg University(蒂尔堡大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract);post-training(abstract)

AI总结 本文针对机器翻译中性别偏见问题,提出新的评估框架,揭示解码器-only模型在性别特定指标上的表现及后训练对偏见的缓解作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17832 2026-03-19 cs.CL cs.AI cs.LG 80%

Text-to-Stage: Spatial Layouts from Long-form Narratives

文本到舞台:从长篇叙述中生成空间布局

Jefferson Hernandez, Swarnadeep Saha, Chenxi Whitehouse, Sanjeel Parekh, Calvin Murdock, Yuliang Li, W. Owen Brimijoin, Vamsi Krishna Ithapu, Ishwarya Ananthabhotla

机构 * Rice University(里士大学) Meta FAIR Meta Reality Labs Research(Meta现实实验室)

专题命中 评测与基准 :LLM(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究如何通过语言模型从无结构文本推断戏剧舞台布局,提出确定性评估体系和结合拒绝SFT与RL的训练方法,在多个指标上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17231 2026-03-19 cs.CL eess.AS 79%

Neuron-Level Emotion Control in Speech-Generative Large Audio-Language Models

语音生成大音频-语言模型中的神经层面情感控制

Xiutian Zhao, Ismail Rasim Ulgen, Philipp Koehn, Björn Schuller, Berrak Sisman

机构 * 1 Center for Language Speech Processing (CLSP), Johns Hopkins University, USA 2 Group on Language, Audio \& Music (GLAM), Imperial College London, UK

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文首次在语音生成大音频-语言模型中研究神经层面的情感控制,通过识别紧凑的情感敏感神经元(ESNs)实现无需训练的情感引导,实验表明其在不同模型上均能提升情感表现并支持自动与人工评估。

Comments 11 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17111 2026-03-19 cs.CV cs.AI 79%

Hidden Clones: Exposing and Fixing Family Bias in Vision-Language Model Ensembles

隐藏克隆:揭示并修复视觉-语言模型集成中的家族偏见

Zacharie Bugaud

机构 * Astera Institute(Astera研究院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文研究了视觉-语言模型集成中同家族模型的关联误差问题,提出三种家族感知方法,通过层级家族投票、QualRCCV和学得候选评分,提升了集成性能并验证了方法的泛化能力。

Comments 15 pages, 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17048 2026-03-19 cs.LG cs.CV 79%

SCE-LITE-HQ: Smooth visual counterfactual explanations with generative foundation models

SCE-LITE-HQ:基于生成基础模型的平滑视觉反事实解释

Ahmed Zeid, Sidney Bender

机构 * BIFOLD – Berlin Institute for the Foundations of Learning(柏林学习与数据基础研究所)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出SCE-LITE-HQ框架,利用预训练生成模型在潜在空间中生成稳定且多样的反事实解释,避免训练专用生成模型的开销,适用于高分辨率数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17813 2026-03-19 cs.CV 78%

M2P: Improving Visual Foundation Models with Mask-to-Point Weakly-Supervised Learning for Dense Point Tracking

M2P:通过Mask-to-Point弱监督学习改进视觉基础模型以实现密集点跟踪

Qiangqiang Wu, Tianyu Yang, Bo Fang, Jia Wan, Matias Di Martino, Guillermo Sapiro, Antoni B. Chan

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) Meituan, Shenzhen, China(美团(深圳,中国)) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出M2P学习方法,利用视频对象分割掩码注解改进视觉基础模型,通过局部结构一致性损失、掩码标签一致性损失和掩码边界约束,提升密集点跟踪性能,实验表明其在TAP-Vid-DAVIS基准上优于DINOv2和DINOv3。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17675 2026-03-19 cs.CV 78%

DeepCORO-CLIP: A Multi-View Foundation Model for Comprehensive Coronary Angiography Video-Text Analysis and External Validation

DeepCORO-CLIP:一种多视图基础模型,用于综合冠状动脉造影视频-文本分析和外部验证

Sarra Harrabi, Yichen Wu, Geoffrey H. Tison, Minhaj Ansari, Milos Vukadinovic, David Ouyang, Joshua P. Barrios, Jacques Delfrate, Robert Avram

机构 * Division of Cardiology, Department of Medicine, Montreal Heart Institute(蒙特利尔心脏研究所心血管科,医学部) McGill, Faculty of Engineering(麦吉尔大学工程学院) Division of Cardiology, Department of Medicine, University of California, San Francisco(加州大学旧金山分校医学部心血管科) Cardiovascular Research Institute, University of California, San Francisco(加州大学旧金山分校心血管研究所) Bakar Computational Health Sciences Institute, University of California, San Francisco(加州大学旧金山分校Bakar计算健康科学研究所) Department of Cardiology, Smidt Heart Institute, Cedars-Sinai Medical Center, Los Angeles, CA(Cedars-Sinai 医疗中心洛杉矶分院心血管科,Smidt心脏研究所) Department of Bioengineering, University of California Los Angeles(加州大学洛杉矶分校生物工程系) Department of Medicine, Kaiser Permanente, San Francisco, USA(Kaiser Permanente 旧金山分院医学部) Department of Medicine, Université de Montréal(蒙特利尔大学医学部)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 DeepCORO-CLIP通过多视图视频-文本对比学习,实现了对冠状动脉造影的全面分析与外部验证,显著提升了斑块检测和疾病预测的准确性。

Comments 69 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15967 2026-03-19 cs.CV 78%

A Comprehensive Benchmark of Histopathology Foundation Models for Kidney Digital Pathology Images

一种针对肾数字病理图像的病理基础模型综合基准测试

Harishwar Reddy Kasireddy, Patricio S. La Rosa, Akshita Gupta, Anindya S. Paul, Jamie L. Fermin, William L. Clapp, Meryl A. Waldman, Tarek M. El-Ashkar, Sanjay Jain, Luis Rodrigues, Kuang Yu Jen, Avi Z. Rosenberg, Michael T. Eadon, Jeffrey B. Hodgin, Pinaki Sarder

机构 * Department of Electrical and Computer Engineering, University of Florida(佛罗里达大学电气与计算机工程系) Seed Production Innovation, Crop Science Division, Bayer Company(拜耳公司种子生产创新部) Division of Medicine – Quantitative Health, University of Florida(佛罗里达大学医学部-定量健康分部) Department of Health Outcomes and Biomedical Informatics, University of Florida(佛罗里达大学健康结果与生物医学信息学系) Department of Pathology, Immunology and Laboratory Medicine, University of Florida College of Medicine(佛罗里达大学医学院病理学、免疫学与实验室医学系) Kidney Disease Branch, National Institute of Diabetes and Digestive and Kidney Diseases, National Institutes of Health(美国国立卫生研究院糖尿病、消化系统与肾病研究所肾病分支) Indiana University School of Medicine(印第安纳大学医学院) Departments of Medicine, Washington University School of Medicine(华盛顿大学医学院医学部) Universidade de Coimbra(科英布拉大学) Department of Pathology and Laboratory Medicine, University of California at Davis School of Medicine(加州大学戴维斯分校医学院病理学与实验室医学系) Department of Pathology, Johns Hopkins University School of Medicine(约翰霍普金斯大学医学院病理学系)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文评估了11种公开的病理基础模型在11个肾脏特定下游任务中的表现,揭示了其在肾病诊断中的适用性及改进方向。

Comments 31 Pages, 14 Tables, 12 figures, Co-correspondence to jhodgin@med.umich.edu and pinaki.sarder@ufl.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09262 2026-03-19 cs.CV 78%

MultiMedEval: A Benchmark and a Toolkit for Evaluating Medical Vision-Language Models

MultiMedEval:用于评估医学视觉-语言模型的基准和工具包

Corentin Royer, Bjoern Menze, Anjany Sekuboyina

机构 * University of Zürich(苏黎世大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 MultiMedEval通过23个数据集和11个医学领域,评估六种多模态任务,提供开源工具简化VLM评估,促进公平统一的基准测试。

Comments Accepted at MIDL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17737 2026-03-19 cs.LG 77%

Embedding World Knowledge into Tabular Models: Towards Best Practices for Embedding Pipeline Design

将世界知识嵌入表格模型:迈向嵌入管道设计的最佳实践

Oksana Kolomenko, Ricardo Knauer, Erik Rodner

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过系统评估256种管道配置,探讨了如何设计有效的LLM嵌入管道,发现嵌入方式和模型选择对预测性能有显著影响,梯度提升树表现优异。

Comments Computational Intelligence 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17639 2026-03-19 cs.AI 77%

VeriGrey: Greybox Agent Validation

VeriGrey:灰盒代理验证

Yuntong Zhang, Sungmin Kang, Ruijie Meng, Marcel Böhme, Abhik Roychoudhury

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出VeriGrey方法,通过工具调用序列反馈函数驱动测试过程,发现LLM代理中隐含的提示注入漏洞,并在实际案例中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11158 2026-03-19 cs.IR cs.AI 77%

Role-Augmented Intent-Driven Generative Search Engine Optimization

角色增强的意图驱动生成搜索引擎优化

Xiaolu Chen, Haojie Wu, Jie Bao, Zhen Chen, Yong Liao, Hu Huang

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出角色增强的意图驱动生成搜索引擎优化方法,通过反思性细化不同信息角色来建模搜索意图,提升生成搜索引擎中的内容可见性。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13538 2026-03-19 cs.IR cs.AI 77%

RAGXplain: From Explainable Evaluation to Actionable Guidance of RAG Pipelines

RAGXplain: 从可解释评估到RAG流水线的可操作指导

Dvir Cohen, Tamir Houri, Lin Burg, Gilad Barkan

机构 * Wix.com AI Research(Wix.com人工智能研究)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RAGXplain通过'指标钻石'框架将性能指标转化为可操作指导,利用LLM生成自然语言失败模式解释,提升RAG流水线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17592 2026-03-19 cs.IR cs.AI cs.HC 77%

A Contextual Help Browser Extension to Assist Digital Illiterate Internet Users

一种上下文帮助浏览器扩展,以协助数字文盲的互联网用户

Christos Koutsiaris

机构 * School of Science(科学学院) Computing South East Technological University Ireland(计算学院东南技术大学爱尔兰)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文设计实现并评估了一种浏览器扩展,通过轻量级提示框为用户hover技术缩写提供上下文帮助,结合技术词典和OpenAI的LLM提升理解效率和信息检索速度。

Comments 9 pages, 5 figures, 2 tables; MSc dissertation reformatted as conference paper; extended version available at github.com/unseen1980/acro-helper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17373 2026-03-19 cs.CL 77%

SafeTutors: Benchmarking Pedagogical Safety in AI Tutoring Systems

SafeTutors: 评估AI辅导系统中的教学安全性

Rima Hazra, Bikram Ghuku, Ilona Marchenko, Yaroslava Tokarieva, Sayan Layek, Somnath Banerjee, Julia Stoyanovich, Mykola Pechenizkiy

机构 * Eindhoven University of Technology(埃因霍温理工大学) Indian Institute of Technology Kharagpur(印度理工学院Khargpur分校) Cisco Research(思科研究) Taras Shevchenko National University of Kyiv(塔拉斯·谢甫琴科基辅国立大学) National Technical University of Ukraine(乌克兰国家技术大学) New York University(纽约大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SafeTutors基准,评估AI辅导系统在数学、物理和化学中的教学有效性与安全性,发现模型在多轮对话中教学失败率显著上升,且学科差异影响安全措施效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16974 2026-03-19 cs.CV cs.AI 77%

Are a Thousand Words Better Than a Single Picture? Beyond Images -- A Framework for Multi-Modal Knowledge Graph Dataset Enrichment

千言胜过一幅图?超越图像——一个多模态知识图谱数据集增强框架

Pengyu Zhang, Klim Zaporojets, Jie Liu, Jia-Hong Huang, Paul Groth

机构 * University of Amsterdam, Amsterdam, The Netherlands(阿姆斯特丹大学,荷兰阿姆斯特丹) Aarhus University, Aarhus, Denmark(哥本哈根大学,丹麦阿arhus) Amazon AGI, Seattle, USA(亚马逊人工智能实验室,美国西雅图)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Beyond Images框架,通过多阶段流程增强多模态知识图谱数据集,利用文本描述和大语言模型融合多源信息,提升图谱完成性能,实验显示在多个数据集上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17833 2026-03-19 cs.SE 75%

ArchBench: Benchmarking Generative-AI for Software Architecture Tasks

Bassam Adnan, Aviral Gupta, Sreemaee Akshathala, Karthik Vaidhyanathan

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 5 pages, 3 figures, Software Architecture Showcase Track, ICSA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16963 2026-03-19 q-bio.QM cs.CV 75%

Topology-Guided Biomechanical Profiling: A White-Box Framework for Opportunistic Screening of Spinal Instability on Routine CT

拓扑引导的生物力学分析:一种白盒框架用于常规CT中脊柱不稳定性的机会性筛查

Zanting Ye, Xuanbin Wu, Guoqing Zhong, Shengyuan Liu, Jiashuai Liu, Ge Song, Zhisong Wang, Jing Hao, Xiaolong Niu, Yefeng Zheng, Yu Zhang, Lijun Lu

机构 * Southern Medical University(南方医科大学) The Affiliated Cancer Hospital of Zhengzhou University(郑州大学附属肿瘤医院) The Chinese University of Hong Kong(香港中文大学) Xi'an Jiaotong University(西安交通大学) Northwestern Polytechnical University(西北工业大学) The University of Hong Kong(香港大学) Westlake University(西湖大学) Guangdong Provincial People's Hospital(广东省人民医院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种白盒框架,通过拓扑引导的生物力学分析,解决常规CT中脊柱不稳定性的筛查问题,通过几何创新和可解释的AI方法提高诊断准确性。

Comments 11 pages, 3 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏