arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-02 至 2026-04-02 共收录 231 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 52 篇

2604.00022 2026-04-02 cs.CL cs.AI 81%

Criterion Validity of LLM-as-Judge for Business Outcomes in Conversational Commerce

对话商业结果中LLM作为评判者的标准效度准则

Liang Chen, Qi Liu, Wenhuan Lin, Feng Liang

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过两项研究探讨了LLM作为评判者在对话商业结果中的标准效度,发现评价维度和权重设计影响显著,需通过转换驱动的重新加权来改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00021 2026-04-02 cs.CL cs.AI cs.CY 81%

How Do Language Models Process Ethical Instructions? Deliberation, Consistency, and Other-Recognition Across Four Models

语言模型如何处理道德指令?在四个模型中的反思、一致性及其他认知

Hiroki Fukui

机构 * Research Institute of Criminal Psychiatry / Sex Offender Medical Center(刑事精神病学研究所/性犯罪者医疗中心) Department of Neuropsychiatry, Kyoto University(京都大学神经精神医学系)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过多代理模拟探讨语言模型处理道德指令的机制,发现不同模型存在不同的处理类型,且处理能力与指令格式的交互影响内部处理。

Comments 34 pages, 7 figures, 4 tables. Preprint. OSF pre-registration: osf.io/4n5uf. Companion paper: arXiv:2603.04904

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00766 2026-04-02 cs.CV cs.AI 79%

Are Large Vision-Language Models Ready to Guide Blind and Low-Vision Individuals?

大视觉-语言模型是否准备好指导盲人和低视力者?

Eunki Kim, Na Min An, Wan Ju Kang, Sangryul Kim, James Thorne, Hyunjung Shim

机构 * SKT KAIST AI(韩国科学技术院人工智能) NAVER Theia Insights

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出统一框架,通过用户研究和定制数据集,开发出更高效的评估器,提升大视觉-语言模型在盲人和低视力用户导航中的应用性能。

Comments 42 pages, 14 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14883 2026-04-02 cs.CV cs.AI 79%

How Blind and Low-Vision Individuals Prefer Large Vision-Language Model-Generated Scene Descriptions

盲人和低视力者如何偏好大型视觉-语言模型生成的场景描述

Na Min An, Eunki Kim, Wan Ju Kang, Sangryul Kim, James Thorne, Hyunjung Shim

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究探讨了盲人和低视力用户对大型视觉-语言模型生成场景描述的偏好,通过用户研究评估了六种描述类型,发现用户对描述的充分性和简洁性存在较大差异,提出需构建以盲人和低视力用户为中心的评估指标。

Comments This paper has been superseded by version 2 of arXiv:2510.00766

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03823 2026-04-02 cs.SE cs.AI cs.CL 79%

SWE-CI: Evaluating Agent Capabilities in Maintaining Codebases via Continuous Integration

SWE-CI:通过持续集成评估代理在维护代码库中的能力

Jialong Chen, Xander Xu, Hu Wei, Chuan Chen, Bing Zhao

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团) Skylenage

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SWE-CI通过持续集成循环构建首个仓库级基准,旨在将代码生成评估从静态短期功能性正确性转向动态长期可维护性,通过跟踪功能正确性随时间的变化揭示可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25770 2026-04-02 stat.ML cs.AI cs.LG 79%

E-Scores for (In)Correctness Assessment of Generative Model Outputs

E-Scores用于生成模型输出的正确性评估

Guneet S. Dhillon, Javier González, Teodora Pandeva, Alicia Curth

机构 * Microsoft Research(微软研究院) University of Oxford(牛津大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出E-Scores作为生成模型输出正确性评估的补充方法,通过e值提高评估的可靠性,并在不同正确性形式下验证其有效性。

Comments International Conference on Artificial Intelligence and Statistics (AISTATS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01066 2026-04-02 econ.GN q-fin.EC 78%

Augmented Human Capital: A Unified Theory and LLM-Based Measurement Framework for Cognitive Factor Decomposition in AI-Augmented Economies

增强人力资本:人工智能增强经济中认知因素分解的统一理论和基于大语言模型的测量框架

Cristian Espinal Maya

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出将人力资本分解为三个正交组成部分,并开发了一个生产函数,其中AI资本与这些组成部分非对称互动,通过放大函数phi(D)补充可增强的认知工作。研究发现,标准的米纳克方程在人工智能增强经济中被误设定,并通过LLM生成的职业可增强性测量验证了增强人力资本的工资回报。

Comments Working paper. 18 pages, 5 figures, 4 tables, 28 references. Code and data: https://github.com/Cespial/cognitive-factor-economics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00803 2026-04-02 cs.IR 75%

A novel three-step approach to forecast firm-specific technology convergence opportunity via multi-dimensional feature fusion

一种新颖的三步方法用于通过多维特征融合预测企业特定技术收敛机会

Fu Gu, Ao Chen, Yingwen Wu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种三步方法,通过多维特征融合预测企业特定技术收敛机会,利用注意力机制和集成学习模型提升预测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08522 2026-04-02 cs.CL 74%

AlphaResearch: Accelerating New Algorithm Discovery with Language Models

AlphaResearch:利用语言模型加速新算法发现

Zhaojian Yu, Kaiyue Feng, Yilun Zhao, Shilin He, Xiao-Ping Zhang, Arman Cohan

机构 * Tsinghua University(清华大学) New York University(纽约大学) Yale University(耶鲁大学)

专题命中 评测与基准 :language model(title);分类 cs.CL

AI总结 AlphaResearch通过迭代提出新想法、编程验证和优化研究提案,实现了在开放性问题上发现新算法的突破,其在六个开放性问题上的表现优于其他系统,尤其在圆圈排列问题上超越了人类和基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00917 2026-04-02 cs.SE cs.AI cs.LG 73%

Investigating Autonomous Agent Contributions in the Wild: Activity Patterns and Code Change over Time

在真实世界中研究自主代理的贡献:活动模式与代码变更趋势

Razvan Mihai Popescu, David Gros, Andrei Botocan, Rahul Pandita, Prem Devanbu, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学) University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析11万条开源拉取请求数据,研究自主编码代理在开源项目中的活动模式及代码变更,探讨其对代码质量、团队动态和软件维护性的影响。

Comments MSR 2026 Technical Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00477 2026-04-02 cs.AI cs.CL cs.HC cs.MA 73%

Logarithmic Scores, Power-Law Discoveries: Disentangling Measurement from Coverage in Agent-Based Evaluation

对数评分,幂律发现:在基于代理的评估中区分测量与覆盖

HyunJoon Jung, William Na

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文通过960次实验展示基于代理的评估在Turing式验证中与人类评分无差异,发现评分与独特问题发现之间存在对数与幂律的分离,揭示了发现空间的幂律分布特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00356 2026-04-02 cs.AI cs.CL 73%

Signals: Trajectory Sampling and Triage for Agentic Interactions

信号:代理互动的轨迹采样与优先级排序

Shuguang Chen, Adil Hafeez, Salman Paracha

机构 * DigitalOcean Holdings, Inc.(DigitalOcean控股公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于信号的轻量框架,用于高效筛选代理交互轨迹,通过计算低成本信号提升采样效率,实验证明其在不同任务中均能有效提升信息量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08225 2026-04-02 cs.CL cs.AI cs.CY cs.HC 73%

Benchmarking Educational LLMs with Analytics: A Case Study on Gender Bias in Feedback

用分析方法评估教育LLM:关于反馈中性别偏见的案例研究

Yishan Du, Conrad Borchers, Mutlu Cukurova

机构 * University College London, UCL Knowledge Lab(伦敦大学学院,UCL知识实验室) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过600篇真实学生作文,利用嵌入式基准框架检测LLM在形成性反馈中的偏见,发现隐性性别提示比显性提示更易引发语义偏移,揭示了LLM在反馈中持续存在的性别偏见。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09136 2026-04-02 cs.AI cs.CL cs.IR 73%

Agentic Retrieval-Augmented Generation: A Survey on Agentic RAG

代理检索增强生成:关于代理RAG的综述

Aditi Singh, Abul Ehtesham, Saket Kumar, Tala Talaei Khoei, Athanasios V. Vasilakos

机构 * Cleveland State University(克利夫兰州立大学) Kent State University(肯特州立大学) Northeastern University(东北大学) Roux Institute at Northeastern University(东北大学鲁克斯研究所) University of Agder (UiA)(阿格德尔大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了代理RAG系统,分析了其架构分类、设计权衡及应用,指出其在灵活性、可扩展性和上下文感知方面的优势,并探讨了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00568 2026-04-02 cs.CL 70%

A Japanese Benchmark for Evaluating Social Bias in Reasoning Based on Attribution Theory

一个用于评估基于归因理论的社会偏见的日本基准

Taihei Shiotani, Masahiro Kaneko, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) AIST(产业技术综合研究所) NII(国立信息学研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文基于归因理论,构建了新的日本基准JUBAKU-v2,用于评估推理中对内群体和外群体行为归因的偏见,通过固定结论来检测模型在文化偏见上的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16908 2026-04-02 cs.CV 67%

Q-REAL: Towards Realism and Plausibility Evaluation for AI-Generated Content

Q-REAL:迈向AI生成内容真实性和可信度评估

Shushi Wang, Zicheng Zhang, Chunyi Li, Wei Wang, Liya Ma, Fengjiao Chen, Xiaoyu Li, Xuezhi Cao, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团) Shanghai AI Lab(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出Q-REAL数据集,用于细粒度评估AI生成图像的真实性和可信度,通过标注实体位置和设计判断问题,提升生成模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00061 2026-04-02 cs.RO cs.SY eess.SP eess.SY 67%

Advancing Multi-Robot Networks via MLLM-Driven Sensing, Communication, and Computation: A Comprehensive Survey

通过MLLM驱动的感知、通信与计算推进多机器人网络:综述

Hyun Jong Yang, Howon Lee, Kyuhong Shim, Jeongho Kwak, Hyunsoo Kim, Donghoon Kim, Khoa Anh Ngo, Sehyun Ryu, Jaehyun Choi, Youbin Kim, Chanjun Moon, Michael Ryoo, Byonghyo Shim

机构 * Seoul National University(首尔大学) Ajou University(亚洲大学) Sungkyunkwan University(成均馆大学) Korea University(高丽大学) POSTECH(浦项科技大学) Stony Brook University(石溪大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文综述了MLLM指导下的多机器人协调,探讨了集成设计对多机器人协作的影响,展示了四种端到端演示,强调了系统级指标的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16080 2026-04-02 cs.CL cs.CY cs.HC cs.LG 62%

Activation Steering via Generative Causal Mediation

通过生成因果中介进行激活引导

Aruna Sankaranarayanan, Amir Zur, Atticus Geiger, Dylan Hadfield-Menell

机构 * CSAIL, MIT(麻省理工学院计算机科学与人工智能实验室) Stanford University(斯坦福大学) Goodfire Research

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究提出生成因果中介(GCM)方法,通过对比长形式响应选择模型组件,以局部化和控制扩散行为,如诗歌式 vs. 论文式表达,在三种语言模型上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15556 2026-04-02 cs.LG cs.CL cs.CR 62%

Certifiably Robust RAG against Retrieval Corruption

可验证的对抗检索污染的RAG

Chong Xiang, Tong Wu, Zexuan Zhong, David Wagner, Danqi Chen, Prateek Mittal

机构 * NVIDIA(英伟达) Princeton University(普林斯顿大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出RobustRAG,通过隔离-聚合策略有效防御检索污染攻击,并在三个数据集和三个LLM上验证了其在开放领域问答和自由文本生成中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00892 2026-04-02 cs.CL 57%

When Users Change Their Mind: Evaluating Interruptible Agents in Long-Horizon Web Navigation

当用户改变主意:在长周期网络导航中评估可中断代理

Henry Peng Zou, Chunyu Miao, Wei-Chieh Huang, Yankai Chen, Yue Zhou, Hanrong Zhang, Yaozu Wu, Liancheng Fang, Zhengyao Gu, Zhen Zhang, Kening Zheng, Fangxin Wang, Yi Nian, Shanghao Li, Wenzhe Fan, Langzhou He, Weizhi Zhang, Xue Liu, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) McGill University(麦吉尔大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of California Santa Barbara(加州大学圣塔芭芭拉分校) University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文首次系统研究长周期环境感知网络导航中可中断代理的表现,通过InterruptBench基准测试六种强大LLM,在单轮和多轮中断设置中分析其适应性和恢复效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00788 2026-04-02 cs.AI cs.CR 57%

UK AISI Alignment Evaluation Case-Study

英国人工智能安全研究所对齐评估案例研究

Alexandra Souly, Robert Kirk, Jacob Merizian, Abby D'Cruz, Xander Davies

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文评估了前沿模型在作为代码助手部署时是否可靠遵循目标,发现未发现研究 sabotage,但部分模型对安全相关任务不合作,且评估意识较弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00339 2026-04-02 cs.LG 57%

When Career Data Runs Out: Structured Feature Engineering and Signal Limits for Founder Success Prediction

当职业数据耗尽时:创始人成功预测的结构化特征工程与信号限制

Yagiz Ihlamur

机构 * Amazon(亚马逊)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 本文通过结构化特征工程和确定性规则层结合XGBoost提升的决策树,提升创始人成功预测性能,发现LLM特征在信息增益上有限,揭示数据集信息含量的上限。

Comments 4 pages, 4 tables. Accepted at SecureFinAI Contest @ IEEE IDS 2026. Code: https://github.com/ihlamury/vcbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21454 2026-04-02 cs.CL 57%

Cross-Context Verification: Hierarchical Detection of Benchmark Contamination through Session-Isolated Analysis

跨上下文验证:通过会话隔离分析进行层次化基准污染检测

Tae-Eun Song

机构 * Daejeon Jungang Cheonggua Co., Ltd.(大田中央青果有限公司)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出跨上下文验证方法,通过多会话分析检测基准污染,发现污染二元性及信息限制机制,验证了结构复杂性非关键。

Comments 11 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00319 2026-04-02 cs.AI cs.MA 57%

Collaborative AI Agents and Critics for Fault Detection and Cause Analysis in Network Telemetry

协同AI代理与批评者用于网络遥测中的故障检测与原因分析

Syed Eqbal Alam, Zhan Shu

机构 * Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系) SheQAI Research(SheQAI研究)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文提出一种多代理联邦系统,通过AI代理与批评者协作完成网络遥测中的故障检测、严重性和原因分析等多模态任务,利用多时间尺度随机逼近技术保证收敛性,通信开销低且隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00293 2026-04-02 cs.LG stat.ML 57%

SYNTHONY: A Stress-Aware, Intent-Conditioned Agent for Deep Tabular Generative Models Selection

SYNTHONY:一种考虑压力的、基于意图的深度表格生成模型选择代理

Hochan Son, Xiaofeng Lin, Jason Ni, Guang Cheng

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 本文提出SYNTHONY,一种基于意图的表格生成模型选择框架,通过压力分析选择最佳合成器,提升模型在不同数据分布下的性能和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00284 2026-04-02 cs.AI cs.MA 57%

Improvisational Games as a Benchmark for Social Intelligence of AI Agents: The Case of Connections

即兴游戏作为AI代理社交智能的基准测试:以Connections为例

Gaurav Rajesh Parikh, Angikar Ghosal

机构 * Duke University(杜克大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文通过即兴词游戏Connections探讨AI代理的推理能力,提出该游戏作为测试社交智能的基准,涵盖知识检索、总结及认知状态意识等核心能力。

Comments https://wordplay-workshop.github.io/wordplay2024/pdfs/16.pdf

Journal ref https://wordplay-workshop.github.io/wordplay2024/pdfs/16.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00020 2026-04-02 cs.CL 57%

Detecting Abnormal User Feedback Patterns through Temporal Sentiment Aggregation

通过时间情感聚合检测异常用户反馈模式

Yalun Qi, Sichen Zhao, Zhiming Xue, Xianling Zeng, Zihan Yu

机构 * Khoury College of Computer Science Northeastern University Boston, United States College of Engineering Northeastern University Boston, United States College of Professional Studies Northeastern University Boston, United States

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出基于预训练Transformer模型的时间情感聚合框架,通过聚合评论情感信号检测用户反馈模式中的异常变化,实验证明其在社交媒体数据中有效识别显著情感下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00820 2026-04-02 cs.CV 50%

Continual Vision-Language Learning for Remote Sensing: Benchmarking and Analysis

遥感持续视觉-语言学习:基准测试与分析

Xingxing Weng, Ruifeng Ni, Chao Pang, XiangYu Hao, Yishan Wang, Xiaokang Zhang, Wei Xu, Gui-Song Xia

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出CLEaRS基准,评估遥感视觉-语言模型的持续学习能力,发现现有模型存在灾难性遗忘,需开发专用持续学习方法。

Comments 23 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19928 2026-04-02 eess.AS 50%

Measuring Prosody Diversity in Zero-Shot TTS: A New Metric, Benchmark, and Exploration

零样本文本到语音中语调多样性测量:一个新的度量标准、基准和探索

Yifan Yang, Bing Han, Hui Wang, Long Zhou, Wei Wang, Mingyu Cui, Xu Tan, Xie Chen

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出ProsodyEval数据集和DS-WED度量标准,用于评估零样本TTS的语调多样性,实验显示DS-WED在人类判断上表现更优,揭示影响语调多样性的因素。

Comments Accepted in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12185 2026-04-02 cs.CR 50%

Jailbreaking Generative AI: Multivector Phishing Threats and Transformer based Defenses

针对生成式AI的劫持:多向钓鱼威胁与基于Transformer的防御

Rina Mishra, Gaurav Varshney

专题命中 评测与基准 :LLM(abstract)

AI总结 本文研究了ChatGPT-4o-Mini的劫持漏洞,显示初学者可通过绕过防护生成多向钓鱼攻击,并提出基于Transformer的检测框架以应对风险。

详情

展开后加载摘要…

URL PDF HTML 收藏