arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-08 至 2026-04-08 共收录 285 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 69 篇

2602.00185 2026-04-08 cond-mat.mtrl-sci cs.AI 70%

QUASAR: A Universal Autonomous System for Atomistic Simulation and a Benchmark of Its Capabilities

QUASAR:一个通用的自主系统用于原子模拟及其能力的基准测试

Fengxu Yang, Jack D. Evans

机构 * School of Physics, Chemistry and Earth Sciences, Adelaide University(阿德莱德大学物理、化学与地球科学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 QUASAR通过整合多种原子模拟方法,实现自主的多尺度工作流,展示了其在材料筛选和新型材料评估中的应用潜力。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06565 2026-04-08 cs.CL 70%

EVM-QuestBench: An Execution-Grounded Benchmark for Natural-Language Transaction Code Generation

EVM-QuestBench: 一个基于执行的自然语言交易代码生成基准测试

Pei Yang, Wanyi Chen, Ke Wang, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EVM-QuestBench,一个基于执行的自然语言交易脚本生成基准测试,包含107个任务,通过动态评估和模块化架构评估20个模型,发现单步精度与多步流程完成存在显著差异。

Comments 10 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13027 2026-04-08 cs.LG cs.CR cs.IT math.IT stat.ML 70%

Towards Better Statistical Understanding of Watermarking LLMs

迈向大语言模型水印技术的更深入统计理解

Zhongze Cai, Shang Liu, Hanzhao Wang, Huaiyang Zhong, Xiaocheng Li

机构 * Imperial College Business School, Imperial College London(帝国理工学院商学院,帝国理工学院) The University of Sydney Business School, The University of Sydney(悉尼大学商学院,悉尼大学) Grado Department of Industrial and Systems Engineering, Virginia Tech(弗吉尼亚理工大学工业与系统工程系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究大语言模型水印技术,通过红绿名单算法建立约束优化问题,提出在线双梯度上升算法,证明其渐近帕累托最优性,提升检测能力并系统讨论模型失真度度量选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05475 2026-04-08 cs.CV 67%

A Synthetic Eye Movement Dataset for Script Reading Detection: Real Trajectory Replay on a 3D Simulator

用于脚本阅读检测的合成眼动数据集:在3D模拟器上的真实轨迹回放

Kidus Zewde, Yuchen Zhou, Dennis Ng, Neo Tiangratanakul, Tommy Duong, Ankit Raj, Yuxin Zhang, Xingyu Shen, Simiao Ren

专题命中 评测与基准 :language model(abstract);pretraining(abstract)

AI总结 本文提出一种生成合成眼动视频的 pipeline,通过回放真实人类虹膜轨迹生成12小时的合成数据,用于脚本阅读检测任务,验证了生成轨迹在时间动态上的有效性。

Comments Synthetic eye movement dataset generation via 3D eye simulator; iris trajectory replay; script reading detection; behavioral data augmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05536 2026-04-08 cs.CL cs.AI 62%

Turbulence-like 5/3 spectral scaling in contextual representations of language as a complex system

语言作为复杂系统的情境表示中呈现湍流样的5/3谱 scaling

Zhongxin Yang, Chun Bao, Yuanwei Bin, Xiang I. A. Yang, Shiyi Chen

机构 * College of Engineering, Peking University(北京大学工学院) Ningbo Institute of Digital Twin, Eastern Institute of Technology(东方理工高等研究院宁波数字孪生研究院) Shenzhen Tenfong Technology Co., Ltd.(深圳腾方科技有限公司) Mechanical Engineering, Pennsylvania State University(宾夕法尼亚州立大学机械工程系)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过变换器语言模型生成高维嵌入空间,发现文本序列中嵌入步信号的功率谱在宽频率范围内呈现接近5/3的幂律,表明语言表示具有多尺度、依赖上下文的组织特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05467 2026-04-08 cs.IR cs.CL cs.LG 62%

CUE-R: Beyond the Final Answer in Retrieval-Augmented Generation

CUE-R:超越检索增强生成的最终答案

Siddharth Jain, Venkat Narayan Vedam

机构 * Intuit

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 CUE-R通过干预基于证据项的检索使用痕迹,评估单次检索增强生成中每个证据项的操作效用,揭示证据项对正确性、基础忠实度和置信度误差的影响。

Comments 6 figures, 14 tables; appendix includes bootstrap CIs, metric definitions, duplicate position sensitivity, prompt template, and reproducibility details

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05243 2026-04-08 cs.CL cs.AI 62%

Exemplar Retrieval Without Overhypothesis Induction: Limits of Distributional Sequence Learning in Early Word Learning

示例检索无需过度假设归纳:早期词语学习中分布序列学习的局限

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了分布序列学习在早期词语学习中的局限,通过实验发现模型在第一阶示例检索上表现优异,但第二阶归纳仍处于偶然水平,揭示了自回归分布序列学习的不足。

Comments 27 pages, 7 figures, 22 references. Pre-registered study (OSF: https://osf.io/qj9hb/). Code and data: https://github.com/synthiumjp/overhypothesis. Submitted to Cognitive Computation

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22765 2026-04-08 cs.CL cs.SD eess.AS 57%

StressTest: Can YOUR Speech LM Handle the Stress?

StressTest: 你的语音语言模型能承受压力测试吗?

Iddo Yosha, Gallil Maimon, Yossi Adi

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出StressTest基准,评估语音模型在应力模式下区分语音含义的能力,发现现有模型表现不佳,并提出StresSLM模型在压力推理和检测上优于现有模型。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05624 2026-04-08 cs.CL 57%

YoNER: A New Yorùbá Multi-domain Named Entity Recognition Dataset

YoNER:一种新的约鲁巴多领域命名实体识别数据集

Peace Busola Falola, Jesujoba O. Alabi, Solomon O. Akinola, Folashade T. Ogunajo, Emmanuel Oluwadunsin Alabi, David Ifeoluwa Adelani

机构 * University of Ibadan(伊巴丹大学) Saarland University(萨尔大学) Atiba University(阿提巴大学) Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所) McGill University(麦吉尔大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出YoNER数据集,用于扩展约鲁巴语言的多领域命名实体识别,通过跨领域实验评估模型性能,并引入OyoBERT模型提升领域内表现。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05613 2026-04-08 cs.LG 57%

Same Graph, Different Likelihoods: Calibration of Autoregressive Graph Generators via Permutation-Equivalent Encodings

同一图,不同似然度:通过排列等价编码校准自回归图生成器

Laurits Fredsgaard, Aaron Thomas, Michael Riis Andersen, Mikkel N. Schmidt, Mahito Sugiyama

机构 * Technical University of Denmark(丹麦技术大学) University of Birmingham(伯明翰大学) National Institute of Informatics(国立信息学研究所)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文通过排列等价编码量化自回归图生成器的似然度不一致问题,发现模型更倾向于训练线性化而非图结构本身,且基于排列的评估更可靠。

Comments Workshop 'Towards Trustworthy Predictions: Theory and Applications of Calibration for Modern AI' at AISTATS 2026, Tangier, Morocco

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05547 2026-04-08 cs.AI cs.GR 57%

COSMO-Agent: Tool-Augmented Agent for Closed-loop Optimization,Simulation,and Modeling Orchestration

COSMO-Agent:增强工具的代理用于闭环优化、仿真和建模协调

Liyuan Deng, Shujian Deng, Yongkang Chen, Yongkang Dai, Zhihang Zhong, Linyang Li, Xiao Sun, Yilei Shi, Huaxi Huang

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出COSMO-Agent框架,通过强化学习使LLM完成闭环CAD-CAE流程,解决CAD-CAE语义鸿沟问题,提升设计效率和稳定性。

Comments 10 pages, 3 figures, preprint paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05482 2026-04-08 cs.CV cs.AI 57%

Unifying VLM-Guided Flow Matching and Spectral Anomaly Detection for Interpretable Veterinary Diagnosis

统一视觉语言模型引导的流匹配与谱异常检测用于可解释的兽医诊断

Pu Wang, Zhixuan Mao, Jialu Li, Zhuoran Zheng, Dianjie Lu, Youshan Zhang

机构 * School of Mathematics, Shandong University(山东大学数学学院) Shenzhen Loop Area Institute(深圳河套学院) Yeshiva University(叶史瓦大学) Qilu University of Technology(齐鲁工业大学) Shandong Normal University(山东师范大学) Chuzhou University(滁州学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出一种结合流匹配与谱异常检测的新方法,通过视觉语言模型引导分割和随机矩阵理论分析,实现高精度可解释的犬类气胸诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05345 2026-04-08 cs.AI 57%

Dynamic Agentic AI Expert Profiler System Architecture for Multidomain Intelligence Modeling

多领域智能建模的动态代理AI专家Profiler系统架构

Aisvarya Adeseye, Jouni Isoaho, Seppo Virtanen, Mohammad Tahir

机构 * Department of Computing, University of Turku(图尔库大学计算系)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出一种动态代理AI专家Profiler系统,通过多层模块化架构对自然语言响应进行四个级别分类,实验显示在多领域中83%-97%的评估与自我评估一致。

Comments Accepted to be Published in IEEE Conference on Artificial Intelligence (CAI) 2026 - May 8-10, 2026, Granada, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05278 2026-04-08 cs.SE cs.AI cs.MA 57%

Spec Kit Agents: Context-Grounded Agentic Workflows

Spec Kit Agents:基于上下文的代理工作流

Pardis Taghavi, Santosh Bhavani

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出Spec Kit Agents,一种多代理的规范驱动开发流程,通过添加阶段级上下文绑定钩子,提升代码质量与测试兼容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05100 2026-04-08 cs.SE cs.AI 57%

Edit, But Verify: An Empirical Audit of Instructed Code-Editing Benchmarks

修改但验证:对指导性代码修改基准的实证审计

Amir M. Ebrahimi, Gopi Krishnan Rajbahadur

机构 * Queen's University(女王大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文实证审计了两个指导性代码修改基准,发现其在编程语言、编辑意图和应用领域上存在偏差,且测试覆盖率和测试范围不足,提出六个实证指导原则以改进基准设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02591 2026-04-08 cs.CL 57%

CharBench: Evaluating the Role of Tokenization in Character-Level Tasks

CharBench:评估字符级任务中分词作用

Omri Uzan, Yuval Pinter

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 CharBench通过大规模字符级任务评估,揭示了分词对字符级任务性能的影响,发现tokenization与正确性弱相关,而词长和字符数更关键,且长token会掩盖字符位置信息。

Comments AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05926 2026-04-08 cs.HC 50%

FEEL: Quantifying Heterogeneity in Physiological Signals for Generalizable Emotion Recognition

FEEL:量化生理信号异质性以实现通用情感识别

Pragya Singh, Ankush Gupta, Somay Jalan, Mohan Kumar, Pushpendra Singh

专题命中 评测与基准 :pretraining(abstract)

AI总结 FEEL通过评估19个数据集上的EDA和PPG信号,探讨了情感识别中异质性的影响,发现CLSP模型在F1分数上表现最佳,而传统模型和手工特征方法也具有竞争力。

Comments Published at Conference on Neural Information Processing Systems (NeurIPS 2025) Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09746 2026-04-08 cs.MA 50%

Multi-Agent Cooperative Learning for Robust Vision-Language Alignment under OOD Concepts

多智能体协作学习用于应对异常概念下的鲁棒视觉语言对齐

Philip Xu

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出多智能体协作学习框架,通过结构化信息传递缓解模态不平衡,提升视觉语言模型在异常概念下的对齐性能,实验表明在少样本和零样本设置中精度提升1-5%。

Comments arXiv admin note: This submission has been withdrawn by arXiv administrators due to incorrect authorship. Author list truncated

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05753 2026-04-08 cs.SE 50%

An End-to-End Approach for Fixing Concurrency Bugs via SHB-Based Context Extractor

一种基于SHB上下文提取器的端到端并发bug修复方法

Zhuang Li, Qiuping Yi, Keyang Xiao, Zongcheng Ji, Hongliang Liang

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出ConFixAgent,一种基于LLM的端到端并发bug修复工具,通过静态发生前图识别相关代码段,提升修复准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05507 2026-04-08 cs.CY 50%

From Pixels to Personas: Tracking the Evolution of Anime Characters

从像素到人物:动漫角色演变的追踪

Rongze Liu, Jiaxin Pei, Jian Zhu

专题命中 评测与基准 :LLM(abstract)

AI总结 研究通过大规模多模态数据集分析动漫角色演变,结合LLM提取的性格特征与视觉特征,揭示观众群体从儿童向青少年过渡,角色设计呈现萌系化趋势,视觉信号比性格特征更主导观众偏好。

Comments Accepted at the 20th International AAAI Conference on Web and Social Media (ICWSM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05256 2026-04-08 cs.CV 50%

Protecting and Preserving Protest Dynamics for Responsible Analysis

为负责任分析保护和保存抗议动态

Cohen Archbold, Usman Hassan, Nazmus Sakib, Sen-ching Cheung, Abdullah-Al-Zubaer Imran

机构 * University of Kentucky(肯塔基大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出一种负责任的计算框架,通过条件图像合成生成合成图像来保护隐私,分析抗议动态的同时减少隐私风险,并评估生成数据的公平性。

Comments 21 pages, 6 figures, Submitted to ACM Journal on Responsible Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05180 2026-04-08 cs.CV 50%

MIRAGE: Benchmarking and Aligning Multi-Instance Image Editing

MIRAGE:多实例图像编辑的基准测试与对齐

Ziqian Liu, Stephan Alaniz

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris, France(法国巴黎理工学院电信巴黎分校LTCI实验室)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出MIRAGE框架,通过多分支并行去噪策略实现精确多实例编辑,解决现有方法在多实例和复合指令下的过度编辑和空间错位问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05130 2026-04-08 cs.SE 50%

A Multi-Agent Framework for Automated Exploit Generation with Constraint-Guided Comprehension and Reflection

面向自动漏洞生成的多智能体框架:基于约束引导的推理与反思

Siyi Chen, Tianhan Luo, Shijian Wu, Xiangyu Liu, Yilin Zhou, Qi Li, Wenyuan Xu

专题命中 评测与基准 :LLM(abstract)

AI总结 本文提出Vulnsage多智能体框架,通过分解复杂漏洞生成过程为多个专业化子智能体,结合LLM生成候选漏洞利用代码,并通过反馈驱动的自完善循环提升漏洞生成效率与准确性,实验证明其在生成漏洞利用代码和发现零日漏洞方面优于现有工具。

Journal ref 34th IEEE/ACM International Conference on Program Comprehension (ICPC '26), April 12--13, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24935 2026-04-08 cs.RO 50%

SABER: A Stealthy Agentic Black-Box Attack Framework for Vision-Language-Action Models

SABER:一种针对视觉-语言-动作模型的隐秘代理黑盒攻击框架

Xiyang Wu, Guangyao Shi, Qingzi Wang, Zongxia Li, Amrit Singh Bedi, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校) University of Southern California(南加州大学) University of Central Florida(中佛罗里达大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 SABER通过生成最小有效指令修改,评估VLA模型的鲁棒性,展示小幅度指令扰动可显著降低机器人执行效果,且代理黑盒方法在红队测试中表现高效且可扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23684 2026-04-08 cs.CV 50%

MoCHA: Denoising Caption Supervision for Motion-Text Retrieval

MoCHA:用于运动-文本检索的去噪标签监督

Nikolai Warner, Cameron Ethan Taylor, Irfan Essa, Apaar Sadhwani

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊)

专题命中 评测与基准 :LLM(abstract)

AI总结 MoCHA通过将文本转换为运动可恢复内容的先验分布,减少运动-文本嵌入方差,提升跨数据集迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 53 篇

2601.09726 2026-04-08 cs.CL 90%

Forgetting as a Feature: Cognitive Alignment of Large Language Models

作为特征的遗忘:大型语言模型的认知对齐

Alexandros Christoforos

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究将遗忘视为大型语言模型的认知机制,通过建立基准测试评估时间推理、概念漂移适应和联想回忆,发现模型遗忘率与人类记忆效率的权衡相似,并提出概率记忆提示策略提升长期推理性能。

Comments arXiv admin note: This submission has been withdrawn by arXiv administrators due to incorrect authorship. Author list truncated

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06013 2026-04-08 cs.AI cs.CL 88%

Epistemic Blinding: An Inference-Time Protocol for Auditing Prior Contamination in LLM-Assisted Analysis

知识盲区:一种用于审计LLM辅助分析中先验污染的推理时协议

Michael Cuccarese

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出了一种在代理系统中用于审计LLM辅助分析中先验污染的推理时协议,通过替换实体标识符以匿名代码并比较输出与未盲对照组,以恢复审计性。

Comments code and LLM skill at: https://github.com/mcuccarese/epistemic-blinding 7 pages 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05887 2026-04-08 cs.AI 88%

HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference

HybridKV: 为高效多模态大语言模型推理设计的混合KV缓存压缩

Bowen Zeng, Feiyang Ren, Jun Zhang, Xiaoling Gu, Ke Chen, Lidan Shou, Huan Li

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出HybridKV框架,通过分层预算分配和不同压缩策略,有效减少KV缓存内存占用并提升解码速度,实验表明在11个多模态基准上内存减少达7.9倍,解码速度提升1.52倍,性能损失极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05502 2026-04-08 cs.CR cs.LG 88%

AttnDiff: Attention-based Differential Fingerprinting for Large Language Models

AttnDiff:基于注意力的差分指纹法用于大语言模型

Haobo Zhang, Zhenhua Xu, Junxian Li, Shangfeng Sheng, Dezhang Kong, Meng Han

机构 * Zhejiang University of Technology(浙江工业大学) Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出AttnDiff,一种高效白盒框架,通过内在信息路由行为提取模型指纹,用于验证大语言模型的衍生关系,实现高相似度区分相关衍生模型与无关模型家族。

Comments Accepted at ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09438 2026-04-08 cs.CL 88%

GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models

GrACE:一种生成方法,用于改进置信度 elicitation 和大语言模型在测试时的高效扩展

Zhaohan Zhang, Ziquan Liu, Ioannis Patras

机构 * Queen Mary University of London(伦敦玛丽女王大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出GrACE,一种生成方法,用于改进大语言模型的置信度 elicitation 和测试时的高效扩展,通过实时计算隐藏状态与特殊标记嵌入的相似性,实现可靠且可扩展的置信度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏