arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-17 至 2026-04-17 共收录 297 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 77 篇

2604.14696 2026-04-17 physics.data-an 82%

Development of an LLM-Based System for Automatic Code Generation from HEP Publications

基于大语言模型的自动代码生成系统开发:从高能物理出版物中生成可执行分析代码

Masahiko Saito, Tomoe Kishimoto, Junichi Tanaka

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出利用大语言模型从高能物理论文中提取分析流程并生成可执行代码,验证了其在高能物理分析中的可行性与局限性。

Comments Proceedings of the International Symposium on Grids and Clouds (ISGC2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14970 2026-04-17 cs.CL 81%

Explain the Flag: Contextualizing Hate Speech Beyond Censorship

解释旗帜:超越审查的仇恨言论语境化

Jason Liartis, Eirini Kaldeli, Lambrini Gyftokosta, Eleftherios Chelioudakis, Orfeas Menis Mastromichalakis

机构 * National Technical University of Athens(国家技术大学雅典) Datoptron Homo Digitalis University of the Aegean(爱琴海大学) Instituto de Telecomunicações(电信研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种结合大语言模型和新编词汇的混合方法,用于检测并解释英语、法语和希腊语中的仇恨言论,提升透明度和可问责性。

Comments Accepted in the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14867 2026-04-17 cs.SE cs.AI 81%

Vibe-Coding: Feedback-Based Automated Verification with no Human Code Inspection, a Feasibility Study

Vibe-Coding:基于反馈的自动验证无需人工代码检查,可行性研究

Michal Töpfer, František Plášil, Tomáš Bureš, Petr Hnětynka

机构 * Charles University Prague(布拉格查理大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文研究了在集体自适应系统中基于反馈的自动验证方法,探讨了反馈精度对LLM生成代码可靠性的影响,证明精细反馈能有效生成有效适应管理者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14513 2026-04-17 cs.CL 81%

PeerPrism: Peer Evaluation Expertise vs Review-writing AI

PeerPrism:同行评价专业性与审稿写作AI

Soroush Sadeghian, Alireza Daqiq, Radin Cheraghi, Sajad Ebrahimi, Negar Arabzadeh, Ebrahim Bagheri

机构 * University of Toronto, Reviewerly(多伦多大学,Reviewerly)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PeerPrism基准测试,通过20690篇同行评审数据,区分思想来源与文本来源,揭示现有检测方法在混合场景下的不足,强调需多维度建模作者身份。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14455 2026-04-17 cs.AI 81%

AIBuildAI: An AI Agent for Automatically Building AI Models

AIBuildAI: 一个用于自动构建AI模型的AI代理

Ruiyi Zhang, Peijia Qin, Qi Cao, Li Zhang, Pengtao Xie

机构 * Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) Department of Medicine, University of California San Diego(加州大学圣地亚哥分校医学系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AIBuildAI通过分层代理架构自动构建AI模型,超越传统AutoML,实现端到端自动化,展示出在Kaggle风格任务中63.1%的获奖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07338 2026-04-17 cs.CL 81%

Beyond Literal Mapping: Benchmarking and Improving Non-Literal Translation Evaluation

超越字面映射:非字面翻译评估的基准测试与改进

Yanzhi Tian, Cunxiang Wang, Zeming Liu, Heyan Huang, Wenbo Yu, Dawei Song, Jie Tang, Yuhang Guo

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Zhipu AI(智谱AI) The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程组) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出RATE框架,通过反思核心代理动态调用专用子代理,提升非字面翻译评估的准确性,实验显示其在系统和段级相关性上比现有方法提高至少3.2分。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15134 2026-04-17 cs.CV 80%

How to Correctly Make Mistakes: A Framework for Constructing and Benchmarking Mistake Aware Egocentric Procedural Videos

如何正确犯错:一个用于构建和基准测试错误感知第一人称视频的框架

Olga Loginova, Frank Keller

机构 * University of Trento(特伦托大学) University of Edinburgh(爱丁堡大学) Italy(意大利) United Kingdom(大不列颠岛)

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文提出PIE-V框架,通过引入可控的人类合理偏差来构建和评估错误感知的第一人称视频,结合心理学启发的错误计划、纠正计划、LLM作家和评委,提升视频的合理性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14991 2026-04-17 cs.AI 79%

Predicting Power-System Dynamic Trajectories with Foundation Models

利用基础模型预测电力系统动态轨迹

Haoran Li, Lihao Mai, Chenhan Xiao, Erik Blasch, Yang Weng

机构 * School of Electrical, Computer and Energy Engineering at Arizona State University(亚利桑那州立大学电气、计算机与能源工程学院) MOVEJ Analytics

专题命中 评测与基准 :foundation model(title);pretraining(abstract);分类 cs.AI

AI总结 本文提出LASS-ODE-Power框架,通过大规模预训练学习可迁移的表示,实现跨不同动态 regime 的轨迹预测,无需数据共享即可在零样本设置中应用,并通过高效推理和定制化微调策略提升电力系统任务性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01728 2026-04-17 cs.RO cs.LG cs.LO 79%

Constrained Decoding for Safe Robot Navigation Foundation Models

安全机器人导航基础模型的约束解码

Parv Kapoor, Akila Ganlath, Michael Clifford, Changliu Liu, Sebastian Scherer, Eunsuk Kang

机构 * Carnegie Mellon University(卡内基梅隆大学) Toyota InfoTech Labs(丰田信息科技实验室)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出SafeDec框架,通过约束解码确保机器人导航基础模型满足信号时间逻辑规范,提升安全性和行动生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14838 2026-04-17 cs.AI 79%

Intermediate Layers Encode Optimal Biological Representations in Single-Cell Foundation Models

中间层编码最优的生物表示在单细胞基础模型中

Vincenzo Yuto Civale, Roberto Semeraro, Andrew David Bagdanov, Alberto Magi

机构 * University of Siena(锡耶纳大学) University of Firenze(佛罗伦萨大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 研究发现单细胞基础模型中中间层编码最优生物表示,任务和细胞状态依赖性显著,需系统评估各层以优化生物任务性能。

Comments 9 pages, 2 figures, 4 tables. Accepted at the LMRL (Learning Meaningful Representations of Life) Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14261 2026-04-17 cs.CL cs.AI 79%

ReviewGrounder: Improving Review Substantiveness with Rubric-Guided, Tool-Integrated Agents

ReviewGrounder:通过规则引导和工具集成代理提升评审的实质内容

Zhuofeng Li, Yi Lu, Dongfu Jiang, Haoxiang Zhang, Yuyang Bai, Chuan Li, Yu Wang, Shuiwang Ji, Jianwen Xie, Yu Zhang

机构 * Texas A&M University(德克萨斯A&M大学) University of Waterloo(滑铁卢大学) UC San Diego(南加州大学) Lambda University of Oregon(俄勒冈大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ReviewGrounder框架,通过规则引导和工具集成提升AI会议评审的实质内容,实验表明其在8个维度上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14582 2026-04-17 cs.CV 78%

MapSR: Prompt-Driven Land Cover Map Super-Resolution via Vision Foundation Models

MapSR: 通过视觉基础模型实现基于提示的土地覆盖图超分辨率

Ruiqi Wang, Qi Yu, Jie Ma, Hanlin Wu

机构 * School of Information Science and Technology, Beijing Foreign Studies University(信息科学与技术学院,北京外国语大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出MapSR框架,通过轻量线性探针提取类提示,实现无需密集标注的高分辨率土地覆盖图生成,有效降低计算成本并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20122 2026-04-17 cs.CV 78%

MEBench: A Novel Benchmark for Understanding Mutual Exclusivity Bias in Vision-Language Models

MEBench:一种新的评估视觉-语言模型互斥偏差的基准

Anh Thai, Stefan Stojanov, Zixuan Huang, Bikram Boote, James M. Rehg

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :language model(title,abstract)

AI总结 MEBench通过引入空间推理提升评估难度,评估视觉-语言模型对互斥偏差的处理能力,发现模型存在弱互斥偏差但能利用额外空间上下文解决歧义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15082 2026-04-17 cs.AR cs.AI 77%

Autonomous Evolution of EDA Tools: Multi-Agent Self-Evolved ABC

自主进化EDA工具:多智能体自进化ABC

Cunxi Yu, Haoxing Ren

机构 * NVIDIA Research(NVIDIA研究) University of Maryland(马里兰大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出首个自进化逻辑综合框架,利用大语言模型代理自主改进ABC逻辑综合系统源代码,通过多套基准测试验证其在大规模代码层面的自主进化能力。

Comments 7 pages; To appear at DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14437 2026-04-17 cs.SE cs.AI 77%

LLMs taking shortcuts in test generation: A study with SAP HANA and LevelDB

大语言模型在测试生成中的捷径行为:SAP HANA与LevelDB的实证研究

Vekil Bekmyradov, Noah C. Pütz, Thomas Bartz-Beielstein

机构 * THK-AI Research Cluster(THK人工智能研究集群) TH Köln(TH科伦大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究大语言模型在软件自动化测试生成中的行为,通过对比开源系统LevelDB与商用数据库SAP HANA的测试表现,揭示LLMs在熟悉领域表现优异但面对新复杂领域时依赖编译性而非语义有效性,强调需建立惩罚捷径、奖励泛化的能力评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14255 2026-04-17 cs.CL cs.AI 76%

Cosine-Similarity Routing with Semantic Anchors for Interpretable Mixture-of-Experts Language Models

基于语义锚点的余弦相似性路由用于可解释的混合专家语言模型

Ivan Ternovtsii, Yurii Bilak

机构 * Department of Software Systems, Uzhhorod National University(软件系统系,乌日霍罗德国立大学)

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.AI

AI总结 本文提出语义共振架构(SRA),通过令牌表示与可学习语义锚点之间的余弦相似性路由令牌到专家,使路由决策可追溯至锚令牌相似度得分。实验表明余弦路由在 perplexity 上与标准线性路由相当,同时减少死专家比例并提升子令牌一致性。

Comments 23 pages, 6 figures. Code available at https://github.com/ITernovtsii/semantic-resonance. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15224 2026-04-17 cs.AI cs.CL cs.LG 75%

Context Over Content: Exposing Evaluation Faking in Automated Judges

上下文而非内容:揭示自动化评判中的评估造假

Manan Gupta, Inderjeet Nair, Lu Wang, Dhruv Kumar

机构 * BITS Pilani(比特学院) University of Michigan(密歇根大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示自动化评判中因后果信号导致的宽大偏见,指出评判模型在不知情情况下受后果影响而降低评判标准,核心贡献是提出控制实验框架以检测此类评估造假。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14265 2026-04-17 cs.LG cs.AI 73%

Reinforcement Learning via Value Gradient Flow

通过价值梯度流进行强化学习

Haoran Xu, Kaiwen Hu, Somayeh Sojoudi, Amy Zhang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出价值梯度流(VGF)方法,通过最优传输问题解决行为正则化的强化学习问题,实现大规模生成模型的可扩展性,并在离线强化学习和大语言模型强化学习任务中取得最佳性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14162 2026-04-17 cs.CL cs.LG 73%

Decoupling Scores and Text: The Politeness Principle in Peer Review

分离评分与文本:同行评审中的礼貌原则

Yingxuan Wen

机构 * Harbin Intitute Of Technology(哈尔滨理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨同行评审中评分与文本反馈的差异,发现评分模型准确率更高,而文本模型受礼貌原则影响,使负面信号被掩盖,导致作者难以判断结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14941 2026-04-17 cs.CL 70%

Text2Arch: A Dataset for Generating Scientific Architecture Diagrams from Natural Language Descriptions

Text2Arch:一个用于从自然语言描述生成科学架构图的数据库

Shivank Garg, Sankalp Mittal, Manish Gupta

机构 * IIT Roorkee, India(印度拉尔·克里希纳理工学院) Google, India(印度谷歌) Microsoft, India(印度微软)

专题命中 评测与基准 :language model(abstract);small language model(abstract);分类 cs.CL

AI总结 本文提出Text2Arch数据库,通过语言模型生成高保真的架构图,解决了文本生成架构图的效率和歧义问题,并展示了其在多个应用中的优势。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11529 2026-04-17 cs.LG 70%

TempusBench: An Evaluation Framework for Time-Series Forecasting

TempusBench: 一个时间序列预测的评估框架

Denizalp Goktas, Gerardo Riaño-Briceño, Alif Abdullah, Aryan Nair, Chenkai Shen, Beatriz de Lucio, Alexandra Magnusson, Farhan Mashrur, Ahmed Abdulla, Shawrna Sen, Mahitha Thippireddy, Gregory Schwartz, Amy Greenwald

机构 * Simulacrum New York City, NY, USA(Simulacrum纽约市)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出TempusBench,一个用于时间序列预测模型评估的开源框架,解决现有评估框架在数据集、任务定义、超参数调优和可视化工具等方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14634 2026-04-17 cs.CL 70%

Pushing the Boundaries of Multiple Choice Evaluation to One Hundred Options

将多项选择评估的边界推向一百个选项

Nahyun Lee, Guijin Son

机构 * Chung-Ang University(Chung-Ang 大学) Seoul National University(首尔国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种大规模选项评估协议,通过将候选集扩展到100个选项来减少偶然性影响,揭示了高干扰下模型性能的局限性,发现语义混淆和位置偏差是主要失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14474 2026-04-17 cs.LG 70%

Scouting By Reward: VLM-TO-IRL-Driven Player Selection For Esports

通过奖励进行 scouting:由 VLM-TO-IRL 驱动的电子竞技玩家选拔

Qing Yan, Wenyu Yang, Yufei Wang, Wenhao Ma, Linchong Hu, Yifei Jin, Anton Dahbura

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Pennsylvania(宾夕法尼亚大学) Cornell University(康奈尔大学)

专题命中 评测与基准 :language model(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一种基于逆强化学习的电子竞技玩家选拔框架,通过学习专业选手的奖励函数,利用多模态双分支架构和 GAIL 目标实现玩家风格匹配评估,提升人才发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14324 2026-04-17 cs.CL 70%

Purging the Gray Zone: Latent-Geometric Denoising for Precise Knowledge Boundary Awareness

清除灰区:用于精确知识边界意识的潜在几何去噪

Hao An, Yibin Lou, Jiayi Guo, Yang Xu

机构 * Computational Linguistics and Consciousness Sciences Lab(计算语言学与意识科学实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出GeoDe框架,通过几何去噪方法减少模型在决策边界附近的模糊性,提升模型的准确性和泛化能力。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14256 2026-04-17 cs.IR cs.AI 70%

Evaluation of Agents under Simulated AI Marketplace Dynamics

对模拟AI市场动态下代理的评估

To Eun Kim, Alireza Salemi, Hamed Zamani, Fernando Diaz

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Marketplace Evaluation框架,通过模拟市场动态评估信息访问系统,补充传统准确度指标,探讨市场留存和份额等指标。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14227 2026-04-17 cs.IR cs.AI 70%

FRESCO: Benchmarking and Optimizing Re-rankers for Evolving Semantic Conflict in Retrieval-Augmented Generation

FRESCO:用于检索增强生成中动态语义冲突的重排序器基准测试与优化

Sohyun An, Hayeon Lee, Shuibenyang Yuan, Chun-cheng Jason Chen, Cho-Jui Hsieh, Vijai Mohan, Alexander Min

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FRESCO针对检索增强生成中动态语义冲突问题,评估重排序器在时间动态场景下的性能,发现现有重排序器对较旧文档存在偏见,通过指令优化框架改进了27%的动态知识任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14169 2026-04-17 cs.CL 70%

Chronological Knowledge Retrieval: A Retrieval-Augmented Generation Approach to Construction Project Documentation

时间知识检索:一种基于检索增强生成的方法用于建设项目文档

Ioannis-Aris Kostis, Natalia Sanchiz, Steeve De Schryver, François Denis, Pierre Schaus

机构 * Université Catholique de Louvain, ICTEAM/INGI(列日大学,ICTEAM/INGI) Buildwise BPC Group(BPC集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种基于检索增强生成的方法,用于建设项目文档的时间知识检索,通过语义搜索与大语言模型结合,实现对项目会议记录的对话式访问,支持时间标注的决策历史查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03920 2026-04-17 cs.CL 70%

From Plausible to Causal: Counterfactual Semantics for Policy Evaluation in Simulated Online Communities

从合理到因果:用于模拟在线社区政策评估的反事实语义

Agam Goyal, Yian Wang, Eshwar Chandrasekharan, Hari Sundaram

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出采用因果反事实框架,区分必要因果与充分因果,以支持政策评估中的因果推理,推动模拟从视觉真实转向政策支持。

Comments Accepted to PoliSim@CHI'26: 6 pages, 1 table (Best Paper Award)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18294 2026-04-17 cs.AI 70%

The Validity Gap in Health AI Evaluation: A Cross-Sectional Analysis of Benchmark Composition

健康AI评估中的有效性缺口:基准组成的横断面分析

Alvin Rajkomar, Pavan Sudarshan, Angela Lai, Lily Peng

机构 * Apple(苹果公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究指出当前健康AI基准测试在临床需求与实际应用间存在有效性缺口,缺乏真实临床数据和脆弱群体代表,需建立标准化查询分析以提升评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04738 2026-04-17 cs.CL 70%

IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation

IF-RewardBench:用于指令遵循评估的评判模型基准测试

Bosi Wen, Yilin Niu, Cunxiang Wang, Xiaoying Ling, Ying Zhang, Pei Ke, Hongning Wang, Minlie Huang

机构 * The Conversational Artificial Intelligence (CoAI) Group, Tsinghua University(清华大学对话人工智能(CoAI)小组) Zhipu AI(智谱AI) University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出IF-RewardBench,一个全面的指令遵循元评估基准,通过构建偏好图评估评判模型的排序能力,揭示现有模型缺陷,并展示其在下游任务中的更强相关性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏