arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-16 至 2026-04-16 共收录 267 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 44 篇

2604.13403 2026-04-16 cs.CV 67%

Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks

为何多模态上下文学习滞后?揭示内部机制和瓶颈

Yu Wang, Sharon Li

机构 * Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文分析了多模态上下文学习在零样本设置中表现与少样本演示下退化的原因,揭示了模型在视觉与文本表示对齐和任务映射转移方面的不足,并提出改进方法。

Comments ACL Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13384 2026-04-16 cs.NI 67%

Agentic Open RAN: A Deterministic and Auditable Framework for Intent-Driven Radio Control

代理式开放无线接入网:一种确定性和可审计的意图驱动无线控制框架

Hengxu Li, Dongkuan Xu, Mingzhe Chen, Yuchen Liu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出A1gent框架,通过分离推理与实时执行,实现意图驱动的无线控制,结合非实时代理和近实时代理,确保可审计的协调与可预测的适应性。

Comments 6 pages, 5 figures. Accepted at IEEE ICC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11244 2026-04-16 cs.CV 67%

Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding

Script-a-Video: 通过因子化流和关系 grounding 实现深度结构化音频视觉描述

Tencent Hunyuan Team

机构 * Tencent Hunyuan Team(腾讯文言团队)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出MTSS框架,通过因子化流和关系 grounding 解决视频描述中信息耦合问题,提升视频理解与生成性能,实验显示在多个基准测试中均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14140 2026-04-16 cs.LG cs.AI 62%

LongCoT: Benchmarking Long-Horizon Chain-of-Thought Reasoning

LongCoT:长周期链式推理基准测试

Sumeet Ramesh Motwani, Daniel Nichols, Charles London, Peggy Li, Fabio Pizzati, Acer Blake, Hasan Hammoud, Tavish McDonald, Akshat Naik, Alesia Ivanova, Vignesh Baskaran, Ivan Laptev, Ruben Glatt, Tal Ben-Nun, Philip Torr, Natasha Jaques, Ameya Prabhu, Brian Bartoldson, Bhavya Kailkhura, Christian Schroeder de Witt

机构 * University of Oxford(牛津大学) Lawrence Livermore National Laboratory (LLNL)(劳伦斯利弗莫尔国家实验室) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 LongCoT通过2500个专家设计的问题评估长周期链式推理能力,揭示前沿模型在长时间推理中的不足。

Comments Long-Horizon Reasoning Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23137 2026-04-16 cs.CV cs.CL 57%

When 'YES' Meets 'BUT': Can Large Models Comprehend Contradictory Humor Through Comparative Reasoning?

当‘是’遇见‘但是’:大型模型能否通过比较推理理解矛盾的幽默?

Tuo Liang, Zhe Hu, Jing Li, Hao Zhang, Yiren Lu, Yunlai Zhou, Yiran Qiao, Disheng Liu, Jeirui Peng, Jing Ma, Yu Yin

机构 * Computer and Data Sciences Department, Case Western Reserve University(卡内基梅隆大学计算机与数据科学系) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算系)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 本文探讨了大型视觉-语言模型在理解涉及复杂矛盾叙述的幽默时的挑战,通过分析漫画中的矛盾对比,提出YesBut基准,并评估了多种模型在比较推理任务中的表现,揭示了模型在视觉感知和叙事理解上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19088 2026-04-16 cs.CL cs.CV 57%

Cracking the Code of Juxtaposition: Can AI Models Understand the Humorous Contradictions

破解 juxtaposition 的密码:AI 模型能否理解幽默的矛盾

Zhe Hu, Tuo Liang, Jing Li, Yiren Lu, Yunlai Zhou, Yiran Qiao, Jing Ma, Yu Yin

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Department of Computer and Data Sciences, Case Western Reserve University(凯斯西储大学计算机与数据科学系)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 本文探讨了AI在理解基于矛盾叙事的幽默中的挑战,通过引入YesBut基准测试,评估大型语言模型在识别和解释漫画中的表现,发现即使是最先进的模型仍无法匹敌人类水平。

Comments NeurIPS 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13934 2026-04-16 cs.SE 50%

Towards Enabling An Artificial Self-Construction Software Life-cycle via Autopoietic Architectures

迈向通过自组织架构实现人工自构造软件生命周期

Daniel Rodriguez-Cardenas, David Nader Palacio, Denys Poshyvanyk

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 本文探讨了通过自组织架构(Psi-Arch)实现软件自构造的可能性,分析了传统维护方法的局限性,并提出了自构造的核心挑战,旨在推动软件工程新范式的发展。

Comments Positional Paper

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 71 篇

2604.14034 2026-04-16 cs.SE cs.AI cs.IR 92%

Large Language Models to Enhance Business Process Modeling: Past, Present, and Future Trends

大语言模型增强业务流程建模:过去、现在与未来趋势

João Bettencourt, Sérgio Guerreiro

机构 * INESC-ID

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文综述了利用大语言模型进行自然语言到BPMN流程模型转换的AI方法,分析了从规则基础到LLM架构的转变,指出语义正确性、评估碎片化等挑战,并提出未来研究方向。

Comments 27 pages, 2 images, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11334 2026-04-16 cs.CL 92%

LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models

LaoBench:一种大规模多维老挝语基准测试用于大语言模型

Jian Gao, Richeng Xuan, Zhaolu Kang, Dingshi Liao, Wenxin Huang, Zongmou Huang, Yangdi Xu, Bowen Qin, Zheqi He, Xi Yang, Changjin Li, Yonghua Lin

机构 * China-ASEAN Information Harbor Co., Ltd.(中国-东盟信息港有限公司) Beijing Academy of Artificial Intelligence(北京人工智能研究院) School of Software & Microelectronics, Peking University(北京大学软件与微电子学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出LaoBench,首个大规模多维老挝语基准测试,包含17000+样本,涵盖文化知识应用、K12教育和双语翻译,评估LLM在老挝语的理解与推理能力,发现多语言模型在文化推理和翻译准确性上仍落后于人类专家。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13041 2026-04-16 cs.DB cs.AI 92%

TableNet A Large-Scale Table Dataset with LLM-Powered Autonomous

TableNet:一个大规模表格数据集与LLM驱动的自主系统

Ruilin Zhang, Kai Yang

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TableNet通过LLM驱动的自主系统生成和识别表格,解决大规模高质量表格数据集的不足,提升表格结构识别的效率与精度。

Comments The 40th Annual AAAI Conference on Artificial Intelligence Bridge Program on Logic & AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03610 2026-04-16 cs.AI 92%

Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games

Orak:面向多样化视频游戏的LLM代理训练与评估基础基准

Dongmin Park, Minkyu Kim, Beongjun Choi, Junhyuck Kim, Keon Lee, Jonghyun Lee, Inkyu Park, Byeong-Uk Lee, Jaeyoung Hwang, Jaewoo Ahn, Ameya S. Mahabaleshwarkar, Bilal Kartal, Pritam Biswas, Yoshi Suhara, Kangwook Lee, Jaewoong Cho

机构 * KRAFTON Seoul National University(首尔国立大学) NVIDIA University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Ludo Robotics

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Orak通过12种主流视频游戏构建基础基准,系统评估LLM代理在不同游戏场景中的能力,提供统一评估框架和细调数据集,推动多样化游戏代理发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05096 2026-04-16 cs.CL 91%

RAG or Learning? Understanding the Limits of LLM Adaptation under Continuous Knowledge Drift in the Real World

RAG还是学习?在现实世界中连续知识漂移下理解LLM适应的极限

Hanbing Liu, Lang Cao, Yang Li

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) School of Artificial Intelligence, Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)人工智能学院) Shenzhen Key Laboratory of Ubiquitous Data Enabling, Tsinghua Shenzhen International Graduate School, Tsinghua University(深圳 ubiquitous 数据赋能重点实验室,清华大学深圳国际研究生院,清华大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出一个现实世界动态事件基准,评估模型在连续知识漂移下的适应能力,揭示现有方法如RAG和学习方法的局限性,并提出时间感知检索基线Chronos以提升时序一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13804 2026-04-16 cs.LG 90%

Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning

角色超越言语:通过强化学习利用角色扮演评估音频大语言模型

Dongjie Fu, Fangming Feng, Xize Cheng, Linjun Li, Zhou Zhao, Tao Jin

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出RoleJudge框架,通过多模态评估系统评估语音与角色的一致性,引入RoleChat数据集并采用多阶段训练和标准对齐强化学习,验证了多维评估框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05452 2026-04-16 cs.CL 90%

LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models

LLMEval-Fair: 一个大规模纵向研究,探讨大型语言模型的稳健与公平评估

Ming Zhang, Yujiong Shen, Jingyi Deng, Yuhui Wang, Huayu Sha, Kexin Tan, Qiyuan Peng, Yue Zhang, Junzhe Wang, Shichun Liu, Yueyuan Huang, Jingqi Tong, Changhao Jiang, Yilong Wu, Zhihao Zhang, Mingqi Wu, Mingxu Chai, Zhiheng Xi, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan NLP Group(复旦大学自然语言处理组)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 LLMEval-Fair通过动态评估框架和抗污染数据整理,揭示了静态基准无法检测的模型性能上限和数据污染问题,提供了更可靠的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23636 2026-04-16 cs.LG cs.AI 90%

FlexGuard: Continuous Risk Scoring for Strictness-Adaptive LLM Content Moderation

FlexGuard: 严格度自适应的连续风险评分用于LLM内容审核

Zhihao Ding, Jinming Li, Ze Lu, Jieming Shi

机构 * The Hong Kong Polytechnic University(香港理工大学) ByteDance(字节跳动)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出FlexGuard,一种基于LLM的连续风险评分系统,通过风险对齐优化提升审核准确性和在不同严格度下的鲁棒性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13528 2026-04-16 eess.AS cs.SD 90%

Few-Shot and Pseudo-Label Guided Speech Quality Evaluation with Large Language Models

基于少量样本和伪标签的语音质量评估方法

Ryandhimas E. Zezario, Dyah A. M. G. Wisnu, Szu-Wei Fu, Sabato Marco Siniscalchi, Hsin-Min Wang, Yu Tsao

机构 * Academia Sinica, National Chengchi University, NVIDIA, University of Palermo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出GatherMOS框架,利用大语言模型作为元评估器整合多种信号进行质量预测,通过零样本和少样本学习展示了其在不同条件下的优越性能。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13241 2026-04-16 cs.CE 89%

Early-Warning Learner Satisfaction Forecasting in MOOCs via Temporal Event Transformers and LLM Text Embeddings

通过时间事件Transformer和LLM文本嵌入在MOOCs中进行学习者满意度预警预测

Anna Kowalczyk, Jakub Kowalski

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出TET-LLM框架,结合时间事件Transformer、LLM嵌入和短文本主题分布,通过早期信号预测学习者满意度,实验表明其在7天预警范围内RMSE为0.82,AUC为0.77。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09819 2026-04-16 cs.LG cs.SY eess.SY 89%

FDM-Bench: A Comprehensive Benchmark for Evaluating Large Language Models in Additive Manufacturing Tasks

FDM-Bench:用于评估大型语言模型在增材制造任务中的综合基准

Ahmadreza Eslaminia, Adrian Jackson, Beitong Tian, Avi Stern, Hallie Gordon, Rajiv Malhotra, Klara Nahrstedt, Chenhui Shao

机构 * Department of Mechanical Science and Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校机械科学与工程系) Coordinated Science Laboratory, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校协调科学实验室) Department of Mechanical and Aerospace Engineering, Rutgers University(罗格斯大学机械与航空航天工程系) Department of Mechanical Engineering, University of Michigan(密歇根大学机械工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出FDM-Bench基准,用于评估大型语言模型在增材制造任务中的能力,通过用户查询和G代码样本评估不同模型的性能,发现闭源模型在检测G代码异常方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13504 2026-04-16 cs.LG cs.AI cs.CL cs.MA cs.RO 89%

Chain of Uncertain Rewards with Large Language Models for Reinforcement Learning

基于大语言模型的强化学习中不确定奖励链

Shentong Mo

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CoUR框架,利用大语言模型优化强化学习中的奖励函数设计,通过不确定性量化和贝叶斯优化提升效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08064 2026-04-16 cs.AI 88%

ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models

ImplicitMemBench: 测量大语言模型中的无意识行为适应

Chonghan Qin, Xiachong Feng, Weitao Ma, Xiaocheng Feng, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出ImplicitMemBench,首个评估大语言模型隐性记忆的系统基准,通过三个认知基础构念测试隐性记忆,揭示模型在自动执行任务中的局限性。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13282 2026-04-16 physics.med-ph 88%

Agentic MR sequence development: leveraging LLMs with MR skills for automatic physics-informed sequence development

代理MR序列开发:利用LLM与MR技能进行自动物理引导的序列开发

Moritz Zaiss, Amr Aly, Jonathan Endres, Tobias Dornstetter, Simon Weinmüller, Andreas Maier

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Agent4MR框架,利用LLM和物理验证报告自动生成并优化PyPulseq序列,减少交互次数,实现高效序列开发。

Comments Word count abstract/body: 223 / 4303

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13298 2026-04-16 cs.CR 87%

Can Agents Secure Hardware? Evaluating Agentic LLM-Driven Obfuscation for IP Protection

代理能保障硬件吗?评估基于大语言模型的代理式硬件网表混淆用于知识产权保护

Sujan Ghimire, Parsa Mirfasihi, Muhtasim Alam Chowdhury, Veeramani Pugazhenthi, Harish Kumar Dharavath, Farshad Firouzi, Rozhin Yasaei, Pratik Satam, Soheil Salehi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于大语言模型的代理式硬件网表混淆框架,通过分阶段任务处理电路分析、综合、验证和攻击评估,验证了其在ISCAS-85基准上的有效性,展示了混淆技术的潜力与局限。

Comments 5 pages, 3 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13413 2026-04-16 cs.LG 85%

Dataset-Level Metrics Attenuate Non-Determinism: A Fine-Grained Non-Determinism Evaluation in Diffusion Language Models

数据层面指标削弱非确定性:扩散语言模型中的细粒度非确定性评估

Zhengyu Fang, Zhimeng Jiang, Huiyuan Chen, Xiaoge Zhang, Tianyi Li, Kaiyu Tang, Xiao Li, Jing Li

机构 * Department of Computer Data Sciences, Case Western Reserve University, Cleveland, USA Department of Computer Science \& Engineering, Texas A\&M University, College Station, USA Department of Biochemistry, Case Western Reserve University, Cleveland, USA Center for RNA Science Therapeutics, Case Western Reserve University, Cleveland, USA Department of Biomedical Engineering, Case Western Reserve University, Cleveland, USA

专题命中 评测与基准 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.LG

AI总结 本文研究了扩散语言模型中非确定性问题,指出数据层面指标限制了对模型行为变化的洞察,并提出基于样本级预测差异的细粒度评估方法,揭示了非确定性在代码生成中的高敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13997 2026-04-16 cs.SE 83%

Learned or Memorized ? Quantifying Memorization Advantage in Code LLMs

学习还是记忆?量化代码大语言模型中的记忆优势

Djiré Albérick Euraste, Kaboré Abdoul Kader, Jordan Samhi, Earl T. Barr, Jacques Klein, Tegawendé F. Bissyandé

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文通过扰动方法量化代码LLM的记忆优势,评估8个开源代码LLM在19个基准测试中的表现,发现任务和模型差异显著,部分基准测试显示低敏感度,挑战了数据泄露的常见担忧。

Comments 12 pages, 12 figures. Accepted at ICSE 2026 (to appear)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06989 2026-04-16 cs.SE 83%

Human-aligned AI Model Cards with Weighted Hierarchy Architecture

面向人类的AI模型卡片与加权层次架构

Pengyue Yang, Haolin Jin, Qingwen Zeng, Jiawen Wen, Harry Rao, Huaming Chen

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出CRAI-MCF框架,通过加权层次架构和量化标准,提升模型评估与比较的严谨性,促进LLM的负责任采用。

Comments 11 pages, 5 figures, 9 tables. Published in FSE Companion 2026

Journal ref In Proceedings of the 34th ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering Companion (FSE Companion '26), Montreal, QC, Canada, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14074 2026-04-16 cs.CV 82%

Training-Free Semantic Multi-Object Tracking with Vision-Language Models

无需训练的语义多目标跟踪与视觉-语言模型

Laurence Bonat, Francesco Tonini, Elisa Ricci, Lorenzo Vaquero

机构 * Department of Information Engineering and Computer Science, University of Trento(信息工程与计算机科学系,特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 评测与基准 :language model(title);LLM(abstract);foundation model(abstract)

AI总结 本文提出TF-SMOT,一种无需训练的语义多目标跟踪方法,结合预训练组件生成时间一致的跟踪片段,并通过InternVideo2.5生成视频摘要和实例描述,同时通过语义检索提升交互识别性能。

Comments Accepted to the 20th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13888 2026-04-16 cs.AI 81%

GeoAgentBench: A Dynamic Execution Benchmark for Tool-Augmented Agents in Spatial Analysis

GeoAgentBench: 一种面向空间分析工具增强代理的动态执行基准

Bo Yu, Cheng Yang, Dongyang Hou, Chengfu Liu, Jiayao Liu, Chi Wang, Zhiming Zhang, Haifeng Li, Wentao Yang

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) School of Earth Sciences and Spatial Information Engineering, Hunan University of Science and Technology(湖南科技大学地球科学与空间信息工程学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出GeoAgentBench,通过动态执行沙盒评估地理信息代理,引入PEA指标和视觉语言模型验证,改进Plan-and-React架构,提升空间分析代理的执行鲁棒性与逻辑严谨性。

Comments 20 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13817 2026-04-16 cs.LG 81%

RPS: Information Elicitation with Reinforcement Prompt Selection

RPS: 通过强化提示选择进行信息获取

Tao Wang, Jingyao Lu, Xibo Wang, Haonan Huang, Su Yao, Zhiqiang Hu, Xingyan Chen, Enmao Diao

机构 * Department of Computer Science, Southwestern University of Finance and Economics(西南财经大学计算机科学学院) China Telecom Corporation Limited(中国电信有限公司) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出RPS框架,通过强化学习实现对话中自适应的信息获取,引入IELegal数据集验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13417 2026-04-16 cs.SE cs.AI 81%

The Cognitive Circuit Breaker: A Systems Engineering Framework for Intrinsic AI Reliability

认知电路断路器:一种用于内在AI可靠性的系统工程框架

Jonathan Pan

机构 * Jonathan Pan

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出认知电路断路器框架,通过提取模型前向传递中的隐藏状态,计算认知不一致度,以实现低延迟的内在可靠性监控,同时展示其在分布外泛化中的有效性。

Comments 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13064 2026-04-16 cs.CL cs.CY 81%

Red Skills or Blue Skills? A Dive Into Skills Published on ClawHub

红技能还是蓝技能?深入探讨ClawHub上的技能

Haichuan Hu, Ye Shang, Quanjun Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanjing University(南京大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究ClawHub上的技能生态系统,分析语言分布、功能组织及安全性,发现英语技能更偏向技术能力,而中文技能更侧重应用场景,且超过30%的技能被标记为可疑。

详情

展开后加载摘要…

URL PDF HTML 收藏