arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-23 至 2026-04-23 共收录 125 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 27 篇

2510.17261 2026-04-23 cs.RO cs.LG 74%

High-Level Multi-Robot Trajectory Planning And Spurious Behavior Detection

高层多机器人轨迹规划与异常行为检测

Fernando Salanova, Jesús Roche, Cristian Mahulea, Eduardo Montijano

机构 * Spanish project PID2024-159284NB-I00 funded by MCIN/AEI/10.13039/501100011033(西班牙项目PID2024-159284NB-I00,由MCIN/AEI/10.13039/501100011033资助) ERDF A way of making Europe and by the European Union NextGenerationEU/PRTR(ERDF推动欧洲发展,以及欧洲联盟NextGenerationEU/PRTR) DGA T45-23R and T64-23R(DGA T45-23R和T64-23R)

专题命中 规划推理 :planning(title);分类 cs.LG

AI总结 本文提出基于Nets-within-Nets框架的多机器人轨迹规划方法,结合Transformer模型检测异常行为,实验表明在识别执行效率低下、核心任务违规和约束适应性异常方面具有高准确率。

Comments 6 pages,3 figures, Iberian Robotics Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19756 2026-04-23 cs.LG cs.AI 73%

WorkflowGen:an adaptive workflow generation mechanism driven by trajectory experience

WorkflowGen:一种基于轨迹经验的自适应工作流生成机制

Ruocan Wei, Shufeng Wang, Ziwei Shi

机构 * China Telecom Cloud(中国电信云)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出WorkflowGen,一种基于轨迹经验的自适应工作流生成机制,通过捕捉完整轨迹提取可重用知识,减少token消耗,提升效率和成功率。

Comments 16 pages,3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20146 2026-04-23 cs.IR cs.CL 70%

SAKE: Self-aware Knowledge Exploitation-Exploration for Grounded Multimodal Named Entity Recognition

SAKE: 为基于地面的多模态命名实体识别的自我意识知识利用-探索

Jielong Tang, Xujie Yuan, Jiayang Liu, Jianxing Yu, Xiao Dong, Lin Chen, Yunlai Teng, Shimin Di, Jian Yin

机构 * Sun Yat-sen University(中山大学) Shandong Normal University(山东师范大学) University of the Chinese Academy of Sciences(中国科学院大学) Southeast University(东南大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 针对开放世界社交媒体平台中长尾、快速演变和未见实体的挑战,SAKE提出一种端到端代理框架,通过自我意识推理和自适应搜索工具调用,结合内部知识利用和外部知识探索,提升多模态命名实体识别的精度与鲁棒性。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19839 2026-04-23 cs.CV cs.AI 70%

Environmental Understanding Vision-Language Model for Embodied Agent

面向具身智能体的环境理解视觉-语言模型

Jinsik Bang, Jaeyeon Bae, Donggyu Lee, Siyeol Jung, Taehwan Kim

机构 * UNIST(全南国立大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出EUEA框架,通过细调四项核心技能提升具身智能体的环境理解能力,结合恢复步骤和GRPO阶段提升任务执行效果,实验显示在ALFRED任务中性能显著优于行为克隆基线。

Comments CVPR Findings 2026, Project Page: https://eu-ea.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18570 2026-04-23 cs.LG cs.AI cs.CL 67%

A multimodal and temporal foundation model for virtual patient representations at healthcare system scale

面向医疗系统规模的多模态与时间基础模型:虚拟患者表示

Andrew Zhang, Tong Ding, Sophia J. Wagner, Caiwei Tian, Ming Y. Lu, Rowland Pettit, Joshua E. Lewis, Alexandre Misrahi, Dandan Mo, Long Phi Le, Faisal Mahmood

机构 * Department of Pathology, Mass General Brigham, Harvard Medical School(病理学系,马萨诸塞州总医院与哈佛医学院) Cancer Program, Broad Institute of Harvard and MIT(癌症计划,哈佛-麻省理工Broad研究所) Data Science Program, Dana-Farber Cancer Institute(数据科学计划,达纳-法伯癌症研究所) Health Sciences and Technology, Harvard-MIT(健康科学与技术,哈佛-麻省理工) Harvard John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛约翰·A·保罗森工程与应用科学学院,哈佛大学) Department of Biomedical Informatics, Harvard Medical School(生物医学信息学系,哈佛医学院) Electrical Engineering and Computer Science, Massachusetts Institute of Technology (MIT)(电气工程与计算机科学,麻省理工学院(MIT)) School of Computer and Communication Sciences, EPFL, Lausanne, Switzerland(计算机与通信科学学院,EPFL,瑞士洛桑)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Apollo模型,整合多模态和时间信息,构建虚拟患者表示,用于预测疾病风险、治疗反应等,展示其在医疗计算中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09781 2026-04-23 cs.LG cs.AI 62%

Explainability in Generative Medical Diffusion Models: A Faithfulness-Based Analysis on MRI Synthesis

生成医学扩散模型的可解释性:基于忠实度的MRI合成分析

Surjo Dey, Pallabi Saikia

机构 * Rajiv Gandhi institute of petroleum technology(拉吉夫·甘地石油技术学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨生成扩散模型在医学影像中的可解释性,聚焦MRI合成,通过分析原型方法评估生成与训练特征的关系,实验表明EPPNet在忠实度上表现最佳,提升生成过程的透明度和可信度。

Comments Accepted at 3rd World Congress on Smart Computing (WCSC2026) conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00911 2026-04-23 cs.CR cs.AI cs.ET cs.HC cs.LG 62%

Device-Native Autonomous Agents for Privacy-Preserving Negotiations

设备本机自主代理用于隐私保护的谈判

Joyjit Roy, Samaresh Kumar Singh

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于设备的自主代理系统,通过零知识证明和本地推理实现隐私保护的谈判,实验显示在保险和B2B采购场景中成功率高,隐私保护效果显著。

Comments 9 pages, 6 figures, 9 tables. This version updates metadata after publication in IEEE Xplore

Journal ref 2026 IEEE SoutheastCon, Huntsville, AL, USA, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09871 2026-04-23 cs.AI cs.HC cs.LG 62%

Epistemology gives a Future to Complementarity in Human-AI Interactions

认识论为人类-人工智能互动中的互补性赋予未来

Andrea Ferrario, Alessandro Facchini, Juan M. Durán

机构 * SUPSI, Dalle Molle Institute for Artificial Intelligence (IDSIA)(SUPSI,达姆施塔特人工智能研究所(IDSIA)) Management in Networked and Digital Societies (MINDS) Department, Kozminski University(网络化与数字化社会管理系(MINDS)部,科米斯基大学) TU Delft(代尔夫特理工大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过认识论重构互补性,将其作为可靠知识过程的证据,提升人类-人工智能团队预测的可靠性,并提出设计与治理建议。

Comments Submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20548 2026-04-23 cs.CL cs.AI cs.DL cs.IR 62%

Enhancing Research Idea Generation through Combinatorial Innovation and Multi-Agent Iterative Search Strategies

通过组合创新和多智能体迭代搜索策略增强研究想法生成

Shuai Chen, Chengzhi Zhang

机构 * Department of Information Management, Nanjing University of Science and Technology(南京理工大学信息管理学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出结合迭代知识搜索与LLM多智能体系统的框架,通过反复交互生成、评估和优化研究想法,提升多样性与新颖性,在自然语言处理领域实验表明优于现有基线方法。

Comments Scientometrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20370 2026-04-23 cs.LG stat.ML 57%

Cold-Start Forecasting of New Product Life-Cycles via Conditional Diffusion Models

通过条件扩散模型进行新产品生命周期的冷启动预测

Ruihan Zhou, Zishi Zhang, Jinhui Han, Yijie Peng, Xiaowei Zhang

机构 * Guanghua School of Management, Peking University(北京大学光华管理学院) Department of Industrial Engineering and Decision Analytics, The Hong Kong University of Science and Technology(香港科技大学工业工程与决策分析系)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出CDLF模型,利用静态描述、参考轨迹和新观察数据预测新产品生命周期,解决冷启动问题,提升预测准确性与概率预测质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20158 2026-04-23 cs.AI 57%

Stateless Decision Memory for Enterprise AI Agents

无状态决策记忆用于企业AI代理

Vasundra Srinivasan

机构 * Vasundra Srinivasan

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出无状态决策记忆(DPM),在企业监管领域中通过无状态设计提升决策精度和可审计性,同时提高效率。

Comments 16 pages, 4 figures, 4 tables. Companion paper to "Four-Axis Decision Alignment for Long-Horizon Enterprise AI Agents" (arXiv:TBD). Code and reproducibility artifacts at https://github.com/vasundras/stateless-decision-memory-enterprise-ai-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20151 2026-04-23 cs.RO cs.LG 57%

Toward Safe Autonomous Robotic Endovascular Interventions using World Models

迈向安全的自主机器人内血管干预的世模型

Harry Robertshaw, Nikola Fischer, Han-Ru Wu, Andrea Walker Perez, Weiyuan Deng, Benjamin Jackson, Christos Bergeles, Alejandro Granados, Thomas C Booth

机构 * Surgical & Interventional Engineering, School of Biomedical Engineering & Imaging Sciences, King’s College London(外科与介入工程系,生物医学工程与成像科学学院,伦敦国王学院) Department of Radiology, National Taiwan University Hospital(放射科,台湾大学医院) Department of Neuroradiology, King’s College Hospital(神经放射科,伦敦国王医院)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出基于世模型的框架,利用TD-MPC2方法在内血管导航中实现自主机械取栓,通过仿真和体外实验验证其在安全性和泛化性上的优势。

Comments This manuscript is a preprint and has been submitted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20070 2026-04-23 cs.HC cs.AI cs.CE 57%

Auditing and Controlling AI Agent Actions in Spreadsheets

对电子表格中AI代理行为的审计与控制

Sadra Sabouri, Zeinabsadat Saghi, Run Huang, Sujay Maladi, Esmeralda Eufracio, Sumit Gulwani, Souti Chattopadhyay

机构 * University of Southern California(南加州大学) California State Polytechnic University(加州州立理工大学) Microsoft(微软公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Pista,一种可审计、可控的电子表格AI代理,通过分解执行过程让用户实时干预决策,提升用户对任务的理解和控制感。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19926 2026-04-23 cs.AI 57%

CreativeGame:Toward Mechanic-Aware Creative Game Generation

CreativeGame:迈向机制感知的创意游戏生成

Hongnan Ma, Han Wang, Shenglin Wang, Tieyue Yin, Yiwei Shi, Yucong Huang, Yingtian Zou, Muning Wen, Mengyue Yang

机构 * University of Bristol(布里斯托大学) Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Nanjing University(南京大学) Sreal AI Project(Sreal AI项目)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出CreativeGame系统,通过机制感知规划循环和跨版本经验积累,实现迭代式HTML5游戏生成,支持可解释的版本间进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19825 2026-04-23 cs.SE cs.AI 57%

SolidCoder: Bridging the Mental-Reality Gap in LLM Code Generation through Concrete Execution

SolidCoder:通过具体执行弥合LLM代码生成中的心理现实差距

Woojin Lee, Jin-Xia Huang

机构 * Electronics and Telecommunications Research Institute, Republic of Korea(韩国电信研究所)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 SolidCoder通过强制边缘情况意识和沙盒执行解决心理现实差距,提升代码生成性能,实现HumanEval、CodeContests和APPS的高准确率。

Comments 23 pages, 2 figures, Accepted at Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00696 2026-04-23 cs.CL 57%

DRIV-EX: Counterfactual Explanations for Driving LLMs

DRIV-EX:用于驾驶LLM的反事实解释

Amaia Cardiel, Eloi Zablocki, Elias Ramzi, Eric Gaussier

机构 * Aptikal, Université Grenoble Alpes(Aptikal,格勒诺布尔大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出DRIV-EX方法,通过反事实解释研究驾驶LLM的决策过程,利用梯度优化生成语义变化的场景描述,提升解释的可理解性和鲁棒性。

Comments Accepted at ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20486 2026-04-23 cs.CV 50%

ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards

ProMMSearchAgent:一种通过过程导向奖励训练的通用多模态搜索代理

Wentao Yan, Shengqin Wang, Huichi Zhou, Yihang Chen, Kun Shao, Yuan Xie, Zhizhong Zhang

机构 * East China Normal University(东中国师范大学) Shanghai Innovation Institute(上海创新研究院) Huawei Noah's Ark Lab(华为诺亚实验室) Independent Researcher(独立研究者) University College London(伦敦大学学院)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出ProMMSearchAgent,通过过程导向奖励解决多模态代理在知识密集型视觉推理中的训练难题,实现零样本迁移至Google搜索API。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19819 2026-04-23 econ.EM 50%

Decision Traces: What Multi-System Data Fusion Reveals About Institutional Knowledge in Enterprise Hiring

决策轨迹:多系统数据融合揭示企业招聘中的机构知识

Saad Bin Shafiq

专题命中 规划推理 :reasoning(abstract)

AI总结 研究通过多系统数据融合揭示企业招聘中机构知识的获取,发现关键词无法预测生产表现,行为评估提升预测能力,且生产速度存在可量化的经济常数。

Comments 32 pages, 4 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13942 2026-04-23 q-fin.GN 50%

AI Agents in Financial Markets: Architecture, Applications, and Systemic Implications

金融市场中的AI代理:架构、应用与系统性影响

Hui Gong

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出一个整合框架分析代理金融,探讨自主AI系统在信息处理、决策支持等流程中的作用,通过四层架构和代理金融市场模型,研究代理设计参数与市场结果的关系,展示如何利用公开数据研究可观察预期渠道。

Comments 35 pages, 3 figures, 7 tables. Updated to reflect the published journal version in FinTech; journal reference and DOI added

Journal ref FinTech 2026, 5(2), 34

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 7 篇

2604.20749 2026-04-23 cs.AI 79%

Where and What: Reasoning Dynamic and Implicit Preferences in Situated Conversational Recommendation

何处与何物:在情境对话推荐中推理动态和隐性偏好

Dongding Lin, Jian Wang, Yongqi Li, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SiPeR框架,通过场景转换估计和贝叶斯逆推推理,提升情境对话推荐的准确性和响应质量。

Comments Accpeted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19945 2026-04-23 cs.CV 78%

Visual Reasoning through Tool-supervised Reinforcement Learning

通过工具监督强化学习进行视觉推理

Qihua Dong, Gozde Sahin, Pei Wang, Zhaowei Cai, Robik Shrestha, Hao Yang, Davide Modolo

机构 * Northeastern University(东北大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出工具监督强化学习框架,通过简单可解释的视觉工具提升多模态大语言模型的复杂视觉推理能力,实验表明其高效且具备强大工具使用能力。

Comments Accepted to CVPR 2026 Findings. 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20012 2026-04-23 cs.CV cs.AI cs.CL 62%

EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training

EmbodiedMidtrain: 通过中训练弥合视觉语言模型与视觉语言动作模型之间的差距

Yiyang Du, Zhanqiu Guo, Xin Ye, Liu Ren, Chenyan Xiong

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世北美研究部及博世人工智能中心(BCAI))

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EmbodiedMidtrain方法,通过中训练弥合视觉语言模型与视觉语言动作模型之间的差距,实验表明中训练能提升不同VLM骨干网络的性能,且在初始化阶段对VLA微调有显著帮助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19902 2026-04-23 cs.CV cs.AI cs.LG 62%

MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings

MMCORE:多模态连接与表征对齐的潜在嵌入

Zijie Li, Yichun Shi, Jingxiang Sun, Ye Wang, Yixuan Huang, Zhiyao Guo, Xiaochen Lian, Peihao Zhu, Yu Tian, Zhonghua Zhai, Peng Wang

机构 * ByteDance Seed(字节跳动种子)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MMCORE通过预训练视觉-语言模型生成语义视觉嵌入,结合扩散模型实现多模态图像生成与编辑,提升生成质量并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20304 2026-04-23 cond-mat.mtrl-sci cs.AI 57%

LLM-guided phase diagram construction through high-throughput experimentation

通过高通量实验构建LLM引导的相图

Ryo Tamura, Haruhiko Morito, Yuna Oikawa, Guillaume Deffrennes, Shoichi Matsuda, Naruki Yoshikawa, Tomoaki Takayama, Taichi Abe, Koji Tsuda, Kei Terayama

机构 * Center for Basic Research on Materials(材料基础研究中心) National Institute for Materials Science(国家材料科学研究所) Graduate School of Frontier Sciences(前沿科学研究生院) The University of Tokyo(东京大学) RIKEN Center for Advanced Intelligence Project(RIKEN高级智能项目中心) Core Facility Center(核心设施中心) Tohoku University(东北大学) Univ. Grenoble Alpes(格勒诺布尔阿尔卑斯大学) CNRS(法国国家科学研究中心) Grenoble INP(格勒诺布尔INP) SIMaP Center for Green Research on Energy and Environmental Materials(能源与环境材料绿色研究中心) Nara Institute of Science and Technology(奈良科学技术大学) Research Center for Structural Materials(结构材料研究中心) Graduate School of Medical Life Science(医学生命科学研究生院) Tokyo Institute of Technology(东京技术大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 本文研究LLM在构建多组分合金相图中的应用,通过高通量实验和X射线衍射分析,展示了LLM在实验规划中的互补优势,验证了其在相图构建中的潜力。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09591 2026-04-23 cs.CV cs.AI 57%

Variational Visual Question Answering for Uncertainty-Aware Selective Prediction

变分视觉问答用于不确定性感知的选择性预测

Tobias Jan Wieczorek, Nathalie Daun, Mohammad Emtiyaz Khan, Marcus Rohrbach

机构 * TU Darmstadt(图宾根大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出变分VQA方法,通过变分贝叶斯方法提升视觉问答和视觉推理任务的可靠性,尤其在低误差容忍度下表现优异,且优于AdamW训练模型。

Comments TMLR April 2026 version. 13 pages main paper, 31 pages with appendix. Updated bibliography

Journal ref Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20841 2026-04-23 cs.CV 50%

DeVI: Physics-based Dexterous Human-Object Interaction via Synthetic Video Imitation

DeVI:基于物理的灵巧人-物体交互通过合成视频模仿

Hyeonwoo Kim, Jeonghwan Kim, Kyungwon Cho, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 DeVI通过合成视频模仿实现基于物理的灵巧人-物体交互,结合3D人体跟踪与鲁棒2D物体跟踪,提升对未知目标物体的控制能力,优于现有方法。

Comments Project Page: https://snuvclab.github.io/devi/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 5 篇

2604.20755 2026-04-23 cs.AI cs.LG 84%

V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization

V-tableR1:基于过程监督的多模态表格推理与批评引导的策略优化

Yubo Jiang, Yitong An, Xin Yang, Abudukelimu Wuerkaixi, Xuxin Cheng, Fengying Xie, Zhiguo Jiang, Cao Liu, Ke Zeng, Haopeng Zhang

机构 * School of Astronautics Beihang University(北航航天学院) Longcat Interaction Team Meituan(美团长猫交互团队) Tianmushan Laboratory Beihang University(北航天门实验室)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 V-tableR1通过过程监督强化学习框架,利用表格的确定性网格结构,提升多模态大语言模型的推理能力,通过批评引导策略优化方法,实现更严谨的逻辑推导,取得开放源代码模型在复杂表格基准上的最佳性能。

Comments 15 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20389 2026-04-23 cs.CR cs.AI 70%

CyberCertBench: Evaluating LLMs in Cybersecurity Certification Knowledge

CyberCertBench: 评估大语言模型在网络安全认证知识中的表现

Gustav Keppler, Ghada Elbez, Veit Hagenmeyer

专题命中 测试时计算 :verifier(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出CyberCertBench,通过行业认证试题评估大语言模型的网络安全知识,验证了前沿模型在通用知识上的表现,但其在特定厂商标准问题上的准确性下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13818 2026-04-23 cs.LG cs.AI cs.CL 67%

Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning

并非所有回放都有效:在大语言模型强化学习中的回放下采样

Yixuan Even Xu, Yash Savani, Fei Fang, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PODS方法,通过下采样回放来减少策略更新成本,提升学习效率。

Comments 19 pages, 10 figures, TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19787 2026-04-23 cs.CL cs.AI cs.CY 62%

LLM Agents Predict Social Media Reactions but Do Not Outperform Text Classifiers: Benchmarking Simulation Accuracy Using 120K+ Personas of 1511 Humans

LLM代理预测社交媒体反应但不优于文本分类器:使用120,000多个1511人的人设进行基准测试

Ljubisa Bojic, Alexander Felfernig, Bojana Dinic, Velibor Ilic, Achim Rettinger, Vera Mevorah, Damian Trilling

机构 * Institute for Artificial Intelligence Research and Development of Serbia(塞尔维亚人工智能研究与开发研究所) University of Belgrade, Institute for Philosophy and Social Theory, Digital Society Lab(贝尔格莱德大学,哲学与社会理论研究所,数字社会实验室) Complexity Science Hub, Vienna, Austria(维也纳复杂科学中心) Graz University of Technology, Graz, Austria(技术大学格拉茨,格拉茨,奥地利) University of Novi Sad, Faculty of Philosophy, Novi Sad, Serbia(诺维萨德大学,哲学学院,诺维萨德,塞尔维亚) University of Trier, Trier, Germany(特里尔大学,特里尔,德国) Vrije University Amsterdam, Amsterdam, Netherlands(阿姆斯特丹自由大学,阿姆斯特丹,荷兰)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLM代理预测人类社交媒体反应的准确性,发现其表现不如传统文本分类器,揭示了零样本代理在模拟极化动态中的潜力及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏