arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-19 至 2026-05-19 共收录 717 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 118 篇

2605.09395 2026-05-19 cs.AI cs.LG cs.MA cs.MM 62%

Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning

通过定制代理推理增强VLMs在少样本多模态时间序列分类中的能力

Lin Li, Jiawei Huang, Qihao Quan, Dan Li, Boxin Li, Xiao Zhang, Erli Meng, Wenjie Feng, Jian Lou, See-Kiong Ng

机构 * Sun Yat-sen University(中山大学) Xiaomi Corporation(小米公司) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MarsTSC框架,通过自演化知识库和代理推理提升少样本多模态时间序列分类性能,实验表明其在六个VLM基础上均优于传统和基础模型基线。

Comments 18 pages, 12 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01705 2026-05-19 cs.LG cs.AI 62%

LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning

LaDi-RL:潜在扩散推理防止强化学习中的熵崩溃

Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang, Yi-An Ma, Lianhui Qin

机构 * UC San Diego(斯克利普斯海洋研究所) Apple(苹果公司)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LaDi-RL方法,通过潜在扩散模型生成潜在推理轨迹,解决强化学习中熵崩溃问题,提升代码生成和数学推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22473 2026-05-19 stat.ML cs.AI cs.LG 62%

Gradient Dynamics of Attention: How Cross-Entropy Sculpts Bayesian Manifolds

注意力的梯度动力学:交叉熵如何塑造贝叶斯流形

Naman Agarwal, Siddhartha R. Dalal, Vishal Misra

机构 * Columbia University(哥伦比亚大学) Columbia University School of Professional Studies(哥伦比亚大学专业研究学院) Department of Statistics(统计学系) Columbia University Department of Computer Science(哥伦比亚大学计算机科学系)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过分析交叉熵训练如何重塑Transformer注意力分数和值向量,揭示了注意力评分的优势路由定律和值的职责加权更新,展示了梯度动力学如何塑造贝叶斯流形以支持概率推理。

Comments v2: Add dual-entropy connection - advantage signal drives \r{ho} down; fix duplicate bibliography entries (synced from Paper I)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18133 2026-05-19 cs.CR cs.AI cs.HC cs.IR 57%

An Empirical Study of Privacy Leakage Chains via Prompt Injection in Black-Box Chatbot Environments

通过提示注入在黑盒聊天机器人环境中研究隐私泄露链的实证研究

Hongjang Yang, Hyunsik Na, Daeseon Choi

机构 * Department of Information Security(信息安全系) Soongsil University(松山大学) AI Safety Center(人工智能安全中心) Department of AI Software(人工智能软件系)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 本文研究了通过间接提示注入在黑盒聊天机器人环境中存在的隐私泄露攻击链,分析了攻击者如何通过构造看似无害的外部内容来劫持代理任务,并评估了新的提示注入技术'exemplification'的攻击成功率,最终展示了使用虚构个人信息的证明概念数据外泄链。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23135 2026-05-19 cs.LG 57%

Characterizing Paraphrase-Induced Failures in Lean 4 Autoformalization

刻画 Lean 4 自动形式化中的同义词诱导失败

William Feng, Ethan Lou, Aryan Sharma

机构 * Yale University(耶鲁大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 本研究探讨了 Lean 4 自动形式化中由于同义词变化导致的失败模式,通过应用确定性同义词规则到本科和竞赛级数学问题数据集,发现代码生成层的失败主导了同义词敏感性,并揭示了不同数据集对失败类型的影响,结果为自动形式化提供了失败模式分类并推动了针对性的训练干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16640 2026-05-19 cs.LG 57%

Provably Shorter Scratchpads in Hybrid DeltaNet-Attention Decoders

在混合DeltaNet-注意力解码器中证明更短的scratchpad

Tomasz Steifer

机构 * Centre for Credible AI(可信人工智能中心) Warsaw University of Technology(华沙理工大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 研究混合递归-注意力解码器的表达能力,证明混合架构在模型表达性和效率上有优势,使用常数精度假设,Qwen风格的混合模型能以常数scratchpad解决parity-conditioned检索任务,而纯DeltaNet或纯注意力模型需多项式scratchpad。

Comments Under review at a ML conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16416 2026-05-19 cs.CV cs.AI 57%

CAVE: A Structured Credit Assignment Approach for Fragmented Visual Evidence Reasoning

CAVE:一种用于碎片化视觉证据推理的结构化信用分配方法

Tengda Guo, Jie Leng, Hanlei Li, Yaoyuan Liang, Qingyue Zhang, Dian Yang, Mingyu Zhang, Yuhua Fu, Shao-Lun Huang

机构 * Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University of Technology(浙江工业大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 CAVE通过结构化过程-奖励机制提升碎片化视觉推理能力,引入三个互补信号优化推理步骤,提升模型可靠性与鲁棒性。

Comments 24 pages, 6 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16341 2026-05-19 cs.LG 57%

Orth-Dion: Eliminating Geometric Mismatch in Distributed Low-Rank Spectral Optimization

Orth-Dion:消除分布式低秩谱优化中的几何不匹配

Tatsuhiro Nakamori, Laura Gomezjurado Gonzalez, Ganesh Talluri, Ansh Tiwari, Hideyuki Kawashima, Ioannis Mitliagkas, Guillaume Rabusseau, Hiroki Naganuma

机构 * Keio University(庆应大学) Stanford University(斯坦福大学) Midwestern University(中西部大学) California Institute of Technology(加州理工学院) Mila Université de Montréal(蒙特利尔大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 Orth-Dion通过替换列归一化为右因子的QR正交化,解决分布式低秩谱优化中的几何不匹配问题,实现与Dion相同通信成本下的最优收敛率。

Comments 24 pages, 3 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18748 2026-05-19 cs.CV 50%

Aurora: Unified Video Editing with a Tool-Using Agent

Aurora: 一种基于工具使用的统一视频编辑框架

Yongsheng Yu, Ziyun Zeng, Zhiyuan Xiao, Zhenghong Zhou, Hang Hua, Wei Xiong, Jiebo Luo

机构 * MIT-IBM(MIT-IBM研究院) NVIDIA(NVIDIA公司)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出Aurora框架,通过结合增强的视觉语言模型(VLM)代理和统一视频扩散变换器,解决视频编辑中的文本和视觉不充分问题,提升了视频编辑的灵活性和准确性。

Comments Code: https://github.com/yeates/Aurora

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18641 2026-05-19 cs.CV 50%

Leveraging Latent Visual Reasoning in Silence

利用沉默中的潜在视觉推理

Dongyao Zhu, Zhen Wang, Xi Xiao, Han Jiang, Saeed Vahidian, Wei-Lun Chao, Tanya Berger-Wolf, Yu Su, Raju Vatsavai, Jianyang Gu

机构 * North Carolina State University(北卡罗来纳州立大学) UC, San Diego(加州大学圣地亚哥分校) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Johns Hopkins University(约翰霍普金斯大学) Duke University(杜克大学) Boston University(波士顿大学) The Ohio State University(俄亥俄州立大学)

专题命中 推理与问题求解 :post-training(abstract)

AI总结 本文探讨了在推理过程中是否需要持续的潜在令牌,发现即使移除这些令牌或用随机噪声替代,性能影响较小,提出了一种基于注意力的奖励机制以促进潜在令牌与后续文本令牌的交互,从而提升视觉感知和视觉推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18302 2026-05-19 cs.HC 50%

What Would GPT Click: Practical Effects of Human-AI Behavioral Misalignment and the Cost of Synthetic Participants in User Experience

GPT点击会怎样:人类与AI行为不一致的实用影响以及合成参与者在用户体验中的成本

Eduard Kuric, Peter Demcak, Matus Krajcovic

专题命中 推理与问题求解 :LLM(abstract_cn)

AI总结 本文研究了合成参与者在用户体验研究中的影响,发现GPT在预测人类点击行为和推理过程时存在显著偏差,揭示了合成响应在决策支持中的分析效用下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17949 2026-05-19 cs.CV 50%

SkyNative: A Native Multimodal Framework for Remote Sensing Visual Evidence Reasoning

SkyNative: 一种面向遥感视觉证据推理的原生多模态框架

Xiao Yang, Ronghao Fu, Zhiwen Lin, Zhuoran Duan, Jiashun Zhu, Jiasen Hu, Lang Sun, Weipeng Zhang, Jiaqi Liu, Xu Na, Haoran Liu, Weijie Zhang, Bo Yang

机构 * College of Computer Science and Technology, Jilin University, China(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出SkyNative,一种原生多模态框架,通过去除预训练视觉骨干,直接在语言模型token空间中表示图像为原始patch tokens,以提升遥感图像的细粒度空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17681 2026-05-19 cs.RO 50%

PRIME: Physically-consistent Robotic Inertial and Motion Estimation for Legged and Humanoid Robots

PRIME: 为四足机器人和人形机器人提供物理一致的机器人惯性与运动估计

Jiarong Kang, Kunzhao Ren, Tao Pang, Xiaobin Xiong

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 该研究提出PRIME方法,通过结合可微接触动力学和光滑互补约束,实现从 onboard 传感器数据中获得物理一致的运动轨迹和惯性参数估计,从而提升机器人运动估计的准确性。

Comments Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16979 2026-05-19 cs.RO 50%

NORM-Nav: Zero-Shot Mobile Robot Navigation with Natural Language Behavioral Constraints

NORM-Nav: 通过自然语言行为约束实现零样本移动机器人导航

Dongjie Huo, Junhui Wang, Chao Gao, Yan Qiao, Dong Zhang, Guyue Zhou

机构 * College of Information Science and Technology, Beijing University of Chemical Technology(北京化工大学信息科学与技术学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Institute of Systems Engineering and Collaborative Laboratory for Intelligent Science and Systems, Macau University of Science and Technology(澳门大学系统工程与智能科学与系统联合实验室) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院)

专题命中 推理与问题求解 :LLM(abstract)

AI总结 本文提出NORM-Nav框架,通过将自然语言行为约束整合到基于成本图的规划中,提升移动机器人在人类环境中导航的社交适应性,实验表明其在任务成功率和轨迹贴近人类参考方面优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07245 2026-05-19 cs.CV 50%

Zero-Shot Textual Explanations via Translating Decision-Critical Features

通过翻译决策关键特征实现零样本文本解释

Toshinori Yamauchi, Hiroshi Kera, Kazuhiko Kawamoto

机构 * Chiba University(千叶大学) National Institute of Informatics(国家信息研究所)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出TEXTER方法,通过隔离决策关键特征生成更准确的文本解释,提升模型可解释性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16460 2026-05-19 cs.CV 50%

REC-RL: Referring expression counting via Gaussian and range-based reward optimization

基于高斯和范围的奖励优化的指称表达计数(REC-RL)

Hui Liu, Yunlai Teng, Kunlong Bai, Pengfei Qi, Haotian Yan, Liang Li, Junlan Feng

机构 * JIUTIAN Research, Beijing, China(京天研究,北京,中国)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出REC-RL框架,通过引入思考-范围-回答范式优化视觉推理过程,结合精度指导和结构化输出奖励,提升指称表达计数任务的性能和泛化能力。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 160 篇

2605.16354 2026-05-19 cs.LG cs.AI cs.CL cs.HC stat.ML 92%

Augmenting Human Evaluation with LLM Judges: How Many Human Reviews Do You Need?

通过LLM裁判增强人类评估:你真的需要多少人类评审?

Jane Paik Kim

机构 * Department of Psychiatry and Behavioral Sciences(精神病学与行为科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过LLM作为辅助裁判来增强人类评估,通过两阶段抽样设计确定人类和LLM评审样本量,以实现目标统计功效。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16303 2026-05-19 cs.CY cs.AI cs.CL 92%

From Demographics to Survey Anchors: Evaluating LLM Agents for Modeling Retirement Attitudes

从人口统计学到调查锚点:评估LLM代理在建模退休态度中的表现

Rubén Garzón, Pauline Baron, Vincent Grari, Jonne Kamphorst, Michael Bernstein, Marcin Detyniecki

机构 * AI Research(AI研究) AXA Group Operations(AXA集团运营) CDSP & CEE(CDSP与CEE) Sciences Po(社会科学高等学院) Computer Science Department(计算机科学系) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文比较了基于人口统计学的LLM代理与基于调查数据的代理在预测退休态度调查中的准确性,发现仅依赖人口统计学的代理存在偏差且不够准确,而基于调查锚点的代理能更好地捕捉复杂的人类响应模式。

Comments 50 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02039 2026-05-19 cs.AI cs.CL cs.DB cs.LG 92%

Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models

在大型语言模型上进行深度数据研究:评估深度数据研究

Wei Liu, Peijie Yu, Michele Orini, Yali Du, Yulan He

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出深度数据研究(DDR)任务和DDR-Bench基准,评估大型语言模型的探索智能,发现有效探索需要内在策略而非单纯扩展。

Comments 14 pages, 7 tables, 8 figures, accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18199 2026-05-19 cs.IR cs.AI 92%

PIPER: Content-Based Table Search via profiling and LLM-Generated Pseudoqueries

PIPER: 通过 profiling 和 LLM 生成的伪查询实现基于内容的表格搜索

Riccardo Terrenzi, Matteo Falconi, Serkan Ayvaz, Pierluigi Plebani

机构 * Centre for Industrial Software, University of Southern Denmark(丹麦南部大学工业软件中心) Department of Electronics, Information and Bioengineering, Politecnico di Milano(米兰理工学院电子、信息与生物工程系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对数据湖、数据空间和开放数据门户中表格数据集快速增长的问题,PIPER 提出了一种基于内容的表格搜索方法,利用表格 profile 和 LLM 生成的伪查询进行密集检索,优于传统元数据方法和 TableQA 检索方法,展示了 LLM 基于内容建模在表格数据集搜索中的价值。

Comments 15 pages, 3 figures, accepted at DEXA'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18015 2026-05-19 cs.LG cs.DB cs.SE 92%

LogRouter: Adaptive Two-Level LLM Routing for Log Question Answering in Big Data Systems

LogRouter: 一种自适应的两级LLM路由用于大数据系统中的日志问题解答

Mert Coskuner, Merve Zeybel, Melik Mert Dolan

机构 * TUBITAK BILGEM(土耳其国家研究 institute)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出LogRouter,一种自适应两级LLM路由系统,用于在大数据系统中实现日志问题解答,通过结合PySpark-based Drain3数据摄入管道、GPU加速的嵌入和Apache Druid和PostgreSQL with pgvector的双索引存储,实现高效的日志查询处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16996 2026-05-19 cs.CL 92%

Evaluation Drift in LLM Personality Induction: Are We Moving the Goalpost?

LLM个性诱导中的评估漂移:我们是否在移动目标?

Prateek Rajput, Yewei Song, Iyiola E. Olatunji, Jacques Klein, Tegawendé F. Bissyandé

机构 * University of Luxembourg(卢森堡大学)

专题命中 评测与基准 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了大型语言模型在诱导人类样性格时的稳定性问题,通过微调长格式论文来诱导性格,并发现尽管微调减少了问卷评分的方差,但完整五维性格的准确性仍接近随机,表明无指导的论文缺乏表达忠实性格所需的线索。

Comments 14 pages, 8 main pages, 5 figures, 4 main page figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16675 2026-05-19 cs.AI 92%

LinAlg-Bench: A Forensic Benchmark Revealing Structural Failure Modes in LLM Mathematical Reasoning

LinAlg-Bench:一个 forensic 验证基准,揭示 LLM 数学推理中的结构失效模式

Shradha Agarwal, Deepak Rajbhar, Tariq J

机构 * Department of Nuclear Engineering and Computer Science(核工程与计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LinAlg-Bench 评估 10 个前沿大语言模型在结构线性代数计算中的表现,揭示 LLM 数学失败并非随机,而是受算法类型和矩阵维度约束。研究发现 4x4 尺寸存在行为阈值,低于该尺寸模型通过执行错误失败,高于则转向计算放弃,通过工具角色扮演等制造响应。

Comments 42 pages, 3 figures, 12 tables. NeurIPS 2026 Evaluations and Datasets Track submission. Dataset: https://huggingface.co/datasets/LinAlgBench/linalg-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16832 2026-05-19 cs.CV 91%

Coarse Semantic Injection for LLM-Conditioned Structured Indoor Prediction

粗粒度语义注入用于LLM条件的结构室内预测

Shuliang Zhu, Tomiwa Adey, Jinjia Zhou

机构 * Shuliang Zhu(朱舒良) Tomiwa Adey(阿德伊汤米瓦) Jinjia Zhou(周锦佳)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种接口保持的语义增强方法,用于LLM条件的结构解码,通过将语义证据与点云表示关联,将其编码为RGBB点接口,以提升结构室内预测的精度,特别是在复杂场景中的门框定位和家具检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01245 2026-05-19 cs.CR 91%

Comprehensive Vulnerability Analysis is Necessary for Trustworthy LLM-MAS

全面的漏洞分析对于可信的LLM-MAS至关重要

Pengfei He, Yue Xing, Juanhui Li, Shen Dong, Zhenwei Dai, Xianfeng Tang, Hui Liu, Han Xu, Zhen Xiang, Charu C. Aggarwal, Hui Liu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文探讨了构建可信LLM-MAS需进行全面漏洞分析,提出统一框架以量化不同架构中的漏洞,并识别关键挑战如构建专用评估基准和实现安全信任管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12871 2026-05-19 cs.CL 91%

MentalBench: A DSM-Grounded Benchmark for Evaluating Psychiatric Diagnostic Capability of Large Language Models

MentalBench: 一个用于评估大语言模型 psychiatric 诊断能力的 DSM 基础基准

Hoyun Song, Migyeong Kang, Jisu Shin, Jihyun Kim, Chanbi Park, Hangyeol Yoo, Jihyun An, Alice Oh, Jinyoung Han, KyungTae Lim

机构 * KAIST(韩国科学技术院) Sungkyunkwan University(成均馆大学) Dongguk University Medical Center(东国大学医学院) Seoultech(首尔技术大学) Samsung Medical Center(三星医疗中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 本文提出 MentalBench,一个用于评估大语言模型在不同临床模糊程度下能否做出 DSM 基础的 psychiatric 诊断决策的基准。该基准基于 psychiatrist 构建并验证的知识图谱,生成了 24,750 个合成临床案例,以系统地变化信息完整性和诊断复杂性,从而实现 DSM 基础的评估。实验表明,尽管最先进的 LLM 在噪声自由查询上表现良好,但它们在区分具有重叠症状的诊断时难以校准其信心。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05739 2026-05-19 cs.LG cs.AI cs.CL q-fin.CP 91%

Multi-Dimensional Behavioral Evaluation of Agentic Stock Prediction Systems Using Large Language Model Judges with Closed-Loop Reinforcement Learning Feedback

基于大语言模型判官的多维行为评估:用于代理股票预测系统的闭环强化学习反馈

Mohammad Al Ridhawi, Mahtab Haj Ali, Hussein Al Osman

机构 * School of Electrical Engineering and Computer Science(电气工程与计算机科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种多维行为评估方法,通过大语言模型判官评估代理系统决策过程,利用闭环强化学习反馈提升预测性能,验证了方法在股票预测中的有效性。

Comments 17 pages, 5 figures, 14 tables. Manuscript submitted to Applied Artificial Intelligence (Taylor and Francis)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17281 2026-05-19 cs.SE cs.AI 91%

ContractBench: Can LLM Agents Preserve Observation Contracts?

ContractBench: LLM Agents能否保持观察契约?

Jicheng Wang, Yifeng He, Zili Wang, Hanwen Xing, Arkaprava De, Hao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of Southern California(南加州大学) University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(title,title_cn);post-training(abstract);分类 cs.AI

AI总结 本文提出ContractBench基准测试,用于评估LLM代理在保持观察契约(如时间有效性及字节完整性)方面的能力,发现现有模型在该任务上仍存在显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16770 2026-05-19 cs.CL cs.AI 91%

Exploring Lightweight Large Language Models for Court View Generation

探索用于法院视图生成的轻量级大语言模型

Zhitian Hou, Tianyong Hao, Nanli Zeng, Zhixiong Chao, Kun Zeng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Computer Science, South China Normal University(华南师范大学计算机学院) China Mobile Internet Co., Ltd.(中国移动互联网有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.CL、cs.AI

AI总结 本文研究了轻量级大语言模型在法院视图生成中的能力及其对指控预测的影响,探讨了模型架构、大小对性能的影响,以及轻量级LLM与深度神经网络在任务中的比较,同时开发了CVGEvalKit评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17029 2026-05-19 cs.SE cs.AI 90%

Task Abstention for Large Language Models in Code Generation

大型语言模型在代码生成中的任务回避

Yanke Zhou, Yuhao Tan, Senrong Xu, Zenan Li, Yuan Yao, Taolue Chen, Xiaoxing Ma

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究了大型语言模型在代码生成任务中是否应回避生成可能产生幻觉的代码,提出了一种基于多重假设检验原理的校准回避规则,通过代码执行结果评估生成一致性,无需依赖Oracle测试用例或外部数据库,提供了一种可靠的安全且稳健的代码生成机制。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏