arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-26 至 2026-06-26 共收录 270 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 67 篇

2606.26937 2026-06-26 cs.HC 新提交 89%

Continuous Behavioral Synthesis for Adaptive Health Dashboards: An LLM-Mediated Architecture Integrating Explicit Preference, Spatial Reorganization, and Attention Allocation Signals

自适应健康仪表盘的连续行为合成:一种集成显式偏好、空间重组和注意力分配信号的LLM中介架构

Tiziano Santilli, Mina Alipour, Mahyar T. Moghaddam

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一种利用大语言模型作为行为合成引擎的架构,通过集成显式反馈、空间重组和注意力信号,实现从稀疏异构用户信号中即时生成自适应仪表盘布局。

Comments 33 pages, Accepted EICS2026 Patras, Greece

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26960 2026-06-26 cs.NI 新提交 89%

Toward Agentic SysAdmin: Rethinking System Administration with AI Agents

迈向智能系统管理:用AI智能体重新思考系统管理

Gianmaria Frigo, Davide Saladino, Alberto Castagnaro, Francesco Marchiori, Denis Donadel, Luca Pajola, Mauro Conti

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出NetLLMeval框架,通过实时网络仿真自动评估LLM在系统管理任务中的表现,发现求解器设计显著影响准确性,本地模型在合适配置下可媲美前沿大模型。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26196 2026-06-26 cs.CL cs.AI cs.CV cs.LG cs.MM 新提交 89%

From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models

从结构到协同:多模态大语言模型中视觉-语言感知范式演进综述

Haoxiang Sun, Tao Wang, Li Yuan, Jian Zhao, Jiancheng Lv

机构 * School of Computer Science, Sichuan University(四川大学计算机学院) School of Electronic and Computer Engineering, Peking University Shenzhen Graduate School(北京大学深圳研究生院电子与计算机工程学院) Institute of Artificial Intelligence (TeleAI), China Telecom and Northwestern Polytechnical University(中国电信与西北工业大学人工智能研究院(TeleAI))

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文系统综述多模态大语言模型中统一视觉-语言感知的范式演进,提出五阶段分类法,梳理各阶段代表性方法,并指出开放挑战与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26109 2026-06-26 cs.CY cs.MA 新提交 89%

Simulating Eating Disorder Patients with LLMs: Evaluating Psychological Persona Stability in Multi-Turn Conversations

使用LLM模拟饮食障碍患者:评估多轮对话中的心理角色稳定性

Jennifer Haase, Jana Gonnermann-Müller, See Heng Yim, Nicolas Leins, Jan Mendling, Sebastian Pokutta

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究通过饮食障碍案例和双评估框架,发现LLM在模拟患者时过度稳定且不准确,系统性地高估严重程度12-30%,并存在“缺失中间态”问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26479 2026-06-26 cs.CR cs.AI cs.CL cs.LG 新提交 88%

Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents

LLM智能体中针对提示注入的带外防御的自适应评估

Praneeth Narisetty, Shiva Nagendra Babu Kore, Uday Kumar Reddy Kattamanchi, Jayaram Kumarapu

机构 * LaunchSafe Research(LaunchSafe研究院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文组织带外防御(如CaMeL、Progent)为经典完整性保护与引用监视实例,并在AgentDojo上对Qwen2.5-7B代理进行自适应评估,结果显示Progent将攻击成功率从25.8%降至4.2%,手工自适应攻击未提升成功率。

Comments 12 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27226 2026-06-26 cs.AI cs.CL 新提交 88%

Ask, Don't Judge: Binary Questions for Interpretable LLM Evaluation and Self-Improvement

询问而非评判:用于可解释的LLM评估和自我改进的二元问题

Sangwoo Cho, Kushal Chawla, Pengshan Cai, Zefang Liu, Chenyang Zhu, Shi-Xiong Zhang, Sambit Sahu

机构 * Capital One, AI Foundations(Capital One人工智能基础)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出BINEVAL框架,将评估标准分解为原子二元问题,聚合为可解释的多维分数,在多项基准上匹配或超越强基线,并支持迭代提示优化。

Comments Acceepted to the Second Workshop on Compositional Learning at ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26429 2026-06-26 cs.LG cs.CL 新提交 88%

DualEval: Joint Model-Item Calibration for Unified LLM Evaluation

DualEval: 联合模型-项目校准的统一LLM评估

Aaron J. Li, Hao Huang, Youngmin Park, Yitong Ma, Wei-Lin Chiang, Li Chen, Cho-Jui Hsieh, Bin Yu, Ion Stoica

机构 * University of California, Berkeley(加州大学伯克利分校) Arena University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 提出DualEval框架,通过联合模型-项目校准统一静态基准和竞技场式评估,生成可靠模型排名并支持基准压缩和异常检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26927 2026-06-26 cs.SE 新提交 88%

Are LLMs Ready for Anti-Pattern Detection in Microservice Architectures?

LLM 是否准备好检测微服务架构中的反模式?

Marco De Luca, Domenico Amalfitano, Porfirio Tramontana, Anna Rita Fasolino

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文研究大型语言模型(LLM)通过提示分析微服务仓库静态制品来检测16种架构反模式的能力,与静态分析工具MARS对比,发现LLM在局部、异构或语义丰富的反模式上表现有竞争力,但在需要结构或跨服务依赖证据时受限,可作为补充工具。

Comments accepted at ICSME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09982 2026-06-26 cs.CY 版本更新 88%

Application of Large Language Models in Automated Question Generation: A Case Study on ChatGLM's Structured Questions for National Teacher Certification Exams

大语言模型在自动问题生成中的应用:以ChatGLM生成国家教师资格考试结构化问题为例

Ling He, Yanxin Chen, Xiaoqiang Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究探索ChatGLM在自动生成国家教师资格考试结构化问题中的应用,通过提示工程生成模拟题并与真题对比,专家评估显示其合理性与实用性高,但多标准考量存在局限。

Comments We are withdrawing this version as the submission was made prior to the completion of full internal coordination among all co-authors. To ensure consistency and avoid any potential misinterpretation, we have decided to withdraw the manuscript and leave it archived as a preprint record only

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27316 2026-06-26 cs.CL 新提交 87%

LLM-Based Examination of Eligibility Criteria from Securities Prospectuses at the German Central Bank

基于大语言模型的德国央行证券招股说明书资格标准审查

Serhii Hamotskyi, Akash Kumar Gautam, Christian Hänig

机构 * Anhalt University of Applied Sciences(安哈尔特应用科学大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出基于大语言模型的生成式信息提取流程,将任务分解为提取、规范化和解释,用于审查证券招股说明书中的资格标准,在文档级资格判断上达到91%的精确率。

Journal ref Proceedings of the 7th Financial Narrative Processing Workshop (FNP 2026) at LREC 2026, pp. 1-10, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26566 2026-06-26 cs.CR cs.CL 新提交 87%

Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models

跨模态对抗扩散:文本、视觉与视觉-语言模型的攻击、防御与评估融合综述

Abrar Alotaibi, Moataz Ahmed

机构 * Information and Computer Science Department, King Fahd University of Petroleum & Minerals(国王法赫德石油矿物大学信息与计算机科学系) College of Computer Science and Information Technology, Imam Abdulrahman Bin Faisal University(伊玛目阿卜杜勒拉赫曼·本·法伊塞尔大学计算机科学与信息科技学院) SDAIA-KFUPM Joint Research Center for Artificial Intelligence, King Fahd University of Petroleum & Minerals(SDAIA-KFUPM人工智能联合研究中心,国王法赫德石油矿物大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL

AI总结 本文整合了文本、图像分类器和视觉-语言模型上的对抗攻击与防御研究,提出统一分类法和评估框架,并识别了当前文献中的五个常见弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22537 2026-06-26 cs.CV 新提交 85%

NegAS: Negative Label Guided Attention and Scoring for Out-of-Distribution Object Detection with Vision-Language Models

NegAS: 基于负标签引导的注意力与评分用于视觉语言模型的分布外目标检测

Yingjie Zhang, Shuai Li, Peng Wang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 提出NegAS框架,利用负标签引导注意力(NegA)和基于sigmoid的OOD评分函数(NegS),解决VLM检测器中OOD区域利用不足和评分不兼容问题,显著提升OOD检测性能。

Comments Accept to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27288 2026-06-26 cs.AI cs.LG 新提交 84%

When Does Combining Language Models Help? A Co-Failure Ceiling on Routing, Voting, and Mixture-of-Agents Across 67 Frontier Models

语言模型组合何时有效?基于67个前沿模型的协同失败上限:路由、投票与多智能体混合

Josef Chen

机构 * KAIKAKU

专题命中 评测与基准 :language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究多模型系统(路由、投票、级联等)的准确率上限,发现其增益受限于所有模型同时出错的比率β,而非常用的平均成对误差相关性ρ,并通过67个模型实验验证了β的显著低估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26348 2026-06-26 cs.AI 新提交 83%

What We are Missing in Multimodal LLM Evaluation?

我们在多模态大语言模型评估中缺失了什么?

Po-han Li, Shenghui Chen, Sandeep Chinchali, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文分析现有多模态大语言模型评估基准的不足,识别出时空连贯性、物理世界理解、多模态一致性和选择性注意等关键缺失,强调填补这些空白对衡量多模态智能真实进展的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26099 2026-06-26 cs.CY cs.AI 新提交 83%

Benchmarking Open-Weight Foundation Models for Global AI Technical Governance

开源基础模型在全球AI技术治理中的基准测试

Jason Hung

专题命中 评测与基准 :foundation model(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有研究在评估大语言模型地理偏差时的三个方法论局限,本研究使用四个开源前沿模型,基于全球AI数据集v2,通过五类响应分类和混合效应模型,评估模型在不同国家的准确性差异。

Comments 12 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08660 2026-06-26 cs.CL 版本更新 83%

A Systematic Survey of Semantic Role Labeling in the Era of Pretrained Language Models

预训练语言模型时代语义角色标注的系统综述

Huiyao Chen, Meishan Zhang, Jing Li, Lilja Øvrelid, Jan Hajič, Hao Fei, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute (SLAI)(深圳南山区研究院) University of Oslo(奥斯陆大学) Charles University(查尔斯大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 提出四维分类法系统综述SRL研究,分析句法特征的作用条件,首次系统处理大语言模型时代的SRL,并扩展至多模态设置。

Comments 54 pages, 9 figures, 9 tables. Accepted at Artificial Intelligence Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16395 2026-06-26 cs.AI 83%

HELIOT: LLM-Based CDSS for Adverse Drug Reaction Management

HELIOT:基于LLM的临床决策支持系统用于不良药物反应管理

Gabriele De Vito, Filomena Ferrucci, Athanasios Angelakis

机构 * Software Engineering (SeSa) Lab University of Salerno(软件工程(SeSa)实验室,萨勒诺大学) Amsterdam UMC Locatie AMC Amsterdam, The Netherlands(阿姆斯特丹大学医学中心(AMC)阿姆斯特丹,荷兰) Digital Health(数字健康;方法学;阿姆斯特丹公共卫生研究所阿姆斯特丹,荷兰) Methodology(阿姆斯特丹大学数据科学中心阿姆斯特丹,荷兰) Amsterdam Public Health Research Institute Amsterdam, The Netherlands University of Amsterdam Data Science Center Amsterdam, The Netherlands

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HELIOT利用大语言模型处理非结构化临床数据,通过提取药物反应信息和学习患者用药耐受性,减少误报并提升不良药物事件预警的准确性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26936 2026-06-26 cs.CR cs.CL cs.LG 新提交 82%

Jailbreaking for the Average Jane: Choosing Optimal Jailbreaks via Bandit Algorithms for Automatically Enhanced Queries

普通人的越狱:通过多臂老虎机算法选择最优越狱以自动增强查询

Prarabdh Shukla, Ritik, Suhas Rao, Arpit Agarwal, Arjun Bhagoji

机构 * Centre for Machine Intelligence and Data Science, IIT Bombay(印度理工学院班加罗尔机器智能与数据科学中心) Department of Computer Science and Engineering, IIT Bombay(印度理工学院班加罗尔计算机科学与工程系)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);prompting(abstract);分类 cs.CL、cs.LG

AI总结 提出基于多臂老虎机框架的越狱攻击策略,在线学习最优越狱方法,并构建包含11,279个恶意查询的安全基准FrankensteinBench,实验表明对15个开源LLM平均成功率高达97%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25487 2026-06-26 cs.CL cs.CR cs.LG 新提交 82%

How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring

你的越狱评判有多可靠?自动ASR评分的校准与对抗鲁棒性

Yang Gao

机构 * Veyon Solutions

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 研究评估了LLM越狱攻击成功率(ASR)的自动评判器(安全分类器与LLM评判)的可靠性,发现两者存在相反缺陷,且易受攻击,建议报告评判器的精确率和召回率并校正ASR。

Comments 10 pages, 3 figures, 2 tables, Code: github.com/gy15901580825/judgeflip

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25369 2026-06-26 cs.SD cs.AI cs.CL eess.AS 新提交 82%

Sarashina2.2-TTS: Tackling Kanji Polyphony in Japanese Speech Generation via Data Scaling and Targeted Data Synthesis

Sarashina2.2-TTS:通过数据扩展和针对性数据合成解决日语语音生成中的汉字多音问题

Lianbo Liu, Shiao Zhu, Kai Washizaki, Reo Yoneyama, Haesung Jeon, Mengjie Zhao, Yusuke Fujita, Hao Shi, Nao Yoshida, Yuan Gao, Roman Koshkin, Yukiya Hono, Yui Sudo

机构 * SB Intuitions

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对日语汉字多音问题,提出Sarashina2.2-TTS系统,通过扩展训练数据至36.1万小时并设计覆盖全部常用汉字的针对性数据增强管道,显著提升读音准确率,在零样本日语语音合成中达到最高说话人相似度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18446 2026-06-26 cs.CL cs.AI 版本更新 82%

ReportLogic: Evaluating Logical Quality in Deep Research Reports

ReportLogic: 评估深度研究报告的逻辑质量

Jujia Zhao, Zhaoxin Huan, Zihan Wang, Xiaolu Zhang, Jun Zhou, Suzan Verberne, Zhaochun Ren

机构 * Leiden Institute of Advanced Computer Science, Leiden University(莱顿先进计算机科学研究所,莱顿大学) Ant Group(蚂蚁集团) CISPA Helmholtz Center for Information Security(信息安全霍普夫中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出ReportLogic基准,通过可审计性视角量化报告逻辑质量,包含宏观逻辑、阐述逻辑和结构逻辑三层评估,并训练开源LogicJudge进行可扩展评估。

Comments Accepted by ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26649 2026-06-26 cs.AI cs.CR 新提交 81%

Autoformalization of Agent Instructions into Policy-as-Code

智能体指令的自动形式化为策略即代码

Adam Mondl, Matthew Maisel, John H. Brock

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出自动形式化流水线,通过LLM生成-批评循环将智能体提示和自然语言策略转化为Cedar策略语言,在MedAgentBench上比手工编码覆盖更多规范。

Comments Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD), ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26458 2026-06-26 cs.AI 新提交 81%

MKG-RAG-Bench: Benchmarking Retrieval in Multimodal Knowledge Graph-Augmented Generation

MKG-RAG-Bench:多模态知识图谱增强生成中的检索基准

Xiaochen Wang, Bao Hoang, Han Liu, Ting Wang, Fenglong Ma

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Michigan State University(密歇根州立大学) Dalian University of Technology(大连理工大学) Stony Brook University(石溪大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MKG-RAG-Bench基准,通过构建跨领域多模态知识图谱和问答数据集,系统评估多模态知识图谱增强生成中的检索性能,揭示检索质量对生成结果的决定性作用。

Comments Accepted by KDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26216 2026-06-26 cs.CR cs.AI 新提交 81%

CyberChainBench: Can AI Agents Secure Smart Contracts Against Real-World On-Chain Vulnerabilities?

CyberChainBench: AI代理能否保护智能合约免受真实链上漏洞的攻击?

Jintao Huang, Fengqing Jiang, Radha Poovendran, Zhiqiang Lin

机构 * The Ohio State University(俄亥俄州立大学) University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出CyberChainBench基准,评估基于LLM的代理在智能合约安全中的漏洞检测、利用生成和补丁合成能力,基于541个真实链上攻击事件,发现最佳配置在检测、利用和修补上的得分分别为37.5%、43.7%和23.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26155 2026-06-26 cs.AI 新提交 81%

Detecting and Controlling Sycophancy with Cascading Linear Features

检测和控制级联线性特征中的谄媚行为

Maty Bohacek, Rishub Jain, Nicholas Dufour, Thomas Leung, Chris Bregler, Roma Patel

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 提出迭代数据生成管线,通过级联线性特征分离谄媚行为,实现更优的检测、评分和干预,性能匹配或超越基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19336 2026-06-26 cs.CL 新提交 81%

Learning User Simulators with Turing Rewards

基于图灵奖励的学习用户模拟器

Yingshan Susan Wang, Cedegao E. Zhang, Linlu Qiu, Zexue He, Pengyuan Li, Alex Pentland, Roger P. Levy, Yoon Kim

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Turing-RL方法,利用基于图灵测试的强化学习训练用户模拟器,通过判别性图灵奖励使生成响应与真实用户不可区分,在对话和论坛讨论中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26633 2026-06-26 cs.DC 新提交 80%

Simulating Unified Tensor Resharding in heterogeneous AI systems

模拟异构AI系统中的统一张量重分片

Sumit Kumar, Sayantan Dasgupta, Kushal Mitra, Meet Dadhania, Rohan Sudhir Basugade, Praveen Tammana, Satananda Burla, Abed Mohammad Kamaluddin, Rinku Shah

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出异构感知模拟器Xsim,通过非均匀负载划分、定制环构建和分块分区等方法,准确模拟异构分布式LLM训练,误差小于5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27369 2026-06-26 cs.LG 新提交 77%

Reinforcement Learning without Ground-Truth Solutions can Improve LLMs

无需真实解即可改进大语言模型的强化学习

Yingyu Lin, Qiyue Gao, Nikki Lijing Kuang, Xunpeng Huang, Kun Zhou, Tongtong Liang, Zhewei Yao, Yi-An Ma, Yuxiong He

机构 * University of California, San Diego(加州大学圣地亚哥分校) Snowflake AI Research

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.LG

AI总结 提出RiVER框架,通过校准的连续奖励信号,在无真实解的任务上训练LLM,在AtCoder和精确解基准上均取得提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26246 2026-06-26 cs.DL cs.AI cs.IR 新提交 77%

Lacuna: A Research Map for Machine Learning

Lacuna:机器学习研究地图

Martin Weiss, Miles Q. Li, Alejandro H. Artiles, Yacine Mkhinini, Chris Pal, Hugo Larochelle, Nasim Rahaman

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出Lacuna研究地图,利用LLM将论文转化为摘要、概念、方向和建议,在多项基准上超越OpenScholar,并评估了多阶段报告代理Lacuna Deep Research的性能。

Comments 14 pages, 3 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26437 2026-06-26 cs.CL cs.AI 新提交 76%

ConflictScore: Identifying and Measuring How Language Models Handle Conflicting Evidence

ConflictScore: 识别和衡量语言模型如何处理冲突证据

Siyi Liu, Aaron Halfaker, Dan Roth, Patrick Xia

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.AI

AI总结 提出ConflictScore指标,通过将回答分解为原子声明并与证据文档对比,量化模型对冲突证据的识别程度,实验表明该指标能有效检测过度自信声明并提升真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏