arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2747 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2747 篇

2608.01042 2026-08-04 cs.SE cs.AI cs.HC cs.LG 新提交 73%

What Could the Agent See at 19:05? Generating Temporal Enterprise Scenarios from Real Research and Replaying Them to Evaluate Agents

智能体在19:05能看到什么?从真实研究生成时间化企业场景并回放以评估智能体

Tezan Sahu, Himani Arora

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本研究提出从真实研究生成时间化企业场景并回放的系统,用于解决现有离线评估智能体仅基于最终静态快照的问题,可在任意时刻评估可插拔智能体。

Comments 6 pages, 3 figures, 4 tables. Accepted as a poster at SERI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01004 2026-08-04 cs.LG cs.AI cs.SE 新提交 73%

Who Belongs in the Eval Set? A Capability-Taxonomy-Driven Pipeline for Curating Regression Eval Sets in Agent-Extensibility Platforms

哪些应该进入评估集?面向智能体可扩展性平台的、基于能力分类法的回归评估集编建流水线

Tezan Sahu, Aritra Das, Pankaj Mittal, Sudipta Das

机构 * Microsoft(微软) Indian Institute of Technology Roorkee(鲁尔基印度理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对智能体可扩展性平台的回归评估集编建问题,提出基于能力分类法的流水线,通过三个组件实现查询决策,可适配带类型化能力分类法的各类编建场景。

Comments Extended abstract accepted at the SERI 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00355 2026-08-04 cs.CL cs.LG 新提交 73%

CurveShift: Is Agent Progress Scalar? Separating Level from Shape

CurveShift:智能体的进展是标量吗?区分水平与形态

Hanwen Xing, Pengyun Wang, BingXu Meng, Kumail Alhamoud, Xiang Li, Jicheng Wang, Xin Yu, Xinyang Han, Xiaomin Li, Philip Torr, Yuexing Hao

机构 * University of Southern California(南加利福尼亚大学) University of Chicago(芝加哥大学) University of California, Berkeley(加利福尼亚大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) University of California, Davis(加利福尼亚大学戴维斯分校) Pennsylvania State University(宾夕法尼亚州立大学) Harvard University(哈佛大学) University of Oxford(牛津大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对大型语言模型进展的标量总结问题,通过LiveCodeBench基准分离混淆,发现2024年9月后发布的模型在竞赛编程难任务上有超出预期的增益,发布了相关数据集与代码。

Comments 25 pages, 4 figures, 7 tables. Data and code: https://github.com/harvenstar/CurveShift

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29055 2026-08-03 cs.LG cs.AI cs.MA 新提交 73%

Autonomous Repair for Multi-Agent Systems via Monte-Carlo Tree Search

基于蒙特卡洛树搜索的多智能体系统自主修复

Hanxiao Lu, Tianyi Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究提出基于蒙特卡洛树搜索的MARS框架,将多智能体系统修复建模为搜索过程,结合分类学增强评估与诊断引导扩展,在StateMAS基准上性能优于现有方法,且令牌消耗相当。

Comments Under conference review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25933 2026-07-29 cs.CL cs.AI 新提交 73%

Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases

评估具有挑战性的真实世界临床病例中的多轮多模态诊断推理

Rui Yang, Weihao Xuan, Yi Lin, Zhuhan Bao, Jonathan Chong Kai Liew, Matthew Yu Heng Wong, Nicolás Lescano, Nikita R. Paripati, Emily Ling-Lin Pai, Jiarui Liu, Heli Qi, Heng-Jui Chang, Benny Kai Guo Loo, Huitao Li, Kunyu Yu, Yufan Wang, Chuan Hong, Shijian Lu, Douglas Teodoro, Naoto Yokoya, Ross Koppel, Mona Diab, Hua Xu, David W. Bates, Nan Liu, Yifan Peng

机构 * Center for Biomedical Data Science, Duke-NUS Medical School(生物医学数据科学中心,杜克 - 新加坡国立大学医学院) Duke-NUS AI + Medical Sciences Initiative, Duke-NUS Medical School(杜克 - 新加坡国立大学人工智能与医学科学计划,杜克 - 新加坡国立大学医学院) Department of Population Health Sciences, Weill Cornell Medicine(人口健康科学系,威尔康奈尔医学院) System Engineering, College of Engineering, Cornell University(系统工程,康奈尔大学工程学院) Graduate School of Frontier Sciences, The University of Tokyo(前沿科学研究生院,东京大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) Department of Biostatistics and Bioinformatics, Duke University(生物统计学与生物信息学系,杜克大学) Perelman School of Medicine, University of Pennsylvania(佩雷尔曼医学院,宾夕法尼亚大学) School of Clinical Medicine, University of Cambridge(临床医学学院,剑桥大学) Hospital of the University of Pennsylvania(宾夕法尼亚大学医院) Children’s Hospital of Philadelphia (CHOP)(费城儿童医院) Department of Anatomic Pathology and Laboratory Medicine, Hospital of the University of Pennsylvania(解剖病理学与检验医学系,宾夕法尼亚大学医院) Department of Pathology and Laboratory Medicine, University of California, San Francisco(病理学与检验医学系,加州大学旧金山分校) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有多模态大语言模型评估难以捕捉现实临床诊断复杂性的问题,开发ClinMM-Bench基准,用两级框架评估15个模型,发现专有模型诊断准确性最高,但各模型完全正确诊断比例有限,当前模型诊断推理有局限并明确了失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25485 2026-07-29 cs.AI cs.CL 新提交 73%

PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents

PatientAgentBench:一个用于评估面向患者的健康人工智能代理的基准框架

Korosh Vatanparvar, Ashutosh Joshi, Maria Xenochristou, Mohammad Abuzar Hashemi, Prasad Kasu, Deepak Bansal, Daniel Lopez-Martinez, Anchal Nema, Ramya Ganesan, Will Kimbrough, Alex Woody, Yadunandana Rao, Dilek Hakkani-Tur, Wilko Schulz-Mahlendorf

机构 * Amazon Health AI(亚马逊健康人工智能)

专题命中 评测与基准 :LLM(abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 研究面向患者的健康人工智能代理评估问题,核心方法是用PatientAgentBench框架,通过语言模型评审团在多维度评估,主要贡献是发现模型临床差距,发布可重复、经临床医生验证的评估标准助领域弥补差距。

Comments Code: https://github.com/amazon-science/PatientAgentBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24767 2026-07-29 cs.IR cs.AI cs.CL 新提交 73%

The Effect of Text Chunk Size on Retrieval-Augmented Generation Performance

文本块大小对检索增强生成性能的影响

German Garrido-Lestache Belinchon, Hugo Garrido-Lestache Belinchon

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究文本块大小对检索增强生成性能的影响,评估其与检索段数量如何影响生成质量和检索效果,通过比较配置,以更好理解文档分割对检索增强生成系统性能和效率的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24191 2026-07-28 cs.CL cs.AI 新提交 73%

StanceFlip: A Comprehensive Multi-Dimensional Benchmark for Multimodal Conversational Stance Flipping Forecasting

StanceFlip:用于多模态对话立场翻转预测的综合多维基准测试

Heyan Chai, Xin Li, Wenjie Wang, Jianyang Qin, Chaoyang Li, Lu Wang, Hao Chen, Qing Liao

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件学院) Harbin Institute of Technology Shenzhen(哈尔滨工业大学(深圳)) City University of Macau(澳门城市大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有对话立场检测基准测试的局限,提出StanceFlip基准测试及ConStaFF框架,含多模态立场六元组提取和动态立场翻转归因两个新子任务,基于大语言模型实现端到端立场推理,实验显示该方法性能领先。

Comments 17pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23808 2026-07-28 cs.CL cs.AI 新提交 73%

Indic DiarBench: A Multilingual Joint Diarization and ASR Benchmark for Indian Languages

Indic DiarBench:印度语言的多语言联合语音分离与自动语音识别基准

Deovrat Mehendale, Aditya Mehndiratta, Dhruv Rathi, Kaushal Bhogale, Mitesh M. Khapra

机构 * Sarvam AI(萨尔瓦姆人工智能公司) AI4Bharat, IIT Madras(印度理工学院马德拉斯分校人工智能促进印度发展实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 介绍涵盖印度22种在册语言的Indic DiarBench基准数据集,含约108小时多说话者音频,经人工校正注释。通过评估领先系统建立基线,该数据集作为开放资源推动印度语言多语言语音技术研究。

Comments 5 pages, 2 figures, Interspeech 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22561 2026-07-28 cs.AI cs.LG 新提交 73%

Codifying the Judge: Scalable Evaluation via Program Distillation

将评判器编码:通过程序蒸馏实现可扩展评估

Tzu-Heng Huang, Shengqi Qiu, Frederic Sala

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 研究针对基于语言模型的评判器成本高、延迟大等问题,提出用程序蒸馏方法,将其决策逻辑提炼成程序委员会。引入PAJAMA系统,实验显示程序评判器性能可匹配大语言模型,还能提高准确率和吞吐量,产生廉价有效奖励信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22014 2026-07-27 cs.AI cs.CL cs.CV cs.RO 新提交 73%

Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents

用于空中多模态大语言模型智能体的零样本任务级评估

Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt, Ishaan Bhimwal, Ryousuke Yamada, Yannik Blei, Wolfram Burgard, Yuki M Asano

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究空中MLLMs在零样本下解决长期具身任务的能力,引入MissionBench基准,含120个任务。对比22个模型与人类表现,发现模型成功率低,虽规模扩大有收益,但任务级能力需协调多种能力,凸显具身AI改进的前景与风险。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21610 2026-07-27 cs.AI cs.LG 新提交 73%

SCOPE and SCION: A Benchmark and an Auditable Reference Pipeline for Schema Induction and Fusion from Text

SCOPE和SCION:用于文本模式归纳与融合的基准和可审计参考管道

Miaobo Hu, Xiaobo Guo, Shuhao Hu, Bokun Wang, Rui Chen, Xin Wang, Daren Zha, Jun Xiao

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(信息工程研究所,中国科学院,北京,中国) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(网络安全学院,中国科学院大学,北京,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究针对模式图这一信息提取瓶颈,提出SCOPE基准和SCION参考管道。通过从训练文本构建候选空间,经严格JSON合同进行相关操作。在SCOPE核心套件上,SCION-lite表现最佳,SCION-RL减少对专有工程师依赖,还给出标准化结果及相关发布内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21274 2026-07-24 cs.CL cs.AI 新提交 73%

A Comparative Evaluation of Embeddings and LLMs in a Greek Book Publisher Setting - The CUP Dataset

希腊图书出版商环境中嵌入模型和大语言模型的比较评估 - CUP数据集

Katerina Papantoniou, Panagiotis Papadakos, Theodore Patkos, Dimitris Garefalakis, Nikos Vardakis, Dimitris Plexousakis

机构 * ICS-FORTH(希腊计算机科学与技术研究所) Crete University Press(克里特大学出版社)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出希腊图书检索基准CUP数据集,评估稀疏、密集、混合及大语言模型辅助的检索方法,发现多语言嵌入优于希腊特定模型,混合检索最佳,还分析了不同方法在各类查询中的表现及大语言模型相关技术的效果。

Comments Preprint of a manuscript submitted to the 14th EETN Conference on Artificial Intelligence (SETN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20596 2026-07-24 cs.LG cs.CL 新提交 73%

Are Single-Token Sparse Autoencoder Features Causally Necessary? Layer-Depth and SAE-Family Effects

单令牌稀疏自动编码器特征在因果关系上是必要的吗?层深度和SAE家族效应

Seonglae Cho, Zekun Wu, Kleyton Da Costa, Rishi Kalra, Ilham Wicaksono, Adriano Koshiyama

机构 * Holistic AI(整体人工智能公司) University College London(伦敦大学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究SAE特征因果作用在不同家族是否稳定,通过分析六个模型和三个SAE家族的390万个特征,发现单令牌特征聚类紧密且集中在早期层,跨家族因果有差异,其可解释性受训练方法影响,非仅激活函数或规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20558 2026-07-24 cs.LG cs.AI 新提交 73%

StabilityBench: Benchmarking Instability in LLMs

StabilityBench:评估大语言模型中的不稳定性

Emma Kondrup, Zachary Yang, Anne Imouza, Reihaneh Rabbany

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型实际行为难测、现有评估协议有局限的问题,提出StabilityBench基准测试工具,通过注入现实模拟增强现有基准,应用于四个基准测试评估九个模型,发现性能不稳定,还提出StabilityBench-Mini以实现更现实评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20479 2026-07-24 cs.AI cs.CL 新提交 73%

Beyond Liars' Bench: The Impact of Lie Typology, Depth, and Sparsity on Deception Detection in LLMs

超越说谎者基准:谎言类型、深度和稀疏性对大语言模型中欺骗检测的影响

Amr Moustafa, Max Feser, Florian Mai

机构 * University of Bonn(波恩大学) Lamarr Institute for ML and AI(拉马尔机器学习与人工智能研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型欺骗检测问题,通过扩充数据对谎言类型等因素影响检测性能进行系统研究,发现最佳表示深度依赖数据集,更具表达力探测器提升有限,稀疏特征与密集状态表现类似,强调训练数据和谎言类型选择对检测性有显著影响。

Comments Presented at the AI Transparency Conference 2026, forthcoming in the AI Transparency Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20455 2026-07-24 cs.CL cs.AI 新提交 73%

RE-AD: Real-Time Requirement Adherence for Data Labeling

RE-AD:数据标注的实时需求遵循

Siddarth Malreddy, Ishan Nigam, Akshay Arora, Nikhil Mittal, Subrat Sahu

机构 * Uber AI Solutions(优步人工智能解决方案)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对众包数据标注质量问题,引入RE-AD框架,利用大语言模型,通过分解SOP为原子规则、分类并应用分层验证策略来验证标注质量,在合成基准上F1分数达0.749,生产部署中标注者接受并修复大部分错误。

Comments Accepted to The Fifth Generation, Evaluation & Metrics Workshop (GEM) workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19259 2026-07-22 cs.LG cs.AI 新提交 73%

Benchmarking Generalization in Financial Statement Fraud Detection: robust evaluation and novel tasks

财务报表欺诈检测中的泛化基准测试:稳健评估与新任务

Guy Stephane Waffo Dzuyo, Gaël Guibon, Christophe Cerisara, Luis Belmar-Letelier

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对财务报表欺诈检测中现有方法性能估计不现实的问题,提出利用大语言模型整合结构化与非结构化数据的框架,通过新基准任务评估,构建公开数据集,该方法在新任务中性能最佳,凸显文本数据和稳健评估的价值。

Comments Accepted at FinLLM@IJCAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19209 2026-07-22 cs.CY cs.AI cs.LG 新提交 73%

Assessment in Team Problem-Solving Exercises in Computing Education

计算教育中团队问题解决练习的评估

Valdemar Švábenský, Jan Vykopal, Sukrit Leelaluk, Pavel Čeleda, Fumiya Okubo, Atsushi Shimada

机构 * Faculty of Informatics(信息学院) Masaryk University(马萨里克大学) Center for ICT Infrastructure(信息与通信基础设施中心) Yamaguchi University(山阳大学) Kyushu University(九州大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究计算教育中团队问题解决练习的评估方法,通过比较聚类和大语言模型,利用原始数据集与教师评分对比,发现聚类有效可靠、计算要求低,GPT-5.2误差低,相关方法已集成到开源平台,还共享了数据和工具。

Comments Full paper accepted for the main track of the IEEE FIE 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14989 2026-07-17 cs.CL cs.AI 新提交 73%

OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios

OmniaBench:跨多样场景对通用人工智能智能体进行基准测试

Chengyu Shen, Yujie Fu, Gangtao Xin, Yanheng Hou, Wenlong Fei, Guojie Zhu, Jiawei Li, Hongcheng Gao, Runming He, Zhen Hao Wong, Meiyi Qiang, Hao Liang, Zhao Cao, Hao Jiang, Chong Chen, Wentao Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型向通用智能体演变,现有基准测试有局限的问题,引入OmniaBench。通过多渠道获取场景知识形成分类法,构建可执行环境并合成任务,还引入能力分类法等。其数据集含多任务,对前沿模型构成挑战,能表征通用智能体能力边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14158 2026-07-17 cs.AI cs.CL cs.MA cs.SE 新提交 73%

Orchestrating Power Grid Studies with Multi-Agent AI and MCP Servers

利用多智能体人工智能和MCP服务器编排电网研究

Jérôme Picault, Clément Goubet

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 探讨智能体人工智能和MCP在TSO环境下对电网研究的支持,结合大语言模型等要素,介绍pypowsybl - mcp接口搭建试验台,研究智能体交互方式,讨论人工参与原则与评估策略,推动电网研究环境更具交互性、可审计性和扩展性。

Comments Accepted to IJCAI AISE 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14141 2026-07-17 cs.AI cs.LG 新提交 73%

Human AI Construction of Bayesian Networks for Operational Decision Support -- A Virtual Survey Approach

用于运营决策支持的贝叶斯网络的人工AI构建——一种虚拟调查方法

Kumar Rahul, Shovan Chowdhury

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究如何构建贝叶斯网络用于运营决策支持,提出利用大语言模型的新方法,通过人工智能代理估计概率并去噪,开发六步框架,以客户咨询医生意图建模为例,揭示因素影响,得出有效策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14101 2026-07-17 cs.CL cs.AI 新提交 73%

LBA: Textual Hard-Label Adversarial Attack under Low Query Budgets

LBA:低查询预算下的文本硬标签对抗攻击

Shixin Guo, Ming Zhong, Xuhong Zhang, Dandan Zhao, Zhe Wang, Bo Zhang, Shouling Ji, Hao Peng

机构 * Zhejiang Normal University(浙江师范大学) Zhejiang University(浙江大学) China Electric Power Research Institute(中国电力科学研究院)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究在低查询预算硬标签场景下生成高质量对抗文本的难题,提出基于采样的LBA方法,整合先验与后验知识构建近似分布用于采样,实验证明该方法在多语言模型上显著优于基线,生成的对抗文本语义保留性和可理解性更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11891 2026-07-15 cs.CL cs.AI 新提交 73%

CANDI: Contextual Alignment for Niche Domains Question Answering

CANDI:特定领域问答的上下文对齐

Megha Chakraborty, Darssan L. Eswaramoorthi, Het Riteshkumar Shah, Madhur Thareja, Michelle A Ihetu, Harshul Raj Surana, Kaushik Roy, Amit Sheth

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对专业领域大语言模型评估问题,提出CANDI-QA数据集,含两类问答对。评估多种语言模型,给出MTSS-Net框架。揭示特定领域上下文对齐挑战及当前模型局限,为上下文感知语言模型研究提供关键基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11873 2026-07-14 cs.CL cs.LG 新提交 73%

A Durability and Cross-Language Transfer Benchmark for a Validated Teaching-Feedback Classification Protocol

用于经过验证的教学反馈分类协议的耐久性和跨语言转移基准

Esteban U. Vega Barajas

机构 * Universidad de Guadalajara(瓜达拉哈拉大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究教学反馈分类协议的复用性问题,通过在原始西班牙数据上跨三代表示方法重新运行,并转移到英语,发现该协议具有耐久性,模型选择是部署决策而非方法特性。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11493 2026-07-14 cs.LG cs.AI math.CT 新提交 73%

Agentic Skill Optimization over Lie Algebroids

李代数胚上的智能体技能优化

Sridhar Mahadevan

机构 * Adobe Research(Adobe研究院) University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究智能体技能优化问题,提出LASKO框架,将技能建模为李代数胚截面,利用李括号筛选测试替代昂贵验证,在自然语言任务因果提取中实现近15倍加速,提升技能优化速度。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08625 2026-07-10 cs.AI cs.CL 新提交 73%

The complexities of patient-centred conversational artificial intelligence

以患者为中心的对话式人工智能的复杂性

João Matos, Olivia Buege, Donny Cheung, Gary S. Collins, Paula Dhiman, Nan Li, Bingyu Mao, Benjamin W. Nelson, Michail Ouroutzoglou, Paul Varghese, Jonathan Amar

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究面向消费者的健康聊天机器人开发评估问题,开发患者模拟器建模多方面内容,经图灵启发评估和多案例测试,发现沟通风格影响分诊结果,强调以患者为中心的对话式人工智能要适应沟通多样性。

Comments 36 pages (main text), 129 pages (supplementary materials)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08034 2026-07-10 cs.CL cs.AI cs.CY 新提交 73%

PLURAL: A Global Dataset for Value Alignment

PLURAL:一个用于价值对齐的全球数据集

Dhruv Agarwal, Anya Shukla, Tanya Goyal, Aditya Vashistha

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型反映西方价值观问题,引入基于IVS的PLURAL数据集,通过两阶段管道生成偏好三元组,经三种方式评估,结果显示其含价值引导可学习信号,能为多元对齐提供资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07670 2026-07-09 cs.CL cs.LG 新提交 73%

Does Bielik Know What It Doesn't Know? Activation Dispersion Separates Entity Familiarity from Factual Reliability Across Model Scale

比埃利克模型知道它所不知道的吗?激活离散度在模型规模上区分实体熟悉度与事实可靠性

Grzegorz Brzezinka

机构 * Prosit AS(Prosit公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型中实体熟悉度与事实可靠性,通过两种无监督离散度度量及有监督线性探测,在比埃利克模型上区分不同实体,发现激活离散度信号在模型规模上与事实可靠性表现不同,已知实体中区分正误更难,模型几乎不弃权。

Comments 23 pages, 6 figures and 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07500 2026-07-09 cs.LG cs.AI 新提交 73%

TimEE: End-to-end Time Series Classification via In-Context Learning

TimEE:通过上下文学习实现的端到端时间序列分类

Jaris Küken, Shi Bin Hoo, Martin Mráz, Frank Hutter, Lennart Purucker

机构 * University of Freiburg(弗莱堡大学) Zuse School ELIZA Darmstadt(达姆施塔特祖斯学校ELIZA) Prior Labs(普瑞尔实验室) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究针对时间序列分类两阶段范式的不足,提出TimEE模型,通过上下文学习实现端到端时间序列分类。该模型基于PFN框架在合成任务上元训练,无需针对每个数据集训练,在UCR基准测试中表现优异,为TSC提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏