arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-10 至 2026-07-10 共收录 227 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 57 篇

2607.08143 2026-07-10 cs.CL cs.AI cs.IR 新提交 88%

ICDAR 2026 HIPE-OCRepair Competition on LLM-Assisted OCR Post-Correction for Historical Documents

ICDAR 2026关于历史文档的大语言模型辅助OCR后校正的HIPE-OCRepair竞赛

Maud Ehrmann, Emanuela Boros, Juri Opitz, Andrianos Michail, Florian Wagner, Simon Clematide

机构 * École Polytechnique Fédérale de Lausanne (EPFL), Switzerland(瑞士联邦理工学院洛桑分校) University of Zurich, Switzerland(苏黎世大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 ICDAR 2026的HIPE-OCRepair竞赛旨在评估大语言模型辅助历史文档OCR后校正系统能力,提供可重现评估框架。四支队伍提交不同策略系统,结果显示虽能提高OCR质量,但性能因多种因素而异,还存在过度校正问题,相关资源已发布供后续研究。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08038 2026-07-10 cs.AI 新提交 86%

A safety-oriented hypothetico-deductive framework for AI-assisted differential diagnosis

一种用于人工智能辅助鉴别诊断的面向安全的假设-演绎框架

Fan Ma, Mauro Giuffrè, Donald Wright, Kent McCann, Mark Iscoe, Lingfei Qian, Mingyang Jiang, Chi Wing Ng, Na Hong, Huan He, Cathy Shyr, Qingyu Chen, Lee Schwamm, Lucila Ohno-Machado, Hua Xu

机构 * Yale School of Medicine, Yale University(耶鲁大学医学院,耶鲁大学) Università degli Studi di Trieste(的里雅斯特大学) Vanderbilt University(范德堡大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对诊断错误威胁,提出AegisDx框架,通过协调LLM组件进行鉴别诊断、筛查危险情况、验证推理等。经多层面评估,该框架在诊断准确率及安全评分等方面表现优于独立LLM,为急性护理提供更优床边决策支持

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07457 2026-07-10 physics.ed-ph 86%

How Well Do AI Systems Solve AP Physics? A Comparative Evaluation of Large Language Models on Algebra-Based Free Response Questions

AI系统如何解决AP物理问题?对大型语言模型在代数基础自由回答问题上的比较评估

Bilas Paul, Jashandeep Kaur, Shantanu Chakraborty, Shruti Shrestha

专题命中 评测与基准 :large language model(title);language model(title);prompting(abstract)

AI总结 本文评估了AI系统在解答AP物理自由回答问题上的表现,发现其在代数问题解决上表现良好,但在空间推理和视觉解释方面存在局限。

Comments 10 pages, 3 figures

Journal ref Phys. Educ. 61 045008 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07895 2026-07-10 cs.CL 新提交 85%

Scalable and Culturally Specific Stereotype Dataset Construction via Human-LLM Collaboration

通过人机协作构建可扩展的特定文化刻板印象数据集

Weicheng Ma, John Guerrerio, Soroush Vosoughi

机构 * Dartmouth(达特茅斯学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对大语言模型刻板印象研究多集中于英语语境的问题,引入人机协作标注框架构建西班牙语刻板印象数据集EspanStereo,验证框架有效性,揭示各国刻板行为差异,该框架可扩展用于多语言,拓宽了刻板印象分析范围并奠定跨文化偏见评估基础。

Comments Weicheng Ma, John Guerrerio: equal contribution; published in EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03533 2026-07-10 cs.AI 85%

Automated Analysis of Global AI Safety Initiatives: A Taxonomy-Driven LLM Approach

全球人工智能安全举措的自动化分析:基于分类学的LLM方法

Takayuki Semitsu, Naoto Kiribuchi, Kengo Zenitani

机构 * Japan AI Safety Institute(日本人工智能安全研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种自动化框架,通过共享活动分类法比较AI安全政策文件,利用活动地图上的活动类别提取并映射相关活动,生成摘要、比较和相似度评分,评估LLM在政策文档中的稳定性与有效性。

Comments 18 pages, 6 figures, 6 tables, to be published in PoliticalNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18020 2026-07-10 cs.SE cs.AI 85%

Specification and Detection of LLM Code Smells

LLM代码异味的规范与检测

Brahim Mahmoudi, Zacharie Chenail-Larcher, Naouel Moha, Quentin Stiévenart, Florent Avellaneda

机构 * École de technologie supérieure Université du Québec à Montréal

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LLM代码异味的概念,通过扩展检测工具SpecDetect4AI,分析了200个开源LLM系统中60.50%的系统存在代码异味问题,检测精度达86.06%。

Comments Accepted paper at ICSE NIER 2026 : https://conf.researchr.org/track/icse-2026/icse-2026-nier

Journal ref ICSE-NIER '26: 2026 IEEE/ACM 48th International Conference on Software Engineering Rio de Janeiro Brazil April 12 - 18, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08745 2026-07-10 cs.AI cs.CV 新提交 83%

AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding

自动驾驶视觉问答:以事件为中心的行车记录仪理解视觉语言模型基准测试

Siddharth Damodharan, Radhika Gupta, Ali Alshami, Ryan Rabinowitz, Jugal Kalita

机构 * University of Colorado Colorado Springs(科罗拉多大学科罗拉多斯普林斯分校) University of Michigan(密歇根大学) University of Notre Dame(圣母大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 针对评估视觉语言模型对安全关键事件推理能力的挑战,提出AUTOPILOT-VQA基准,通过围绕真实驾驶事件的结构化问题评估系统,涵盖多安全相关类别,推动向安全意识推理发展,为自动驾驶系统评估提供标准,助力相关视觉语言系统开发。

Comments CVPR Autopilot Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07758 2026-07-10 cs.LG 新提交 83%

Scalable and Trustworthy Earth Observation Foundation Models

可扩展且可信的地球观测基础模型

Syed Usama Imtiaz, Mitra Nasr Azadani, Nasrin Alamdari

机构 * Department of Civil and Environmental Engineering, Florida State University(土木与环境工程系,佛罗里达州立大学)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 研究地球观测基础模型,指出其因数据特性需特定领域适配。回顾相关设计原则,综合模型格局等内容,纳入基准证据说明评估问题,通过案例展示实践原则,提出应从多方面评估下一代遥感基础模型。

Comments (Preprint, in review) Elsevier Book Chapter: Next-Generation Remote Sensing Methods

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26962 2026-07-10 cs.CY cs.AI cs.CL 版本更新 82%

DeepTutor: Towards Agentic Personalized Tutoring

DeepTutor:迈向代理式个性化辅导

Bingxi Zhao, Jiahao Zhang, Xubin Ren, Zirui Guo, Tianzhe Chu, Yi Ma, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DeepTutor通过结合引用基础问题辅导与难度校准的问题生成,提出一个统一的开放源码框架,利用静态知识和动态学习者记忆实现个性化适应,并在五个领域大学课程中评估个性化教学效果。

Comments Tech Report, work in progress. Code available at https://github.com/HKUDS/DeepTutor

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08124 2026-07-10 cs.SE cs.LG 新提交 81%

TTHE: Test-Time Harness Evolution

测试时工具演化

Jun Nie, Yonggang Zhang, Jun Song, Qianshu Cai, Dahai Yu, Yike Guo, Xinmei Tian, Bo Han

机构 * Hong Kong Baptist University(香港 Baptist 大学) University of Science and Technology of China(中国科学技术大学) Hong Kong Generative AI Research & Development Center, The Hong Kong University of Science and Technology(香港生成式人工智能研究与开发中心,香港科技大学) TCL Corporate Research (HK) Co., Ltd(TCL 企业研究(香港)有限公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 研究LLM智能体测试时工具优化问题,提出TTHE方法,通过维护候选工具种群,基于执行轨迹推理优化,无需黄金标签或特定任务监督,在多任务实验中改进基线工具,将测试时适应重塑为程序演化并确定代理可靠性挑战。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12857 2026-07-10 cs.CY cs.AI 版本更新 81%

Adaptive Generation of Bias-Eliciting Questions for LLMs

为大语言模型自适应生成偏差引发问题

Robin Staab, Jasper Dekoninck, Maximilian Baader, Martin Vechev

机构 * ETH Zurich, Switzerland(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型固有偏差问题,引入反事实框架,通过迭代问题变异生成开放式问题评估偏差,构建CAB基准,评估发现模型在某些场景有持续偏差,凸显公平性研究需求。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08535 2026-07-10 cs.CL cs.AI 新提交 81%

When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability

当评判者改变时,测量结果也会改变:评估大语言模型作为评判者的可靠性

Zongyou Yang, Yinghan Hou, Xiaokun Yang

机构 * Dyson School of Design Engineering, Imperial College London(伦敦帝国理工学院戴森设计工程学院) Department of Electrical and Electronic Engineering, Imperial College London(伦敦帝国理工学院电气与电子工程系) School of Electronic Information, Nanchang Institute of Technology(南昌工程学院电子信息学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型作为评判者时分数因评估者变化而改变的问题,通过在四个数据集上比较两种升级路径,发现评判者升级不可互换,强评判者可减偏差,重复采样陪审团作用有限,结构化辩论能改决策,提出报告应含多方面内容。

Comments 6 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07729 2026-07-10 cs.MA cs.AI cs.CL 新提交 81%

Collective Intelligence with Foundation Models

基于基础模型的集体智能

J. de Curtò, I. de Zarzà

机构 * Department of Computer Applications in Science \& Engineering, BARCELONA Supercomputing Center, 08034 Barcelona, Spain Escuela Técnica Superior de Ingeniería (ICAI), Universidad Pontificia Comillas, 28015 Madrid, Spain Human Centered AI, Data \& Software, LUXEMBOURG Institute of Science

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究如何将多个基础模型协调成合作推理系统,提出多智能体框架,含求解器、批评和聚合智能体及评分模块。通过消融研究比较四种配置,发现模型异质性是性能提升关键,能提高逐步准确率、降低方差,还讨论了相关原则、方法及对应用人工智能的影响。

Comments Accepted as a book chapter in "Advances in Global Applied Artificial Intelligence" (G. A. Tsihrintzis, M. Virvou, N. G. Bourbakis, L. C. Jain, Eds.), authenticated version will be published in Springer series: Learning and Analytics in Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12612 2026-07-10 cs.IR cs.AI 版本更新 79%

Self-EvolveRec: Self-Evolving Recommender Systems with LLM-based Directional Feedback

Self-EvolveRec:基于大语言模型定向反馈的自进化推荐系统

Sein Kim, Sangwu Park, Hongseok Kang, Wonjoong Kim, Jimin Seo, Yeonjun In, Kanghoon Yoon, Hyunsik Jeon, Chanyoung Park

机构 * Microsoft(微软)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究针对传统推荐系统设计方法局限,提出Self-EvolveRec框架,集成用户模拟器与模型诊断工具建立定向反馈循环,并引入协同进化策略。实验证明该框架在推荐性能和用户满意度上显著优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19032 2026-07-10 cs.CV 版本更新 78%

Diagnosing Corruption-Induced Reliability Failures in Vision-Language Models

诊断视觉语言模型中由损坏引起的可靠性故障

Xiangjie Sui, Songyang Li, Hanwei Zhu, Baoliang Chen, Yuming Fang, Xin Sun

机构 * City University of Macau(澳门城市大学) Nanyang Technological University(南洋理工大学) Jiangxi University of Finance and Economics(江西财经大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究视觉损坏对视觉语言模型行为的影响,引入Bench-C测试平台及稳健对齐分数(RAS),通过对13个VLM实验发现轻度损坏会提高top-1准确率却降低预测结构,支持超越最终答案的稳健性评估。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12497 2026-07-10 cs.CR 版本更新 78%

Demystifying LLM Supply Chain Vulnerabilities in the Wild: Distribution, Root Cause, and Real-World Impact

揭开大语言模型供应链在实际应用中的漏洞:分布、根源及现实世界影响

Shenao Wang, Yanjie Zhao, Zhao Liu, Quanchen Zou, Haoyu Wang

专题命中 评测与基准 :LLM(title,abstract)

AI总结 该研究首次系统大规模实证分析大语言模型供应链漏洞,分析529个实际漏洞,发现漏洞集中在应用层等,特定漏洞源于独特特征,还研究了现实影响,提炼5条见解,为保障供应链安全提供数据基础与研究方向。

Comments Accepted by Internetware 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08346 2026-07-10 cs.CL q-fin.GN 新提交 77%

Grounded Event Extraction from SEC 8-K Filings with a Fine-Grained Taxonomy

基于细粒度分类法从美国证券交易委员会8-K文件中提取有依据的事件

Rian Dolphin, Joe Dursun, Jarrett Blankenship, Katie Adams, Quinton Pike

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对美国证券交易委员会8-K文件项目代码粗略问题,提出两阶段系统按119种事件类型分类法标记文件。通过模糊n-gram验证和重新评分产出有依据事件标签,经实验验证该系统能有效区分经济上不同的事件,提升事件提取精度。

Comments 9 pages, 8 figures, 1 table. Full dataset and taxonomy available at https://massive.com/docs/rest/stocks/filings/8-k-disclosures?utm_source=research&utm_campaign=8k_tags

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07946 2026-07-10 cs.SE cs.LG 新提交 77%

DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks

DeepSWE:在原始的、长周期工程任务上评估前沿编码智能体

Wenqi Huang, Charley Lee, Leonard Tng, Serena Ge

机构 * Datacurve

专题命中 评测与基准 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.LG

AI总结 研究针对编码智能体评估,指出多数基准测试存在的问题。提出DeepSWE基准测试,其任务从零编写,用手写验证器评分,能避免相关问题,在区分智能体等方面表现出色,还发布了基准测试等相关内容。

Comments 32 pages, 10 figures. Code and data: https://github.com/datacurve-ai/deep-swe ; https://deepswe.datacurve.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07881 2026-07-10 cs.SE cs.CR cs.LG 新提交 77%

Functional and Secure Code Generation with Task Vectors

使用任务向量进行功能和安全代码生成

Felix Wang, Anudeep Das, Mei Nagappan, N. Asokan

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究旨在解决大语言模型生成安全功能代码的问题,提出SecVecCoder方法,利用任务向量生成可信代码,在CodeGuard+基准测试中提升了可信代码完成率,且解码延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06127 2026-07-10 cs.CL 新提交 77%

Measuring the practice of shared-decision making (OPTION12): An Investigation into Open-sourced Smaller LLMs (OS-sLLMs) for Better Privacy and Sustainability

衡量共享决策的实践(OPTION12):对用于更好隐私和可持续性的开源小型语言模型(OS - sLLMs)的调查

Tamara Wit, Lifeng Han, Carly Heipon, David Lindevelt, Anne Stiggelbout, Suzan Verberne

机构 * Leiden University Medical Centre(莱顿大学医学中心) The Leiden Institute of Advanced Computer Science(莱顿高级计算机科学研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 研究利用Observer OPTION12框架,对开源小型语言模型进行共享决策自动评估,聚焦隐私保护与本地部署。通过专家注释临床咨询评估多个模型,发现通用领域模型表现更好,还引入共识框架,为隐私保护的人在回路SDM评估提供基础。

Comments Pilot study. Preliminary findings on open-source smaller LLMs for OPTION12 shared decision-making assessment

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02615 2026-07-10 cs.CR cs.AI cs.SE 新提交 77%

TAG: A Lightweight Framework for Test-Driven Agentic Artifact Generation

代理创建,我们验证:用于代理工件生成的轻量级框架

Yaniv Melamed, Yoni Zukerman, Michal Shechter, Miri Weissler, Ashwin Patil, Hani Neuvirth-Telem

机构 * Microsoft(微软)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究如何用大语言模型生成结构化工件并使其可靠用于生产部署。核心方法是基于“LLMs生成,我们验证”原则构建轻量级框架,贡献是提出含三关键属性的框架并在安全领域验证,还可用于其他工件生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00331 2026-07-10 cs.AI cs.MA 77%

CogEvo-Edu: Cognitive Evolution Educational Multi-Agent Collaborative System

CogEvo-Edu: 基于认知进化教育的多智能体协作系统

Yefeng Wu, Yuchen Song, Yecheng Zhao, Ling Wu, Shan Wan

机构 * Electronic Science and Technology, Anhui University(安徽大学电子科学与技术学院) Medical Imaging Science, Wannan Medical College(皖南医学院医学影像学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CogEvo-Edu通过认知进化机制实现教育多智能体协作,提升数字信号处理教学效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13723 2026-07-10 cs.SE 版本更新 75%

Compiling Large Multi-Modal Requirement Documents into Runnable Software Systems: From an Agentic Test-Driven Perspective

ARC:将大型多模态需求文档编译为可运行软件系统

Weiyu Kong, Yun Lin, Xiwen Teoh, Duc-Minh Nguyen, Ruofei Ren, Jiaxin Chang, Haoxu Hu, Haoyu Chen

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 提出Agentic需求编译(ARC)技术,通过双向测试驱动智能体循环,将多模态DSL文档直接编译为可运行Web系统,在GUI测试通过率上平均提升50.6%。

Comments This work is accepted at issta'26 (SIGSOFT International Symposium on Software Testing and Analysis)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08625 2026-07-10 cs.AI cs.CL 新提交 73%

The complexities of patient-centred conversational artificial intelligence

以患者为中心的对话式人工智能的复杂性

João Matos, Olivia Buege, Donny Cheung, Gary S. Collins, Paula Dhiman, Nan Li, Bingyu Mao, Benjamin W. Nelson, Michail Ouroutzoglou, Paul Varghese, Jonathan Amar

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究面向消费者的健康聊天机器人开发评估问题,开发患者模拟器建模多方面内容,经图灵启发评估和多案例测试,发现沟通风格影响分诊结果,强调以患者为中心的对话式人工智能要适应沟通多样性。

Comments 36 pages (main text), 129 pages (supplementary materials)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08034 2026-07-10 cs.CL cs.AI cs.CY 新提交 73%

PLURAL: A Global Dataset for Value Alignment

PLURAL:一个用于价值对齐的全球数据集

Dhruv Agarwal, Anya Shukla, Tanya Goyal, Aditya Vashistha

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型反映西方价值观问题,引入基于IVS的PLURAL数据集,通过两阶段管道生成偏好三元组,经三种方式评估,结果显示其含价值引导可学习信号,能为多元对齐提供资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12138 2026-07-10 cs.AI cs.CL cs.IR 版本更新 73%

Retrieval-Augmented Generation Must Move Beyond Factual Grounding to Represent Diverse Opinions

检索增强生成必须超越事实基础以代表多样化观点

Aditya Agrawal, Alwarappan Nakkiran, Darshan Fofadiya, Alex Karlsson, Harsha Aduri, Aman Singh Thakur

机构 * Amazon.com(亚马逊公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文指出检索增强生成系统存在系统性事实偏差,并提出需要在检索系统设计上进行范式转变,通过不确定性量化方法提出统一目标,并展示Opinion-Aware RAG架构在两个领域中的实验结果,证明其在多样性、公平性和准确性方面的提升。

Comments 18 pages, Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07102 2026-07-10 cs.CL cs.AI 版本更新 73%

Persona Matters: Effects of Activation Steering on Short Answer Generation and Scoring

通过人格向量引导大型语言模型在教育应用中的影响

Yongchao Wu, Aron Henriksson

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过人格向量引导大型语言模型在教育应用中的影响,发现其在短答案生成和自动评分中效果不一,尤其在开放性英语文学任务中影响更大,且混合专家模型表现出更大的校准偏移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08768 2026-07-10 cs.CL 新提交 70%

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks

UniClawBench:面向实际任务中主动智能体的通用基准测试

Zhekai Chen, Chengqi Duan, Kaiyue Sun, Bohao Li, Yuqing Wang, Manyuan Zhang, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) Meituan(美团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有基准测试难以评估主动智能体的问题,提出UniClawBench,基于五项基础模型能力设计400个双语现实任务,采用实时评估和闭环评估策略,通过多模型框架对比展示基础模型能力和框架设计对性能的影响,还公开了基准测试和代码。

Comments Project Page: https://uniclawbench.github.io | GitHub Repo: https://github.com/HKU-MMLab/UniClawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08269 2026-07-10 cs.AI 新提交 70%

PolyUQuest: Verifiable Structure-Aware Web RAG over Heterogeneous Graphs

PolyUQuest:基于异构图的可验证结构感知网络检索增强生成

Ying Liu, Yi Ye, Quanyu Feng, Mingxi Ye, Mingtao Zhang, Haoyang Li, Chen Jason Zhang, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对现有RAG系统不足,提出基于异构图的PolyUQuest框架。通过双层路由器分配查询到三种检索模式,答案可验证。在PolyU官网等评估中,该框架在多方面优于现有系统,还提供交互式界面,准备部署为学生问答服务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07824 2026-07-10 cs.MA cs.AI 新提交 70%

From Triggers to Emotions: A CPM-Grounded Appraisal Multi-Agent for Dynamic Emotional Evolution in Persona-Based Dialogue

从触发因素到情感:基于CPM的评估多智能体模型用于基于角色的对话中的动态情感演变

Jingyao Cai, Shuaijun Liu, Abdul Rehman, Yutong Guo, Qin Tian, Thomas Dolby, Sue Green, Chantel Cox, Xiaosong Yang

机构 * National Centre for Computer Animation(国家计算机动画中心) Information Hub(信息中心) Key Laboratory of Child Cognition & Behavior Development of Hainan Province(海南省儿童认知与行为发展重点实验室) Chief Technology Officer(首席技术官) School of Health and Care(健康与护理学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对基于角色对话中情感模拟的局限,借鉴CPM理论提出CPM - MultiAgent框架,通过情感触发提取、协作评估和状态更新实现情感一致的角色模拟,经多种实验验证能有效模拟动态情感演变。

详情

展开后加载摘要…

URL PDF HTML 收藏