arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-07 至 2026-07-07 共收录 712 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 99 篇

2607.03628 2026-07-07 cs.CR cs.MA 新提交 50%

Swarm-Driven Multi-Agent Reasoning for Smart City Security

用于智慧城市安全的群体驱动多智能体推理

Saeid Jamshidi, Kawser Wazed Nafi, Carol Fung, Foutse Khomh

专题命中 推理与问题求解 :LLM(abstract)

AI总结 研究智慧城市安全问题,提出基于大语言模型的多智能体方法TPSC-Sec,通过专门智能体分析并经威胁信息素群体共识机制聚合假设,还引入Adaptive Verified TPSC,实验表明该方法能实现高效安全推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03599 2026-07-07 cs.SE 新提交 50%

LogSemFuse: Semantic Evidence Fusion for Explainable Log Anomaly Detection

LogSemFuse:用于可解释日志异常检测的语义证据融合

Hassan Jabri, Zeyang Ma, Zhijie Wang, Tse-Hsun Chen

专题命中 推理与问题求解 :LLM(abstract)

AI总结 研究日志异常检测,提出LogSemFuse框架,结合骨干预测与多源语义证据,增强现有检测器,能产生异常决策和基于证据的解释,提升检测效果与可解释性,且开销小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02719 2026-07-07 cs.CV 新提交 50%

GRCD: Grounded Region Change Detection for Multi-Finding Chest X-Ray Pairs

GRCD:用于多发现胸部X光对的地面区域变化检测

OFM Riaz Rahman Aranya, Peyman Najafirad, Kevin Desai

机构 * Department of Computer Science(计算机科学系)

专题命中 推理与问题求解 :language model(abstract)

AI总结 针对现有胸部X光多发现报告自动生成方法不足,提出GRCD框架。通过修正标注错误构建数据集,引入模块编码区域变化并注入语言模型,在多发现测试集上性能优于基线,消融实验验证设计有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28862 2026-07-07 cs.CV 版本更新 50%

HKVLM: Faithful Query--Region Binding for Frozen-Detector Visual Grounding

HKVLM:通过将语言查询绑定到冻结检测器实现忠实推理定位

Bo Ma

机构 * Bo Ma

专题命中 推理与问题求解 :language model(abstract)

AI总结 提出HKVLM框架,通过将定位从语言路径中分离,利用冻结检测器和语言模型,仅训练轻量对齐钩子实现推理定位,在少样本冷启动场景下显著提升定位精度并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22867 2026-07-07 cs.CV cs.RO 版本更新 50%

MUSON: A Reasoning-oriented Multimodal Dataset for Socially Compliant Navigation in Urban Environments

MUSON:用于城市环境中社会合规导航的面向推理的多模态数据集

Zhuonan Liu, Xinyu Zhang, Zishuo Wang, Runji Cai, Tomohito Kawabata, Qianyi Li, Xuance Peng, Tianze Yu, Zhen Xiong, Xuesu Xiao, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(北海道大学信息科学研究生院) Graduate School of Computer Science, George Mason University(乔治·马歇尔大学计算机科学研究生院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 研究社会合规导航问题,利用视觉语言模型,引入含10110个自我中心样本的多模态数据集MUSON,采用五步注释框架,为推进该导航提供有效基准。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 164 篇

2605.30919 2026-07-07 cs.LG cs.AI 版本更新 92%

De-attribute to Forget for LLM Unlearning

De-attribute to Forget for LLM Unlearning

Xinyang Lu, Jiabao Pan, Rachael Hwee Ling Sim, See-Kiong Ng, Anthony Kum Hoe Tung, Bryan Kian Hsiang Low

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于数据归因奖励的LLM遗忘框架DareU,通过强化学习降低生成响应与遗忘数据的归因分数,实现有效遗忘并平衡模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20408 2026-07-07 cs.CR cs.AI 新提交 92%

NRT-Bench: Benchmarking Multi-Turn Red-Teaming of LLM Operator Agents in Safety-Critical Control Rooms

LLM智能体安全性、多轮红队测试、越狱基准、对抗鲁棒性、安全关键系统

Hanwool Lee, Dasol Choi, Bokyeong Kim, Haon Park, Seung Geun Kim

机构 * AIM Intelligence(AIM智能公司) KAERI(韩国原子能研究所)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出NRT-Bench基准,通过模拟核电站控制室的多轮红队测试,评估LLM智能体在安全关键系统中的对抗鲁棒性,发现不同模型的漏洞几乎不重叠,且防御效果高度依赖模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28893 2026-07-07 cs.SE cs.CR 91%

Towards Demystifying and Repairing LLM-in-the-Loop Vulnerabilities

迈向揭示与修复LLM-in-the-Loop漏洞

Yujie Ma, Jialin Rong, Chenxi Yang, Lili Quan, Jin Wen, Xiaofei Xie, Yongqiang Lyu, Qiang Hu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 通过构建首个LLM-in-the-loop漏洞数据集LLMCVE,分析发现LLM常作为目标或传播向量而非根因,并评估现有修复方法,揭示此类漏洞修复更具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03377 2026-07-07 cs.CL cs.AI 新提交 91%

Spectral Signatures of Large Language Models

大语言模型的频谱特征

Zhuoying Zhang, Ishan V. Prasad, Yuanzhe Hu, Zihang Liu, Hengrui Luo, Pu Ren, Yaoqing Yang

机构 * Rice University(莱斯大学) Dartmouth College(达特茅斯学院) Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 针对大规模管理和量化大语言模型的挑战,采用基于重尾自正则化理论的频谱形状指标,以权重经验谱密度形状信息为模型频谱特征,可用于模型谱系追踪等,还构建语料库进行基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03704 2026-07-07 cs.CL 新提交 90%

Optimizing Large Language Models for Causality Assessment in Pharmacovigilance: Developing a Performance Metric as Objective for Bayesian Hyperparameter Optimization

优化用于药物警戒中因果关系评估的大语言模型:开发一种性能指标作为贝叶斯超参数优化的目标

Nicole Sonne Heckmann, Arnault-Quentin Vermillet, Søren Norlin Mølgaard, Manuela Del Castillo Suero, Lars Melskens, Gerard Ompad, Maurizio Sessa

机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系) Safety Operations, Novo Nordisk(诺和制药安全运营部) Clinical Development Centre Denmark, Novo Nordisk(丹麦临床开发中心,诺和制药) Statistical Data Science Lead, Pfizer(辉瑞统计数据科学负责人)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究针对药物警戒中因果关系评估优化大语言模型,开发高斯过程兼容的优化目标,用链思维提示评估GPT-5.2,通过贝叶斯优化研究温度优化效果,EWACS指标优化提升了因果关系分类一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20677 2026-07-07 cs.CR cs.CL 版本更新 90%

Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models

基于学习的自动化对抗红队测试用于大型语言模型的鲁棒性评估

Zhang Wei, Hanxuan Chen, Peilu Hu, Zhenyuan Wei, Chenwei Liang, Jiayi Gu, Wenqian Weng, Jacqueline Pang, Hao Yan, Li Mei, Shengning Lang, Kuan Lu, Xi Xiao, Zhimo Han, Yijin Wang, Yichao Zhang, Chen Yang, Zhenyu Yu, Riyang Bao, Xinyuan Song, Junfeng Hao, Mu-Jiang-Shan Wang

机构 * Independent Researcher(独立研究者) Hunan University(湖南大学) Shenzhen Kaihong Digital Industry Development Co., Ltd.(深圳凯鸿数字产业开发有限公司) Central University of Finance and Economics(中央财经大学) Chongqing University(重庆大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Stevens Institute of Technology(斯蒂文斯理工学院) Cornell University(康奈尔大学) Oak Ridge National Laboratory(橡树岭国家实验室) Zhengzhou University of Light Industry(郑州轻工业大学) Xidian University(西安电子科技大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) AI Safety Research Lab, Institute of Advanced Computing(高级计算研究所人工智能安全研究实验室) University of Malaya(马来亚大学) Emory University(埃默里大学) Department of Nephrology, Affiliated Hospital of Guangdong Medical University(广东医学院附属医院肾内科)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出一种学习驱动的自动化红队测试框架,用于高效发现大型语言模型的漏洞,通过元提示引导的对抗性提示生成和分层执行检测流程,在六个威胁类别中实现标准化评估,实验发现47个漏洞,包括21个高严重性失败和12种新攻击模式。

Comments ACL ARR minor revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19698 2026-07-07 cs.AI 版本更新 90%

RLIE: Rule Generation with Logistic Regression, Iterative Refinement, and Evaluation for Large Language Models

RLIE:用于大语言模型的基于逻辑回归、迭代细化和评估的规则生成

Yang Yang, Hua XU, Zhangyi Hu, Yutao Yue

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究提出RLIE框架,将大语言模型与概率建模结合学习加权规则集,经规则生成、逻辑回归、迭代细化和评估四阶段,评估多种推理策略,明确大语言模型在归纳推理中的潜力与局限,实现更可靠的神经符号推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08269 2026-07-07 cs.NE cs.AI 版本更新 90%

A Systematic Survey on Large Language Models for Evolutionary Optimization: From Modeling to Solving

关于用于进化优化的大语言模型的系统综述:从建模到求解

Yisong Zhang, Ran Cheng, Guoxing Yi, Kay Chen Tan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该综述聚焦进化优化,通过工作流框架系统回顾相关进展,将文献分为优化建模与求解两阶段,求解阶段再分三类范式,分析方法、局限性及与传统方法关系,还给出基准、比较及应用,并指出研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02509 2026-07-07 cs.CL 版本更新 90%

When Rating Scales Fall Short: LLM-Assisted Discovery of ADHD Signals in Turkish Teacher Narratives

当评分量表不足时:LLM辅助发现土耳其教师叙述中的ADHD信号

Baris Karacan, Irem Aktar Songur, Ahmet Ozaslan, Elvan Iseri

机构 * Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系) Department of Child and Adolescent Psychiatry, Gazi University(加齐大学儿童与青少年精神病学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过分析土耳其教师评估表中的结构化评分和开放式叙述,利用大语言模型辅助的主题发现方法,揭示了叙述文本中未被结构化量表捕捉的ADHD互补信号。

Comments 15 pages. Accepted to CLPsych 2026. Camera-ready author version. The final version will appear in the ACL Anthology

Journal ref In Proceedings of the 10th Workshop on Computational Linguistics and Clinical Psychology (CLPsych 2026), pages 368-382, San Diego, California, USA, 2026. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03734 2026-07-07 cs.SE 新提交 89%

Fault Detection and Explainable Classification in Automotive HIL Validation via Denoising Autoencoders and In-Context Large Language Models

通过去噪自编码器和上下文大语言模型进行汽车硬件在环验证中的故障检测与可解释分类

Mohammad Abboush, Hamza Ouarrad, Andreas Rausch

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 提出用于汽车实时验证中故障检测与分类的通用且可解释的两阶段框架,先以去噪自编码器标记异常,再用大语言模型分类并给出解释,评估显示该方法有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19185 2026-07-07 cs.CL cs.AI 88%

SCURank: Ranking Multiple Candidate Summaries with Summary Content Units for Enhanced Summarization

SCURank: 基于摘要内容单元的多候选摘要排序以提升摘要生成

Bo-Jyun Wang, Ying-Jia Lin, Hung-Yu Kao

机构 * Department of Computer Science and Information Engineering, National Cheng Kung University(国立成功大学计算机科学与资讯工程系) Artificial Intelligence Research Center, Chang Gung University(长庚大学人工智能研究中心) Department of Artificial Intelligence, Chang Gung University(长庚大学人工智能系) Department of Computer Science, National Tsing Hua University(国立清华大学计算机科学系)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 SCURank通过摘要内容单元提升摘要生成,优于传统指标和LLM排序方法,验证了信息导向排序在多LLM蒸馏中的优势。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04061 2026-07-07 cs.CL cs.AI cs.LG stat.ML 新提交 88%

Telescope: Improving Zero Shot Detection of LLM Generated Content By Measuring Token Repetition Probability

望远镜:通过测量令牌重复概率改进大语言模型生成内容的零样本检测

Christopher Nassif, Josh F. Cooper

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究区分大语言模型生成文本与人类写作的难题,提出用望远镜困惑度衡量模型令牌重复,揭示该特征在预训练早期出现,能有效进行零样本检测,性能优于其他方法。

Comments 50 pages, ICML, 20 figures, Equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06371 2026-07-07 cs.CY 版本更新 88%

Bilingual Bias in Large Language Models: A Taiwan Sovereignty Benchmark Study

大语言模型中的双语偏差:一项台湾主权基准研究

Ju-Chun Ko

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究大语言模型在多语言环境下对政治敏感话题的语言一致性,通过对17个模型进行双语基准测试,发现显著语言偏差,提出量化指标并开源框架。

Comments 19 pages, 4 tables, benchmark code available at https://github.com/dAAAb/ai-taiwan-sovereignty-benchmark-pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17329 2026-07-07 cs.CR 版本更新 88%

Risk Assessment and Security Analysis of Large Language Models

大语言模型的风险评估与安全分析

Xiaoyan Zhang, Dongyang Lyu, Xiaoqi Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 针对大语言模型在关键应用场景的安全问题,设计动态风险评估系统与分层防御系统,用熵加权计算多指标,结合多种技术,能识别隐蔽攻击并快速评估风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17801 2026-07-07 cs.RO cs.CV 版本更新 88%

Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain

Robobench:作为具身大脑的多模态大语言模型的综合评估基准

Yulin Luo, Chun-Kai Fan, Menghang Dong, Jiayu Shi, Xiangju Mi, Mengdi Zhao, Bo-Wen Zhang, Cheng Chi, Jiaming Liu, Gaole Dai, Rongyu Zhang, Ruichuan An, Kun Wu, Zhengping Che, Shaoxuan Xie, Guocai Yao, Zhongxia Zhao, Pengwei Wang, Guang Liu, Zhongyuan Wang, Tiejun Huang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息多媒体国家重点实验室,计算机学院,北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute for Brain and Intelligence, Fudan University(脑与智能研究院,复旦大学) University of Science and Technology Beijing(北京科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究针对在动态非结构化环境中构建能感知、推理和行动的机器人的挑战,介绍RoboBench基准,涵盖多维度、多任务等,能评估多模态大语言模型,揭示其局限性并分析与下游控制关系,为量化高级认知提供支架。

Comments ECCV 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01793 2026-07-07 cs.AI 新提交 87%

Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification

大规模安全测试LLM智能体:从风险发现到基于证据的验证

Yunhao Feng, Ruixiao Lin, Ming Wen, Qinqin He, Yanming Guo, Yifan Ding, Yutao Wu, Jialuo Chen, Zhuoer Xu, Xiaohu Du, Jianan Ma, Zixing Chen, Xingjun Ma, Yunhao Chen, Xinhao Deng

机构 * AntGroup(蚂蚁集团) Zhejiang University(浙江大学) Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Hunan Institute of Advanced Technology(湖南先进技术研究院) Deakin University(迪肯大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出Vera框架,通过文献驱动的风险发现、组合生成可执行安全用例和自适应执行与证据验证三阶段流水线,实现端到端自动化安全测试,在四个生产级智能体框架上发现严重漏洞,平均攻击成功率93.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05290 2026-07-07 cs.CV 新提交 87%

ChatImage: Navigating Long-Form LLM Answers through Interactive Images

ChatImage:通过交互式图像导航大语言模型的长文本回答

Wencan Jiang, Jiangning Zhang, Yong Liu

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对LLM长文本答案难以细粒度浏览的问题,ChatImage将其转为带点击热点的交互图像,支持局部查询,提升内容与交互区域的一致性,还开源实现并发布多格式评测基准。

Comments Project:https://wencanjiang.github.io/ChatImage

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08242 2026-07-07 cs.HC 版本更新 87%

Bringing Everyone to the Table: An Experimental Study of LLM-Facilitated Group Decision Making

让每个人都参与进来:关于大语言模型辅助群体决策的实验研究

Mohammed Alsobay, David M. Rothschild, Jake M. Hofman, Daniel G. Goldstein

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究大语言模型辅助群体决策,通过随机实验,比较无辅助、一次性信息共享提示、人类辅助和大语言模型辅助四种条件下完成隐藏档案任务的情况,发现大语言模型辅助能增加信息共享,且成本有限,还开源数据和平台。

Comments To appear at ACM CSCW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03162 2026-07-07 cs.AI cs.HC 新提交 86%

APeB: Benchmarking Personalization Ability of Large Language Model Agents

APeB:大型语言模型智能体个性化能力基准测试

Garry Yang, Zizhe Chen, Xinru Chen, Yongqiang Chen, Jianxiang Wang, Deyu Zou, Linyi Ding, Jialiang Wu, Yunzhong He, Yu Gong, James Cheng, Huaixiao Tou

机构 * The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 研究大型语言模型智能体在处理原始、未明确查询时的个性化问题,通过引入个性化产品搜索测试平台构建基准测试,评估发现模型处理明确查询较好,但早期查询有困难,简单方法能提升性能。

Comments NA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11098 2026-07-07 cs.SD cs.CL 版本更新 86%

VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents

VCB Bench:用于音频基础大语言模型对话代理的评估基准

Jiliang Hu, Wenfu Wang, Zuchao Li, Chenxing Li, Yiyang Zhao, Hanzhao Li, Liqiang Zhang, Meng Yu, Dong Yu

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Tencent AI Lab(腾讯AI实验室)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 针对现有音频语言模型基准局限,提出VCB Bench,基于真实人类语音构建,从指令跟随、知识理解、鲁棒性三个角度评估,揭示性能差距并指明改进方向,提供评估框架。

Comments 25 pages, 9 figures, accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02950 2026-07-07 cs.CL cs.AI cs.HC 版本更新 86%

Structured Prompting and Automated Evaluation in Fixed Synthetic Japanese-Language Counseling Dialogues

固定合成日语咨询对话中的结构化提示与自动评估

Keita Kiuchi, Yoshikazu Fujimoto, Hideyuki Goto, Tomonori Hosokawa, Makoto Nishimura, Yosuke Sato, Izumi Sezai, Tomohiro Inoue

机构 * Japan National Institute of Occupational Safety and Health(日本国立职业安全卫生研究所) Kaze To Taiyo(凯泽・太阳) Saga Occupational Health Association(Saga职业健康协会) Department of Pharmacy, Zikei Hospital/Zikei Institute of Psychiatry(药剂科,Zikei医院/Zikei精神医学研究所) Department of Medical Welfare, Suzuka University of Medical Science(医疗福祉科, Suzuka医科大学) Graduate School of Human Sciences, Ritsumeikan University(人类科学研究生院,立命馆大学) Faculty of Nursing, National Defense Medical College(护理学部,国家防卫医疗大学) Support Center for Students with Disabilities, Aoyama Gakuin University(残疾学生支持中心,上智大学)

专题命中 评测与基准 :prompting(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究通过人工智能生成的18份固定日语咨询对话记录,对比GPT - minimal、GPT - SMDP和Claude - SMDP三种情况,咨询专家与新的语言模型分别评级,发现SMDP对话在多方面获更高专家评级,语言模型评级可重复但偏宽松。

Comments 59 pages, 2 figures, 30 tables; supplemental material included; data and code at https://doi.org/10.5281/zenodo.21182321; preregistration at https://doi.org/10.17605/OSF.IO/VU286

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06774 2026-07-07 cs.SE 版本更新 86%

OpenCoderRank: Personalized Technical Assessments with Generative AI

OpenCoderRank: 基于生成式AI的个性化技术评估

Hridoy Sankar Dutta, Sana Ansari, Swati Kumari, Shounak Ravi Bhalerao

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 OpenCoderRank是一种轻量级自托管平台,通过模拟真实世界限时技术评估,为资源受限环境提供定制化评估解决方案,结合BERTScore和LLM评估方法验证其有效性。

Comments Accepted to SynthIR Workshop (SIGIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04329 2026-07-07 cs.AI 新提交 85%

HAS-Bench: Evaluating LLM-Based Human-Agent Systems under Configurable Human Participation

HAS-Bench:在可配置人类参与下评估基于大语言模型的人机系统

Yaozu Wu, Wei-Chieh Huang, Jizhou Guo, Dongyuan Li, Renhe Jiang, Henry Peng Zou, Chunyu Miao, Shanghao Li, Weizhi Zhang, WeiWei Ye, Yankai Chen, Meng Zhang, Xue Liu, Philip S. Yu

机构 * The University of Tokyo(东京大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) MBZUAI McGill University(麦吉尔大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 介绍基于图的HAS-Framework框架,在此基础上HAS-Bench在多方面可配置人类参与下评估人机系统,测量任务结果与协作行为,实验表明人类参与可提升任务完成等,但收益取决于参与方式等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04072 2026-07-07 cs.SE cs.AI quant-ph 新提交 85%

Benchmarking API Drift in LLM-Generated Quantum Code Across Successive SDK Versions

跨连续软件开发工具包版本对大语言模型生成的量子代码中的 API 漂移进行基准测试

Mohammad Arif Rasyidi, Syahirul Faiz

机构 * Department of Computer Science(计算机科学系) Khalifa University(卡利法大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型生成的量子代码能否可靠适配特定 SDK 版本(API 漂移问题),引入量子 API 漂移基准,以 Qiskit 为例评估 17 个模型,揭示版本对齐是量子代码生成评估新维度及 API 漂移恢复情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17331 2026-07-07 cs.HC cs.AI 版本更新 85%

Exploring Context-aware and LLM-driven Locomotion for Immersive Virtual Reality

探索用于沉浸式虚拟现实的上下文感知和大语言模型驱动的移动

Suleyman Ozdel, Kadir Burak Buldu, Enkelejda Kasneci, Efe Bozkir

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Human-Centered Technologies for Learning(以人为本的学习技术)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究提出由大语言模型驱动的移动技术,让用户用自然语言在虚拟环境中导航。通过评估三种移动方法,结合眼动追踪数据分析和标准化问卷,发现该方法有潜力成为可行的免手持替代方案,能促进虚拟空间免手持移动。

Comments 28 pages. To appear in the Proceedings of the ACM on Human-Computer Interaction (PACM HCI), Vol. 10, No. 5; presented at the 28th ACM International Conference on Mobile Human-Computer Interaction (MobileHCI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏