arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1309 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1309 篇

2603.02792 2026-07-21 cs.LG cs.NE 版本更新 86%

From Heuristic Selection to Automated Algorithm Design: LLMs Benefit from Strong Priors

从启发式选择到自动化算法设计:LLMs受益于强先验

Qi Huang, Furong Ye, Ananta Shahane, Thomas Bäck, Niki van Stein

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出利用基准算法引导LLM优化,提升黑箱优化在pbo和bbob基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14590 2026-07-09 cs.LG 版本更新 86%

Counterfactual Modeling with Fine-Tuned LLMs for Health Intervention Design and Sensor Data Augmentation

基于微调大语言模型的反事实建模用于健康干预设计与传感器数据增强

Shovito Barua Soumma, Asiful Arefeen, Stephanie M. Carpenter, Melanie Hingle, Hassan Ghasemzadeh

机构 * College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院) School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) School of Nutritional Sciences and Wellness, University of Arizona(亚利桑那大学营养科学与健康学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究利用微调后的大型语言模型生成高质量反事实解释,用于健康干预设计和传感器数据增强,实验表明LLM生成的反事实能有效提升模型性能,具有临床应用价值。

Comments IEEE Open Journal of Engineering in Medicine and Biology (Volume: 7), Date of Publication: 28 May 2026. Page(s): 232-240

Journal ref IEEE Open Journal of Engineering in Medicine and Biology (Volume: 7), Date of Publication: 28 May 2026. Page(s): 232-240; Electronic ISSN: 2644-1276

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05088 2026-07-09 cs.AI 版本更新 86%

AI Chatbot Suicide Risk Detection and Response: Human Validation Study of the Open-Source VERA-MH Safety Evaluation

人工智能聊天机器人自杀风险检测与应对:开源VERA-MH安全评估的人工验证研究

Kate H. Bentley, Luca Belli, Adam M. Chekroud, Emily J. Ward, Emily R. Dworkin, Emily Van Ark, Kelly M. Johnston, Will Alexander, Millard Brown, Matt Hawrilenko

机构 * Spring Health Harvard Medical School(哈佛医学院) UC Berkeley(加州大学伯克利分校) Yale University(耶鲁大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对人工智能聊天机器人用于心理支持时的安全性评估问题,以VERA-MH为基准,模拟用户与聊天机器人对话,通过持牌临床医生和基于LLM的评估器评级,验证了VERA-MH在检测自杀风险方面的可靠性,为后续研究指明方向。

Journal ref JMIR AI. 2026;5

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23826 2026-07-08 cs.CV cs.CL 版本更新 86%

Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval

将查询分解为工具调用以进行长视频关键帧检索

Michal Shlapentokh-Rothman, Prachi Garg, Yu-Xiong Wang, Derek Hoiem

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ToolMerge方法,通过LLM规划器将查询分解为工具调用并使用布尔运算符合并排名,实现长视频关键帧检索,在字幕检索任务上优于其他方法5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11098 2026-07-07 cs.SD cs.CL 版本更新 86%

VCB Bench: An Evaluation Benchmark for Audio-Grounded Large Language Model Conversational Agents

VCB Bench:用于音频基础大语言模型对话代理的评估基准

Jiliang Hu, Wenfu Wang, Zuchao Li, Chenxing Li, Yiyang Zhao, Hanzhao Li, Liqiang Zhang, Meng Yu, Dong Yu

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Tencent AI Lab(腾讯AI实验室)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 针对现有音频语言模型基准局限,提出VCB Bench,基于真实人类语音构建,从指令跟随、知识理解、鲁棒性三个角度评估,揭示性能差距并指明改进方向,提供评估框架。

Comments 25 pages, 9 figures, accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.05201 2026-06-29 cs.AI cs.HC econ.GN q-fin.EC 版本更新 86%

"Generate" the Future of Work through AI: Empirical Evidence from Online Labor Markets

通过AI“生成”工作的未来:来自在线劳动力市场的实证证据

Jin Liu, Xingchen Xu, Xi Nan, Yongjun Li, Yong Tan

机构 * School of Management, University of Science and Technology of China(中国科学技术大学管理学院) Michael G. Foster School of Business, University of Washington(华盛顿大学迈克尔·G·福斯特商学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 利用在线平台数据,发现LLM生成式AI导致与核心功能匹配的子市场需求和供给下降,但供给减少较小,加剧竞争,尤其在编程密集型领域,因ChatGPT降低编程门槛促使高技能自由职业者转入。

Comments 102 pages, 17 figures, 39 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07955 2026-06-23 cs.CL 版本更新 86%

Expert Preference-based Evaluation of Automated Related Work Generation

基于专家偏好的自动相关工作生成评估

Furkan Şahinuç, Subhabrata Dutta, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab) Department of Computer Science and Hessian Center for AI (hessian.AI) Technical University of Darmstadt(乌普萨拉知识处理实验室(UKP实验室)计算机科学系海斯赛人工智能中心(hessian.AI)达姆施塔特技术大学) Konrad Zuse School of Excellence in Learning and Intelligent Systems (ELIZA)(克诺尔兹塞学校卓越学习和智能系统(ELIZA))

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出GREP多轮评估框架,结合经典标准与专家偏好,通过细粒度分解和对比示例提升LLM评估相关工作质量的能力,与人类专家评估高度相关。

Comments Project page: https://ukplab.github.io/arxiv2025-expert-eval-rw/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05162 2026-06-23 cs.CL 版本更新 86%

Mind the Gap... or Not? How Translation Errors and Evaluation Details Skew Multilingual Results

注意差距...还是不注意?翻译错误和评估细节如何扭曲多语言结果

Jan-Thorsten Peter, David Vilar, Tobias Domhan, Dan Malkin, Markus Freitag

机构 * Google(谷歌)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文以数学领域为例,研究LLM在多语言上的性能差距,发现数据翻译错误和答案提取不一致导致虚假差距,提出半自动质量保证方法和建议,修正后差距基本消失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16941 2026-06-19 eess.AS cs.CL cs.SD 版本更新 86%

The Voice Behind the Words: Quantifying Intersectional Bias in SpeechLLMs

言语背后的声音:量化语音大语言模型中的交叉偏见

Shree Harsha Bokkahalli Satish, Christoph Minixhofer, Maria Teleki, James Caverlee, Ondřej Klejch, Peter Bell, Gustav Eje Henter, Éva Székely

机构 * 1 Department of Speech, Music Hearing, KTH Royal Institute of Technology, Sweden 2 Centre for Speech Technology Research, University of Edinburgh, UK 3 Texas A\&M University, USA

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过2880次受控交互,评估三种语音大语言模型在六种英语口音和两种性别呈现中的口音与性别交叉偏见,发现东欧口音(尤其女性)获得更低有用性评分,且人类评估者比LLM评判更敏感。

Comments 5 pages, 3 figures, 1 table, Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01359 2026-06-17 cs.CR cs.AI 版本更新 86%

Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks

破解代码:通过系统性越狱攻击对AI代码代理进行安全评估

Shoumik Saha, Jifan Chen, Sam Mayers, Sanjay Krishna Gouda, Zijian Wang, Varun Kumar

机构 * University of Maryland – College Park(马里兰大学-College Park) AWS AI Labs(AWS人工智能实验室) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出JAWS-Bench基准测试,通过三级工作区评估代码LLM代理的越狱风险,发现代理化使攻击成功率提升1.6倍,并揭示可执行攻击代码的高比例。

Comments 22 pages, 18 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05859 2026-06-16 cs.AI 版本更新 86%

When Do We Need LLMs? A Diagnostic for Language-Driven Bandits

何时需要大语言模型?语言驱动型老虎机的诊断方法

Uljad Berdica, Fernando Acero, Anton Ipsen, Parisa Zehtabi, Michael Cashmore, Manuela Veloso

机构 * University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出LLMP-UCB算法从LLM中获取不确定性估计,实验表明轻量数值老虎机在文本嵌入上匹配或超越LLM方案且成本更低,并给出基于臂嵌入的几何诊断指导何时使用LLM。

Comments The Reinforcement Learning Conference, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14368 2026-06-16 cs.CR cs.CL 版本更新 86%

From ASR to ASP: Evaluating Prompt Attack Vulnerabilities Against Open-Source LLMs

从ASR到ASP:评估针对开源大语言模型的提示攻击漏洞

Jiawen Wang, Pritha Gupta, Ivan Habernal, Eyke Hüllermeier, Xiaoxue Gao, Nancy F. Chen

机构 * LMU Munich(慕尼黑莱茵恩大学) RUB Bochum(波恩鲁姆大学) MCML A*STAR(新加坡科技研究局)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出攻击成功概率(ASP)指标,评估14个开源和3个闭源LLM对提示注入攻击的脆弱性,发现催眠攻击可达约90% ASP,忽略前缀攻击可突破所有开源模型。

Comments 8 pages, 2 figures, EMNLP 2026 under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22638 2026-06-11 cs.AI 版本更新 86%

MobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility Scenarios

MobilityBench:用于评估真实世界移动场景中路径规划智能体的基准

Zhiheng Song, Jingshuai Zhang, Chuan Qin, Chao Wang, Chao Chen, Longfei Xu, Kaikui Liu, Xiangxiang Chu, Hengshu Zhu

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) AMAP, Alibaba Group(阿里集团AMAP) Alibaba Group(阿里集团)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MobilityBench基准,通过确定性API重放沙箱和多维评估协议,系统评估基于LLM的路径规划智能体,发现现有模型在偏好约束路径规划上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16061 2026-06-09 stat.ML cs.LG econ.EM stat.ME 版本更新 86%

Partial Identification under Missing Data Using Weak Shadow Variables from Pretrained Models

利用预训练模型中的弱影子变量在缺失数据下的部分识别

Hongyu Chen, David Simchi-Levi, Ruoxuan Xiong

机构 * Massachusetts Institute of Technology, Cambridge, MA 02139(麻省理工学院) Emory University, Atlanta, GA 30322(埃默里大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对缺失非随机(MNAR)导致的估计偏差,提出部分识别框架,通过线性规划结合预训练模型(如LLM)的预测作为弱影子变量收紧边界,并设计集合扩张估计器保证覆盖,实验显示识别区间缩小75-83%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17948 2026-06-08 cs.CR cs.AI cs.MA 版本更新 86%

RAVEN: Retrieval-Augmented Vulnerability Exploration Network for Memory Corruption Analysis in User Code and Binary Programs

RAVEN: 用于用户代码和二进制程序中内存损坏分析的检索增强漏洞探索网络

Parteek Jamwal, Minghao Shao, Boyuan Chen, Achyuta Muthuvelan, Asini Subanya, Boubacar Ballo, Kashish Satija, Mariam Shafey, Mohamed Mahmoud, Moncif Dahaji Bouffi, Pasindu Wickramasinghe, Siyona Goel, Yaakulya Sabbani, Hakim Hacid, Mthandazo Ndhlovu, Eleanna Kafeza, Sanjay Rawat, Muhammad Shafique

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RAVEN框架,结合LLM代理与检索增强生成,自动生成遵循Google Project Zero模板的漏洞分析报告,在105个样本上平均质量得分54.21%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02621 2026-08-12 cs.CL cs.LG 版本更新 86%

Reinforcement Learning-based Semi-supervised Knowledge Distillation with LLM-as-a-Judge

基于强化学习的知识蒸馏与大语言模型作为评判者

Yiyang Shen, Lifu Tu, Weiran Wang

机构 * University of Iowa(爱荷华大学)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种基于强化学习的知识蒸馏方法,利用大语言模型作为评判者在无标签数据上生成奖励,实现无需真实标签的蒸馏,提升数学推理基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18695 2026-08-11 cs.CV cs.AI cs.LG eess.IV 版本更新 86%

Attributes Should Come from Images, Not Class Names: Distribution-Conditioned Attribute Selection for Vision-Language Models

属性应来自图像,而非类名:视觉语言模型的分布条件属性选择

Gautam Rajendrakumar Gare, Jia Shi, Zhiqiu Lin, Deepak Pathak, John Galeotti, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型可解释零样本分类,指出基于类名的描述符视觉证据不足。提出从目标图像集选属性的方法,该方法提升了准确率,性能优于CoOp,用时短,所选属性还能描述数据分布,是一种有效的分布条件属性选择策略。

Comments Accepted at the PFATCV Workshop, ECCV 2026. Project page: https://ggare-cmu.github.io/AttributeSelect/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28545 2026-08-06 cs.CL cs.AI cs.SE 版本更新 86%

ORCA-bench: How Ready Are Language Model Agents for Oncall?

ORCA-bench:语言模型智能体的值班待命准备程度如何?

Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz Dwivedi

机构 * Cornell Tech(康奈尔科技学院) Traversal Columbia University(哥伦比亚大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究推出ORCA-bench基准,评估编码智能体在生产级值班待命场景下的根本原因分析能力,发现现有前沿智能体表现不佳,凸显其距离安全胜任生产可靠性工作仍有较大差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01666 2026-08-05 cs.CL cs.AI 版本更新 86%

Style Wins, Substance Loses: A Diagnosis of LLM-as-Judge in Idea Generation

风格取胜,实质落败:对作为创意生成评判者的大语言模型(LLM)的诊断

Fengxian Ji, Yuke Li, Jingpu Yang, Juanfan Wu, Fan Zhang, Zhexuan Cui, Yu Xie, Min Peng, Qianqian Xie, Xiuying Chen, Zhuohan Xie

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本研究针对大语言模型作为创意评判者的风格偏差问题,提出SciStyleBench基准及配套的SciStyleExtractor模块,实验验证该模块可有效降低风格偏差、提升实质区分度,为科学创意评估提供了系统性解决方案。

Comments First three authors are co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28128 2026-08-04 cs.CL cs.AI cs.CY 版本更新 86%

Rethinking LLM-Judged Helpfulness as a Pedagogy Signal: A Pre-Registered Audit Across Tutor Models

将大语言模型评判的有用性重思为教学信号:一项针对导师模型的预注册审计

Shuyi Fan, Boyuan Deng, Mengyu Xu, Jiale Liu, Hongyang Zhang, Qiaoxin Yang, Chongyang Gao

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 本研究通过预注册审计发现,通用LLM有用性评分标准无法作为可靠教学信号,其排序具有评判者依赖性,而教学评分标准可有效区分策略,故导师评估应采用教学针对性评分标准与确定性过程测量。

Comments 24 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02950 2026-07-07 cs.CL cs.AI cs.HC 版本更新 86%

Structured Prompting and Automated Evaluation in Fixed Synthetic Japanese-Language Counseling Dialogues

固定合成日语咨询对话中的结构化提示与自动评估

Keita Kiuchi, Yoshikazu Fujimoto, Hideyuki Goto, Tomonori Hosokawa, Makoto Nishimura, Yosuke Sato, Izumi Sezai, Tomohiro Inoue

机构 * Japan National Institute of Occupational Safety and Health(日本国立职业安全卫生研究所) Kaze To Taiyo(凯泽・太阳) Saga Occupational Health Association(Saga职业健康协会) Department of Pharmacy, Zikei Hospital/Zikei Institute of Psychiatry(药剂科,Zikei医院/Zikei精神医学研究所) Department of Medical Welfare, Suzuka University of Medical Science(医疗福祉科, Suzuka医科大学) Graduate School of Human Sciences, Ritsumeikan University(人类科学研究生院,立命馆大学) Faculty of Nursing, National Defense Medical College(护理学部,国家防卫医疗大学) Support Center for Students with Disabilities, Aoyama Gakuin University(残疾学生支持中心,上智大学)

专题命中 评测与基准 :prompting(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究通过人工智能生成的18份固定日语咨询对话记录,对比GPT - minimal、GPT - SMDP和Claude - SMDP三种情况,咨询专家与新的语言模型分别评级,发现SMDP对话在多方面获更高专家评级,语言模型评级可重复但偏宽松。

Comments 59 pages, 2 figures, 30 tables; supplemental material included; data and code at https://doi.org/10.5281/zenodo.21182321; preregistration at https://doi.org/10.17605/OSF.IO/VU286

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09552 2026-06-08 cs.IR cs.AI cs.CL 版本更新 86%

MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval

MCERF:通过增强检索推进工程文档的多模态大语言模型评估

Kiarash Naghavi Khanghah, Hoang Anh Nguyen, Anna C. Doris, Amir Mohammad Vahedi, Daniele Grandi, Faez Ahmed, Hongyi Xu

机构 * School of Mechanical, Aerospace, and Manufacturing Engineering, University of Connecticut, Storrs, CT 06269(机械、航空航天与制造工程学院,康涅狄格大学,斯托尔斯,CT 06269) Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA(机械工程系,麻省理工学院,剑桥,MA 02139,美国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出MCERF框架,结合多模态检索器ColPali与大语言模型推理,通过混合查找、视觉文本融合、高推理和自一致性决策等策略,在DesignQA基准上实现平均准确率相对提升41.1%,无需完整规则书摄入即可处理工程文档中的多模态问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30777 2026-08-14 cs.SE 版本更新 86%

What Breaks When LLMs Code? Characterizing Operational Safety Failures of Agentic Code Assistants

当LLM编码时会出现什么问题?表征自主代码助手的操作安全故障

Alif Al Hasan, Sumon Biswas

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract)

AI总结 通过系统分析文献和GitHub问题,构建了包含33种操作风险类型的多维安全分类法,发现编码代理故障通常严重且主要源于约束违反、破坏性操作、授权绕过和欺骗。

Comments This paper is accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026), Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08417 2026-08-13 cs.CR 版本更新 86%

Attention is All You Need to Defend Against Indirect Prompt Injection Attacks in LLMs

注意力是所有你需要的:用于防御大语言模型中的间接提示注入攻击

Yinan Zhong, Qianhao Miao, Yanjiao Chen, Jiangyi Deng, Yushi Cheng, Wenyuan Xu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Rennervate框架,通过注意力机制在token级别检测并清除IPI攻击,有效提升LLM的安全性。

Comments Accepted by Network and Distributed System Security (NDSS) Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03552 2026-07-24 cs.SI 版本更新 86%

From Risk Perception to Behavior Large Language Models-Based Simulation of Pandemic Prevention Behaviors

从风险认知到行为:基于大语言模型的流行病预防行为模拟

Lujia Bo, Mingxuan Chen, Youduo Chen, Xiaofan Gui, Jiang Bian, Chunyan Wang, Yi Liu

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

AI总结 本文提出基于大语言模型的流行病预防行为模拟框架,通过静态和动态模块预测和更新行为,验证了其在不同数据环境下的有效性,并展示了政策放松期间行为变化的模拟结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06774 2026-07-07 cs.SE 版本更新 86%

OpenCoderRank: Personalized Technical Assessments with Generative AI

OpenCoderRank: 基于生成式AI的个性化技术评估

Hridoy Sankar Dutta, Sana Ansari, Swati Kumari, Shounak Ravi Bhalerao

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 OpenCoderRank是一种轻量级自托管平台,通过模拟真实世界限时技术评估,为资源受限环境提供定制化评估解决方案,结合BERTScore和LLM评估方法验证其有效性。

Comments Accepted to SynthIR Workshop (SIGIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11599 2026-07-03 econ.GN q-fin.EC 版本更新 86%

Can LLMs Credibly Transform the Creation of Panel Data from Diverse Historical Tables?

LLM能否可信地转换来自不同历史表格的面板数据?

Verónica Bäcker-Peral, Vitaly Meursault, Christopher Severen

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 提出基于多模态LLM的管道,以低成本从历史表格中提取面板数据,在车辆登记数据上达到95.4%精确匹配率,成本仅为传统方法的1/50。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14189 2026-06-23 cs.CY 版本更新 86%

AI and the Future of Academic Peer Review

人工智能与学术同行评审的未来

Sebastian Porsdam Mann, Mateo Aboy, Joel Jiehao Seah, Zhicheng Lin, Xufei Luo, Daniel Rodger, Hazem Zohny, Timo Minssen, Julian Savulescu, Brian D. Earp

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文分析同行评审的缺陷,探讨大型语言模型(LLM)如何通过监督辅助提升评审质量、减少偏见,并强调治理选择对AI辅助评审合法性的关键作用。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19218 2026-06-10 cs.SE cs.MA 版本更新 86%

Gecko: A Simulation Environment with Stateful Feedback for Refining Agent Tool Calls

Gecko: 一种具有状态反馈的仿真环境,用于优化智能体工具调用

Zeyu Zhang, Guohao Li, Zhenchang Xing, Alexandros Apostolopoulos, Yu Lin Lee, Liang Zheng

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出Gecko仿真环境,通过规则与LLM结合提供工具名称/参数验证、模式一致响应合成和任务完成判断三类反馈,形成GATS方法,在BFCLv3和τ²-bench上显著提升LLM工具调用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05031 2026-08-14 cs.SE cs.AI 版本更新 85%

LLM-Based Test Oracles: Source-of-Authority Taxonomy -- A Systematic Literature Review

基于大语言模型的测试预言机:权威来源分类法——一项系统文献综述

Ali Hassaan Mughal, Muhammad Bilal

机构 * Independent Researcher, USA(美国独立研究员) Technical University of Munich, Germany(德国技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过系统文献综述,沿权威来源、形式及裁决机制三轴分析相关研究,刻画领域、语言等情况,指出规范衍生权威最常见但仅占约一半研究,还报告了评估及失败情况并提出研究议程。

Comments 21 pages, 10 figures, 11 tables. Systematic literature review of 83 studies, reported under PRISMA 2020. Submitted to IEEE Access. Replication package: https://doi.org/10.5281/zenodo.21194940

详情

展开后加载摘要…

URL PDF HTML 收藏