arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32006 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32006 篇

2607.25375 2026-07-29 cs.CL 新提交 89%

Inspect India Evals: An Open Benchmarking Framework for Evaluating Large Language Models in the Indian Linguistic and Cultural Context

印度评估:一个在印度语言和文化背景下评估大语言模型的开放基准框架

Abhishek Kumar Singh, Shrey Nag, Sachita, Lipi Goel, Rajeshwar Singh Janwar

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 Inspect India Evals是在印度语言文化背景下评估大语言模型的开放框架,基于Inspect AI平台构建,含六个基准。测试五个模型,Sarvam-M 24B和Gemma 2 27B表现最佳,各模型在多语言安全测试中表现一致,DPI安全得分有差异,框架公开可扩展。

Comments 19 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24515 2026-07-29 cs.CL 版本更新 89%

Systematic Analysis of Large Language Models and Transformer-Based Machine Translation for English-Tamil and Tamil-English Across Diverse Datasets

跨不同数据集对英语-泰米尔语和泰米尔语-英语的大语言模型和基于Transformer的机器翻译的系统分析

Sriharshaa S, Sangeetha Sivanesan, Jaya Nirmala S

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 研究针对泰米尔语等低资源语言机器翻译挑战,在多数据集上评估多种模型,用BLEU等指标分析其性能,通过注意力分析增强可解释性,证明上下文提示可实现少样本翻译并与监督方法比较,揭示数据集及领域匹配对模型性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23538 2026-07-28 cs.CL 新提交 89%

Guiding Language Models to Be More Empathetic: Culturally Sensitive Mental Health Advice Generation Through Human-LLM Collaboration

引导语言模型更具同理心:通过人机协作生成具有文化敏感性的心理健康建议

Fatema Tuj Johora Faria, Mukaffi Bin Moin, Md. Mahfuzur Rahman, Khan Md Hasib, Jubayer Al Mahmud, M. F. Mridha

机构 * Ahsanullah University of Science and Technology(阿山努拉科技大学) Bangladesh University of Business and Technology(孟加拉国商业与技术大学) The University of New South Wales(新南威尔士大学) Jashore University of Science and Technology(贾绍尔科技大学) American International University - Bangladesh(孟加拉国美国国际大学)

专题命中 评测与基准 :language model(title,abstract);LLM(title);large language model(abstract);prompting(abstract)

AI总结 研究探索大语言模型在低资源语言中生成同理心心理健康建议的能力,提出角色扮演反思性思维链咨询框架和基于Grok 4的评估框架,通过人机协作及特定策略,提升心理健康建议质量,使其更符合专业咨询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17636 2026-07-28 cs.CL 版本更新 89%

Measuring Negative Campaigning across Languages with Large Language Models: A Study of 18 Million Tweets in 19 Countries

使用大语言模型衡量跨语言的负面竞选活动:对19个国家1800万条推文的研究

Victor Hartman, Petter Törnberg

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 该研究利用大语言模型对19个国家1800万条推文进行分析,评估其用于负面竞选跨语言分类的可行性。通过此方法进行跨国研究,基于战略激励框架得出不同类型政党负面竞选程度不同的结论,为相关研究提供新证据并展示了大语言模型的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20471 2026-07-24 cs.AI 新提交 89%

Benchmarking the Personalization Capabilities of Large Language Models

大型语言模型个性化能力的基准测试

Ashutosh Srivastava, Siddharth Yedlapati, Vinay Aggarwal, Yaman Kumar Singla, Shashwat Dixit, Jitendra Ajmera, Balaji Krishnamurthy

机构 * Adobe Media & Data Science Research(Adobe媒体与数据科学研究)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究大型语言模型个性化能力,将贝叶斯说服框架应用于生成式智能体并实例化到销售场景,发布SDR-Bench语料库,发现个性化存在平台期,通过现场部署验证框架,还公开了SDR-Arena和SDR-Bench以支持相关可重复研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20463 2026-07-24 cs.AI 新提交 89%

ClickGuard: Detecting and Spoiling Clickbait News with Informativeness Measures and Large Language Models

ClickGuard:利用信息性度量和大语言模型检测和揭露标题党新闻

Wojciech Michaluk, Tymoteusz Urban, Mateusz Kubita, Soveatin Kuntur, Anna Wróblewska

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文利用信息性度量和大语言模型开发了名为ClickGuard的浏览器扩展,采用混合机器学习架构,结合Transformer嵌入、语言特征和“诱饵性”分数,基于XGBoost建模,能在用户访问前后预警标题党文章,给出可能性分数并解释,还提供文章剧透。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20410 2026-07-23 cs.CL 新提交 89%

LKValues: Aligning Large Language Models with Sri Lankan Societal Values

LKValues:使大语言模型与斯里兰卡社会价值观保持一致

Nethmi Muthugala, Supryadi, Surangika Ranathunga, Nisansa de Silva, Ruijie Tao, Ovindu Gunatunga, Pengyun Zhu, Shaowei Zhang, Jingting Zheng, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院TJUNLP实验室) School of Mathematical and Computational Sciences, Massey University(梅西大学数学与计算科学学院) Department of Computer Science & Engineering, University of Moratuwa(莫拉图瓦大学计算机科学与工程系) Johns Hopkins University(约翰霍普金斯大学) School of Computing, University of Colombo(科伦坡大学计算机学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 研究针对大语言模型价值对齐存在西方文化偏见问题,以斯里兰卡为例,提出LKValues资源套件,通过调查得出社会价值观,构建语料库和评估基准,经实验发现其能改善模型表现,为低资源国家价值对齐提供可复制流程。

Comments 37 pages, 10 figures, and 15 tables. Includes appendices. Datasets are available at the project repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15517 2026-07-20 cs.CV cs.AI 新提交 89%

SLAPBench: Benchmarking Multimodal Large Language Models for Four-Finger SLAP Fingerprint Verification

SLAPBench:用于四指SLAP指纹验证的多模态大语言模型基准测试

Bibesh Pyakurel, M. G. Sarwar Murshed

机构 * University of Wisconsin–Green Bay(威斯康星大学格林湾分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究四指SLAP指纹验证,介绍SLAPBench基准,评估多个MLLM在不同提示下的表现,发现提示控制崩溃,模型能力控制歧视,建立了特定于SLAP的MLLM基线,揭示了模型在指纹验证中的能力差距和公平性问题。

Comments 19 pages, 6 figures, 2 tables. Includes appendix with supporting figures and per-subgroup fairness detail. Code and data: https://github.com/bibeshpyakurel/SLAPBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14816 2026-07-17 cs.SE cs.AI 新提交 89%

Large Language Models for Code Generation from Multilingual Prompts: A Curated Benchmark and a Study on Code Quality

用于从多语言提示生成代码的大语言模型:一个精心策划的基准测试和对代码质量的研究

Saima Afrin, Alessandro Midolo, Camilo Escobar-Velásquez, Mario Linares-Vásquez, Weiyuan Ding, Bowen Xu, Massimiliano Di Penta, Antonio Mastropaolo

机构 * University of Catania(卡塔尼亚大学) North Carolina State University(北卡罗来纳州立大学) University of Sannio(萨尼奥大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究多语言提示对代码生成的影响,通过460个Python和Java编码任务,将英文提示翻译成多种语言并评估生成代码,发现英文提示非最佳,提示语言影响因编程语言和大语言模型而异,提供多语言基准测试及见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11594 2026-07-14 cs.AI cs.GR 新提交 89%

MAGIC: Transition-Aware Generation of Navigable Multi-Scene Game Worlds with Large Language Models

MAGIC:利用大语言模型生成具有可导航多场景的游戏世界并感知过渡

Tsz Hei Fan, Choi Wing Fung, Yuxuan Wan, Shuqing Li, Michael R. Lyu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究利用大语言模型生成多场景游戏世界时面临的问题,提出MAGIC系统,通过四阶段管道将自然语言提示转化为可运行项目,解决跨场景一致性等问题,在新基准测试中表现出色,生成可执行项目且过渡识别指标优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11459 2026-07-14 eess.SY cs.AI cs.SY 新提交 89%

A Multimodal Dataset for Large Language Model Applications in the Energy Domain

用于能源领域大语言模型应用的多模态数据集

Costas Mylonas, Magda Foti

机构 * UBITECH

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 介绍mAIEnergy多模态数据集,整合文本、图像、时间序列及地理空间等数据,统一为结构化格式并伴有元数据与工作流程,可作能源知识库,遵循FAIR原则,助力能源领域大语言模型应用的研究、建模和决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29088 2026-07-02 cs.SE cs.AI 版本更新 89%

Diff-Based Code Corruption using LLMs for Large-Scale Bugfix Benchmarking

基于LLM的差异代码损坏用于大规模错误修复基准测试

Balázs Szalontai, Ábel Szauter, Balázs Márton, Péter Verebics, Balázs Pintér, Tibor Gregorics

机构 * Eötvös Loránd University(罗兰大学) Faculty of Informatics(信息学学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MegaBugFix,一个包含12,629个由LLM通过差异生成的有缺陷Python程序的大规模基准,用于评估模型错误修复能力,发现现有模型在此基准上表现更差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31614 2026-07-01 eess.SY cs.AI cs.SY 新提交 89%

Automating Cause-Effect Specification with Knowledge Graphs and Large Language Models

利用知识图谱和大语言模型自动化因果规范生成

Javal Vyas, Milapji Singh Gill, Mehmet Mercangöz

机构 * Autonomous Industrial Systems Lab, Imperial College London(帝国理工学院自主工业系统实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 提出一种语义AI框架,结合知识图谱与约束大语言模型,自动生成因果逻辑和操作安全叙述,减少手动工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29366 2026-06-30 math.OC cs.AI 89%

Solver-Verified Formulation Generation and Selection for Multi-Warehouse Inventory Allocation Using Large Language Models

基于求解器验证的多仓库库存分配公式生成与选择——利用大语言模型

Jintao Xu, Yingzheng Ma, Jiong Dong, Yongzhi Qi, Jianshen Zhang, Dongyang Geng, Anni Zhang

机构 * Supply Chain Tech Team Y, JD.com(京东供应链技术团队Y)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 提出ORLA框架,利用大语言模型从自然语言需求自动生成运筹学公式,通过求解器反馈验证并选择最优公式,在京东29个生产批次上实现分配准确率提升4.5个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28683 2026-06-30 cs.AI cs.CY stat.AP stat.ME 89%

Aristotelian Virtue Profiling of LLMs through Ethical Dilemmas

通过伦理困境对LLM进行亚里士多德式美德画像

Ioannis Tzachristas, John Pavlopoulos

机构 * Technical University of Munich(慕尼黑技术大学) Athens University of Economics and Business(雅典经济与商业大学) Archimedes, Athena Research Center(阿提卡研究中心)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出VirtueMap框架,通过七种非致命、非政治、非宗教的伦理困境,让人类或LLM对五种回应排序,基于95%共识的参考排序,使用归一化Borda对齐计算实践智慧、正义、诚实、勇气和节制的美德画像,在九个LLM家族中评估,平均排名一致性达90.3%。

Comments VirtueMap website: https://jtzach.github.io/Aristotle-Virtue-Map

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00835 2026-06-30 cs.CL 89%

Agentic Tool Use in Large Language Models

大语言模型中的代理工具使用

Jinchao Hu, Meizhi Zhong, Kehai Chen, Xuefeng Bai, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文系统梳理了大语言模型中代理工具使用的三种范式,分析了其方法、优缺点及评估现状,旨在解决现有研究碎片化问题,提供更系统的进化视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21787 2026-06-30 cs.SE cs.AI 89%

Assessing the Business Process Modeling Competences of Large Language Models

评估大型语言模型的业务流程建模能力

Chantale Lauer, Peter Pfeiffer, Alexander Rombach, Nijat Mehdiyev

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出BEF4LLM框架,从语法、语用、语义和有效性四个维度评估LLM生成的BPMN模型,发现LLM在语法和语用质量上表现优异,但语义和有效性仍需提升,为未来模型优化提供指导。

Journal ref Information Systems, Vol. 142 (2026), Art. 102761

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10858 2026-06-30 cs.CR cs.AI 89%

Large Language Models for Security Operations Centers: A Comprehensive Survey

面向安全运营中心的大型语言模型:全面综述

Ali Habibzadeh, Farid Feyzi, Reza Ebrahimi Atani

机构 * University of Guilan(吉兰大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文综述了将生成式AI,特别是大型语言模型应用于安全运营中心的工作流程,探讨其能力、挑战及未来方向,为研究人员和运营管理者提供当前状态的全面视角。

Journal ref Journal of Electrical and Computer Engineering, 2026, 3383674 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03180 2026-06-29 cs.CL 89%

BengaliMoralBench: A Benchmark for Auditing Moral Reasoning in Large Language Models within Bengali Language and Culture

BengaliMoralBench:一种用于审计大型语言模型道德推理的基准,针对孟加拉语和文化

Shahriyar Zaman Ridoy, Azmine Toushik Wasi, Koushik Ahamed Tonmoy, Taki Hasan Rafi, Dong-Kyu Chae

机构 * North South University(北南大学) Computational Intelligence and Operations Laboratory(计算智能与运营实验室) Hanyang University(翰林大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出BengaliMoralBench,一个针对孟加拉语和文化背景的道德推理评估基准,涵盖五个道德领域,通过三种伦理框架进行标注,评估不同模型的性能差异及文化适应性问题。

Comments Accepted at ACM FAccT 2026

Journal ref ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13182 2026-06-23 cs.SE cs.AI 版本更新 89%

From Empirical Evaluation to Context-Aware Enhancement: Repairing Regression Errors with LLMs

从经验评估到上下文感知增强:使用LLM修复回归错误

Anh Ho, Thanh Le-Cong, Bach Le, Christine Rizkallah

机构 * The University of Melbourne(墨尔本大学) Singapore University of Technology and Design(新加坡科技与设计大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过构建回归错误基准RegressionBug4APR,评估传统APR和基于LLM的APR方法,发现上下文感知增强(引入错误诱导变更信息)使LLM-based APR修复成功率提升1.6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18108 2026-06-17 astro-ph.IM cs.AI 新提交 89%

Querying an astronomical database using large language models: the ALeRCE text-to-SQL system

使用大语言模型查询天文数据库:ALeRCE文本到SQL系统

P. A. Estevez, J. Espejo-Moreira, S. Sanfeliu-Alvarez, F. Forster, A. M. Munoz Arancibia, G. Cabrera-Vives, F. E. Bauer, A. Bayo, M. Catelan, R. Dastidar, L. Hernandez-Garcia, J. A. Intriago, G. Pignata

机构 * Department of Electrical Engineering, University of Chile, Av. Tupper 2007, Santiago, Chile Millennium Institute of Astrophysics (MAS), Nuncio Monseñor Sótero Sanz 100, Providencia, Santiago, Chile Data Artificial Intelligence Initiative (ID\&IA), Universidad de Chile Center for Mathematical Modeling, Universidad de Chile, Beauchef 851, North building, 7th floor, Santiago 8320000, Chile Departamento de Astronom\'ia, Universidad de Chile, Casilla 36D, Santiago, Chile Department of Computer Science, Universidad de Concepción, Edmundo Larenas 219, Concepción, Chile Center for Data Artificial Intelligence, Universidad de Concepción, Edmundo Larenas 310, Concepción, Chile Heidelberg Institute for Theoretical Studies, Heidelberg, Baden-Württemberg, Germany Instituto de Alta Investigación, Universidad de Tarapacá, Casilla 7D, Arica, 1010000, Chile European Southern Observatory, Karl-Schwarzschild-Strasse 2, 85748 Garching bei München, Germany Instituto de Astrofísica, Facultad de Física, Pontificia Universidad Católica de Chile, Casilla 306, Santiago 22, Chile Centro de Astroingeniería, Pontificia Universidad Católica de Chile, Av. Vicuña Mackenna 4860, 7820436 Macul, Santiago, Chile Instituto de Estudios Astrof\'isicos, Facultad de Ingenier\'ia y Ciencias, Universidad Diego Portales, Av. Ej\'ercito Libertador 441, Santiago, Chile Centro Interdisciplinario de Data Science, Facultad de Ingenier\'ia y Ciencias, Universidad Diego Portales, Av. Ej\'ercito Libertador 441, Santiago, Chile

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 提出基于大语言模型的文本到SQL系统,通过上下文学习和逐步生成框架(模式链接、查询分类、提示分解、自纠正)实现自然语言查询天文数据库,在ALeRCE数据集上评估13个模型,Claude Opus 4.6等表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15762 2026-06-16 cs.CR cs.AI cs.SE 新提交 89%

Snyk VulnBench JS 1.0: Can LLMs Find the Same Bugs Twice?

Snyk VulnBench JS 1.0: LLM 能否两次发现相同的漏洞?

Liran Tal, Johannes Kloos, Arsenii Rudich, Stephen Thoemmes, Manoj Nair

机构 * Snyk

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过300次重复漏洞扫描实验,评估LLM在相同JavaScript代码上安全审查的可重复性,发现引用匹配结果稳定但额外报告波动大,建议结合确定性SAST使用。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06015 2026-06-16 cs.CL 版本更新 89%

A Systematic Evaluation of Large Language Models for PTSD Severity Estimation: The Role of Contextual Knowledge and Modeling Strategies

大型语言模型在PTSD严重程度评估中的系统评估:上下文知识与建模策略的作用

Panagiotis Kaliosis, Adithya V Ganesan, Oscar N. E. Kjell, Whitney Ringwald, Scott Feltman, Melissa A. Carr, Dimitris Samaras, Camilo Ruggero, Benjamin J. Luft, Roman Kotov, Andrew H. Schwartz

机构 * Department of Computer Science(计算机科学系) Stony Brook University(石溪大学) College of Connected Computing(连接计算学院) Vanderbilt University(范德比大学) Lund University(隆德大学) University of Minnesota(明尼苏达大学) Stony Brook World Trade Center Wellness Program(石溪世界贸易中心健康计划) Renaissance School of Medicine at Stony Brook University(石溪大学复兴医学院) University of Texas at Dallas(德克萨斯大学达拉斯分校) Department of Psychiatry(精神病学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究系统评估了11种大型语言模型在PTSD严重程度评估中的表现,发现提供详细定义和上下文可提升准确性,增加推理努力可改善估计,并验证了集成策略的有效性。

Comments 24 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01727 2026-06-12 cs.AI cs.CY 89%

Are LLMs More Skeptical of Entertainment News?

LLM是否对娱乐新闻更持怀疑态度?

Huiqian Lai

机构 * Huiqian Lai(赖慧茜)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究零样本LLM在新闻可信度评估中是否对娱乐新闻有更高的误判率,发现模型间存在差异,并通过风格交换和提示缓解实验探讨原因。

Comments Accepted at the 2nd Workshop on Misinformation Detection in the Era of LLMs (MisD), co-located with ICWSM 2026, May 26, 2026, Los Angeles, CA, USA

Journal ref Proceedings of the ICWSM Workshops, MisD 2026: The 2nd Workshop on Misinformation Detection in the Era of LLMs, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12821 2026-06-12 cs.AI cs.ET 新提交 89%

GeoNatureAgent Benchmark: Benchmarking LLM Agents for Environmental Geospatial Analysis Across Frontier and Open-Weight Foundation Models

GeoNatureAgent Benchmark:面向前沿与开源基础模型的环境地理空间分析LLM智能体基准测试

Gabriel Diaz-Ireland, Diego Prieto-Herráez, Mario García Peces, Javier Velázquez, Devika Jain

机构 * Universidad Católica de Ávila (UCAV)(阿维拉天主教大学) Johns Hopkins University(约翰霍普金斯大学) Independent Researcher(独立研究者) Center for Geographic Analysis, Harvard University(哈佛大学地理分析中心)

专题命中 评测与基准 :LLM(title,title_cn);foundation model(title);分类 cs.AI

AI总结 提出首个通过结构化工具调用真实API评估环境分析智能体的基准,包含93个任务,发现Claude Sonnet 4领先,但开源模型在成本效益上占优,且比较任务普遍未解决。

Comments Preprint. 10 pages, 8 figures. Submitted to ACM SIGSPATIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09351 2026-06-09 cs.CL stat.ME 新提交 89%

In-Context Learning for the Imputation of Public Opinion Data with Large Language Models

基于上下文学习的民意数据插补方法

Tobias Holtdirk, Georg Ahnert, Joseph W Sakshaug, Anna-Carolina Haensch

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Mannheim(曼海姆大学) Institute for Employment Research (IAB)(就业研究所(IAB)) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 提出通过上下文学习(ICL)插补调查缺失数据,在150个意见变量上评估,相比MICE PMM方法,在所有缺失机制下绝对误差更低,尤其非随机缺失时优势显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07541 2026-06-09 cs.HC cs.AI cs.CV cs.CY cs.MM 新提交 89%

Multimodal Large Language Models as Synthetic Participants in Video-Based Studies: An Evaluation

多模态大语言模型作为视频研究中的合成参与者:一项评估

Prabal Shrestha, Bohan Jiang, Haoning Xue, Huan Liu, Xinyi Zhou

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本研究评估多模态大语言模型在视频感知任务中模拟人类主观评分的表现,发现模型存在偏差且与人类一致性有限。

Comments Accepted to SocialLLM @ ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06099 2026-06-05 cs.AI 89%

CogManip: Benchmarking Manipulative Behavior in Multi-Turn Interactions with Large Language Model

CogManip: 在大语言模型多轮交互中操控行为的基准测试

Zeyang Yue, Chenfei Yan, Feifei Zhao, Haibo Tong, Mengwen Xu, Xiaozhen Wang, Erliang Lin, Yi Zeng

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) BrainCog AI Lab, CASIA(CASIA脑认知人工智能实验室) Gaoling School of AI, Renmin University of China(中国人民大学 Gallagher人工智能学院) Beijing-AISI(北京人工智能研究所) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 提出CogManip基准,通过1000个多轮交互场景评估15种操控策略风险,发现前沿模型存在显著风险异质性,并揭示提示工程防御的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05614 2026-06-05 cs.AI 89%

Safety Paradox: How Enhanced Safety Awareness Leaves LLMs Vulnerable to Posterior Attack

安全悖论:增强的安全意识如何使LLM易受后验攻击

Long P. Hoang, Hai V. Le, Shaoyang Xu, Wei Lu, Wenxuan Zhang

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文揭示安全对齐增强的LLM因内部安全评估能力而面临后验攻击漏洞,通过实验和理论分析证明安全判断能力越强越易被利用,并提出因果干预验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05843 2026-06-05 cs.CL 89%

OdysseyArena: Benchmarking Large Language Models For Long-Horizon, Active and Inductive Interactions

OdysseyArena: 为长视界、主动和归纳交互评估大型语言模型

Hang Yan, Fangzhi Xu, Qiushi Sun, Jinyang Wu, Zixian Huang, Muye Huang, Jingyang Gong, Zichen Ding, Kanzhi Cheng, Yian Wang, Xinyu Che, Zeyi Sun, Jian Zhang, Zhangyue Yin, Haoran Luo, Ben Kao, Qika Lin

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本文提出OdysseyArena,通过长视界、主动和归纳交互评估大型语言模型,提供120个任务测量归纳效率和长视界发现,并通过OdysseyArena-Challenge测试极端交互视界下的模型稳定性,揭示前沿模型在复杂环境中的归纳能力瓶颈。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏