arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-05 至 2026-05-05 共收录 57 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 57 篇

2605.01461 2026-05-05 cs.RO cs.MA 95%

LLM-Foraging: Large Language Models for Decentralized Swarm Robot Foraging

LLM-Foraging:基于大规模语言模型的去中心化蚁群觅食

Peihan Li, Joanna Gutierrez, Fabian Hernandez, Qi Lu, Lifeng Zhou

机构 * Drexel University(德雷塞尔大学) The University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract)

AI总结 本文提出LLM-Foraging,通过在CPFA状态机中加入LLM战术决策器,使蚁群觅食控制器在无训练状态下适应不同配置,优于传统GA优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01100 2026-05-05 cs.AI 92%

A Knowledge-Driven LLM-Based Decision-Support System for Explainable Defect Analysis and Mitigation Guidance in Laser Powder Bed Fusion

基于知识的LLM决策支持系统:用于激光粉末床融合的可解释缺陷分析与缓解指导

Basit Mahmud Shahriar, Md Habibor Rahman

机构 * Department of Mechanical Engineering, University of Massachusetts Dartmouth(达特茅斯大学机械工程系)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出一种整合结构化缺陷知识与LLM推理的知识驱动决策支持系统,用于制造业中激光粉末床融合的可解释缺陷诊断与缓解指导。系统基于包含27种已知缺陷类型的知识库,支持模糊自然语言查询、文献支持的缺陷解释及基于编码工艺知识的缺陷原因和缓解策略指导。

Comments 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23452 2026-05-05 cs.CL cs.DL 91%

CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era

CiteAudit:你引用了它,但你读过它吗?LLM时代验证科学参考的基准

Kaiwen Shi, Weixiang Sun, Zheyuan Zhang, Lichao Sun, Nitesh V. Chawla, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) Lehigh University(莱恩大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CiteAudit基准,用于验证LLM时代科学引用的真实性,通过多代理验证流程和大规模人工验证数据集,实现优于现有模型的引用验证性能。

Comments We have further refined the benchmark construction and reference verification pipeline to improve clarity and consistency. The revised version includes updated results and additional details to better align the evaluation with the intended setup. These changes provide a more precise presentation of the experimental findings, with conclusions and contributions remaining unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01451 2026-05-05 cs.CL 90%

Auditing demographic bias in AI-based emergency police dispatch: a cross-lingual evaluation of eleven large language models

对基于AI的紧急警务调度中的种族偏见进行审计:对十一种大型语言模型的跨语言评估

William Guey, Wei Zhang, Pierrick Bougault, Yi Wang, Bertan Ucar, Vitor D. de Moura, José O. Gomes

机构 * Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) School of Social Sciences, Tsinghua University(清华大学社会科学部) Department of Industrial Engineering, Federal University of Rio de Janeiro(里约热内卢联邦大学工业工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文通过跨语言框架评估11种模型,在19800个输出中发现当事件严重性模糊时种族偏见系统性出现,但当操作优先级由通话内容确定时偏见消失。偏见程度因种族轴而异,宗教外观影响最大,性别次之,种族最小。语言间偏见转移不一致,性别偏见在中文中放大,种族偏见在英文中更明显。

Comments 26 pages, 7 figures. Submitted to Humanities and Social Sciences Communications (Nature) collection on Artificial Intelligence and Emerging Technologies in Public Safety. Code and data: https://github.com/williamguey/llmdispatchbias

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07885 2026-05-05 cs.CR cs.AI cs.SE 90%

False Friends in the Shell: Unveiling the Emoticon Semantic Confusion in Large Language Models

壳中的假朋友:揭示大型语言模型中的表情符号语义混淆

Weipeng Jiang, Xiaoyu Zhang, Juan Zhai, Shiqing Ma, Chao Shen, Yang Liu

机构 * Xi’an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究揭示大型语言模型对表情符号的语义混淆问题,通过构建数据集发现平均混淆率超38%,且多数混淆响应导致安全风险,呼吁开发有效缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19298 2026-05-05 cs.CL cs.AI cs.IR 90%

IndiaFinBench: An Evaluation Benchmark for Large Language Model Performance on Indian Financial Regulatory Text

IndiaFinBench:用于评估大语言模型在印度金融监管文本性能的评估基准

Rajveer Singh Pall

机构 * Gyan Ganga Institute of Technology and Sciences(加延加anga科技与科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IndiaFinBench,首个公开的评估基准,用于评估大语言模型在印度金融监管文本上的性能,包含406个专家标注的问题-答案对,涵盖四个任务类型,评估十二个模型,发现数值推理任务表现最显著。

Comments 24 pages, 4 figures, 11 tables. Dataset and evaluation code at https://github.com/rajveerpall/IndiaFinBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01209 2026-05-05 cs.SE cs.FL 89%

ClarifySTL: An Interactive LLM Agent Framework for STL Transformation through Requirements Clarification

ClarifySTL: 一种通过需求澄清的交互式LLM代理框架用于STL转换

Yue Fang, Zhi Jin, Jie An, Hongshen Chen, Xiaohong Chen, Naijun Zhan

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出ClarifySTL框架,通过交互式澄清需求中的模糊和歧义信息,提升STL转换的准确性与效率,实验表明其在多个基准测试中表现优异。

Comments 32 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09723 2026-05-05 cs.CL cs.AI cs.LG stat.ME 89%

ALIGNS: Unlocking nomological networks in psychological measurement through a large language model

ALIGNS:通过大型语言模型解锁心理测量中的规范网络

Kai R. Larsen, Sen Yan, Roland M. Mueller, Lan Sang, Mikko Rönkkö, Ravi Starzl, Donald Edmondson

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ALIGNS利用大型语言模型构建包含55万+指标的规范网络,首次将大语言模型应用于测量验证基础问题,通过三个评估发现心理测量中的新维度和潜在问题。

Comments Error in algorithm explanation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01292 2026-05-05 cs.CL 89%

Addressing Data Scarcity in Bangla Fake News Detection: An LLM-Based Dataset Augmentation Approach

缓解孟加拉语虚假新闻检测中的数据稀缺问题:一种基于大语言模型的数据集增强方法

Ahmed Alfey Sani, Kazi Akib Zaoad, Shefayat E Shams Adib, Md Abdul Muqtadir, Ajwad Abrar

机构 * Islamic University of Technology(伊斯兰科技大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出基于大语言模型的数据集增强框架,通过生成合成新闻文章提升孟加拉语虚假新闻分类性能,实验表明高增益率随机采样可将F1分数提升至0.88,同时公开发布4545个合成样本以支持低资源领域研究。

Comments Accepted in 15th ACM ICSCA, 2026 in Langkawi, Malaysia

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01394 2026-05-05 cs.SE cs.AI 88%

LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation

LiveFMBench: 揭示代理工作流在规范生成中的力量与局限

Dong Xu, Jialun Cao, Guozhao Mo, Junjie Hu, Cheng Wen, Hongyu Lin, Xianpei Han, Shengchao Qin, Cong Tian, Shing-Chi Cheung, Le Sun, Yaojie Lu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) The Hong Kong University of Science(香港科学与技术大学) Guangzhou Institute of Technology, Xidian University(西安电子科技大学广州研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过LiveFMBench系统研究LLM和代理在C程序形式化规范生成中的能力与失败模式,发现直接提示和代理流程显著提升成功率,但需排除不忠实行为以准确评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01582 2026-05-05 cs.IR cs.AI 87%

KG-First, LLM-Fallback: A Hybrid Microservice for Grounded Skill Search and Explanation

基于知识图谱与大语言模型的混合微服务:面向 grounded skill search 和解释的 hybrid 方法

Ngoc Luyen Le, Marie-Hélène Abel, Bertrand Laforge

机构 * UTC(UTC大学) LPNHE(LPNHE研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出 SkillGraph-Service 微服务,通过统一权威能力框架资源构建知识图谱,结合符号严谨与子符号灵活,实现教育者查询中的词汇不匹配处理,并利用大语言模型进行约束排序和受众感知解释,实验证明其在多语言数据集上具有高检索效果和低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01449 2026-05-05 cs.CR cs.AI 87%

VisInject: Disruption != Injection -- A Dual-Dimension Evaluation of Universal Adversarial Attacks on Vision-Language Models

VisInject:破坏≠注入——对视觉-语言模型中通用对抗攻击的双维度评估

Pang Liu, Yingjie Lao

机构 * Department of Electrical and Computer Engineering, Tufts University(Tufts大学电气与计算机工程系)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 本文通过双维度评估揭示视觉-语言模型中通用对抗攻击的脆弱性,发现攻击成功与精确注入存在显著差异,揭示了模型在微小扰动下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01630 2026-05-05 cs.CL cs.AI 87%

Prosa: Rubric-Based Evaluation of LLMs on Real User Chats in Brazilian Portuguese

Prosa:基于评分标准的LLM在巴西葡萄牙语真实用户聊天中的评估

Roseval Malaquias Junior, Giovana Kerche Bonás, Thales Sales Almeida, Hugo Abonizio, Thiago Laitz, Ramon Pires, Marcos Piau, Celio Larcher, Rodrigo Nogueira

机构 * Maritaca AI Jusbrasil

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI

AI总结 本文提出Prosa基准,通过多判官过滤的二元评分标准减少LLM评分偏差,提升评估的判别能力,验证了评分标准的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27924 2026-05-05 cs.CL cs.AI 87%

Can AI Be a Good Peer Reviewer? A Survey of Peer Review Process, Evaluation, and the Future

人工智能能成为良好的同行评审者吗?同行评审流程、评估与未来的调查

Sihong Wu, Owen Jiang, Yilun Zhao, Tiansheng Hu, Yiling Ma, Kaiyan Zhang, Manasi Patwardhan, Arman Cohan

机构 * Yale University(耶鲁大学) New York University(纽约大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文调查了同行评审流程中的生成、 rebuttals 和 meta-review 等任务,以及评估方法,探讨了 LLM 在整个同行评审流程中的应用与未来方向。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15658 2026-05-05 cs.CL cs.AI cs.IR 87%

SurGE: A Benchmark and Evaluation Framework for Scientific Survey Generation

SurGE:科学调查生成的基准和评估框架

Weihang Su, Anzhe Xie, Qingyao Ai, Jianming Long, Xuanyi Chen, Jiaxin Mao, Ziyi Ye, Yiqun Liu

机构 * Tsinghua University(清华大学) Quan Cheng Laboratory(泉城实验室) Renmin University of China(中国人民大学) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 为科学调查生成任务设计了SurGE基准和评估框架,通过测试实例和学术文献库评估生成质量,揭示LLM在该任务上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01368 2026-05-05 cs.RO 87%

Assistance Without Interruption: A Benchmark and LLM-based Framework for Non-Intrusive Human-Robot Assistance

无中断协助:一种非侵入式人机协助的基准和基于大语言模型的框架

Yuedi Zhang, Shuanghao Bai, Wanqi Zhou, Haoran Zhang, Qi Zhang, Zhirong Luan, Badong Chen

机构 * Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学) School of Electrical Engineering(电气工程学院)

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 本文提出非侵入式协助的基准和框架,通过模拟基准和新指标评估,结合LLM与评分模型实现主动非侵入式协助,减少人类努力并保持任务有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00877 2026-05-05 cs.MM cs.AI cs.CL cs.CV cs.LG 87%

OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models

OceanPile:一个大规模多模态海洋语料库用于基础模型

Yida Xue, Ningyu Zhang, Tingwei Wu, Zhe Ma, Daxiong Ji, Zhao Wang, Guozhou Zheng, Huajun Chen

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou 310027, China(浙江大学计算机科学与技术学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Hangzhou 311200, China(浙江大学杭州全球科技创新中心) School of Software Technology, Zhejiang University, Ningbo 315048, China(浙江大学软件学院) Ocean College, Zhejiang University, Zhoushan 316021, China(浙江大学海洋学院) State Key Laboratory of Ocean Sensing, Hangzhou 311200, China(杭州海洋传感国家重点实验室) Ocean Research Center of Zhoushan, Zhejiang University, Zhoushan 316021, China(舟山海洋研究中心)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出OceanPile,一个用于海洋基础模型的多模态语料库,整合了声呐数据、水下图像、海洋科学图像和科学文本,通过高质量指令数据集和评估基准提升海洋领域模型性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00829 2026-05-05 cs.CY 87%

LLM-based uncertainty assessment of social media situational signals for crisis reporting

基于大型语言模型的社会媒体情境信号不确定性评估用于危机报道

Timothy Douglas, Roben Delos Reyes, Asanobu Kitamoto

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种考虑社会媒体声明可信度的自动化情境感知报告框架,通过评估外部代理数据下的置信度生成危机报告,提升危机响应中的信息优先级处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01484 2026-05-05 cs.LG stat.ML 86%

Evaluating LLMs on Large-Scale Graph Property Estimation via Random Walks

通过随机游走评估大图属性估计中的LLM

Sunil Kumar Maurya, Xin Liu

机构 * University of Tokyo(东京大学) AIST(日本产业技术综合研究所)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出EstGraph基准数据集,设计四类任务估计大图属性,通过随机游走采样生成提示,评估LLM在大图场景下的推理能力。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01392 2026-05-05 cs.SE cs.AI 86%

Using LLMs in Software Design: An Empirical Study of GitHub and A Practitioner Survey

在软件设计中使用LLMs:GitHub和实践者调查的实证研究

Yifei Wang, Ruiyin Li, Peng Liang, Yangxiao Cai, Zengyang Li, Mojtaba Shahin, Arif Ali Khan, Qiong Feng

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, Central China Normal University(中央财经大学计算机学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院) M3S Research Unit, University of Oulu(奥卢大学M3S研究单位) School of Computer Science, Nanjing University of Science(南京理工大学计算机学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过实证研究和调查,探讨开发者如何利用LLM进行软件设计,发现LLM在架构设计、数据模型设计等方面的应用,揭示其优势与局限性。

Comments 29 pages, 8 images, 6 tables, Manuscript submitted to a Journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01372 2026-05-05 cs.CL 86%

Embedding-based In-Context Prompt Training for Enhancing LLMs as Text Encoders

基于嵌入的上下文提示训练:增强LLM作为文本编码器

Ailiang Lin, Zhuoyun Li, Keyu Mao, Kotaro Funakoshi, Manabu Okumura

机构 * Institute of Science Tokyo(东京科学研究院) Tencent(腾讯)

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EPIC方法,通过上下文学习生成高质量嵌入,减少计算负担,实验表明在MTEB基准上取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01417 2026-05-05 cs.CL cs.AI 86%

Medmarks: A Comprehensive Open-Source LLM Benchmark Suite for Medical Tasks

Medmarks:面向医疗任务的综合性开源大语言模型评估套件

Benjamin Warner, Ratna Sagari Grandhi, Max Kieffer, Aymane Ouraq, Saurav Panigrahi, Geetu Ambwani, Kunal Bagga, Nikhil Khandekar, Arya Hariharan, Nishant Mishra, Manish Ram, Shamus Sim Zi Yang, Ahmed Essouaied, Adepoju Jeremiah Moyondafoluwa, Robert Scholz, Bofeng Huang, Molly Beavers, Srishti Gureja, Anish Mahishi, Sameed Khan, Maxime Griot, Hunar Batra, Jean-Benoit Delbrouck, Siddhant Bharadwaj, Ronald Clark, Ashish Vashist, Anas Zafar, Leema Krishna Murali, Harsh Deshpande, Ameen Patel, William Brown, Johannes Hagemann, Connor Lane, Paul Steven Scotti, Tanishq Mathew Abraham

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Medmarks,一个包含30个医疗任务基准的开源评估套件,系统评估61个模型,揭示前沿模型在医疗推理中的优势及模型对答案顺序偏见的敏感性。

Comments website: https://medmarks.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19227 2026-05-05 cs.CL cs.AI cs.HC 86%

Generative Interfaces for Language Models

生成式接口用于语言模型

Jiaqi Chen, Yanzhe Zhang, Yutong Zhang, Yijia Shao, Diyi Yang

机构 * Stanford University(斯坦福大学) Georgia Tech(佐治亚理工学院)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出生成式接口,通过主动生成用户界面提升多轮交互效率,实验表明其在人类偏好上提升达72%。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01264 2026-05-05 cs.SE cs.LG 81%

FeedbackLLM: Metadata driven Multi-Agentic Language Agnostic Test Case Generator with Evolving prompt and Coverage Feedback

FeedbackLLM: 基于元数据的多智能体语言无关测试用例生成器与演进提示和覆盖反馈

Kushal Jasti, Tejamani Prashanth Sahu, Rishitha Pentyala, Muvvala Mohit, Vivek Yelleti

机构 * Department of Computer Science and Engineering, SRM University AP, India(印度SRM大学计算机科学与工程系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 FeedbackLLM通过双阶段方法生成测试用例,利用元数据反馈提升覆盖率,有效解决传统方法的计算开销和可扩展性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00957 2026-05-05 cs.IR cs.AI 81%

"I Don't Know" -- Towards Appropriate Trust with Certainty-Aware Retrieval Augmented Generation

我不知道--迈向具有确定性意识的适当信任

Daan Di Scala, Maaike de Boer, Pınar Yolum

机构 * TNO Netherlands Organisation for Applied Scientific Research, Department Data Science(荷兰应用科学研究院,数据科学部门) Utrecht University, Department of Information and Computing Sciences(乌得勒支大学,信息与计算科学系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CERTA系统,通过结合问题、上下文和答案的相关性来反映不确定性,以建立适当的信任。研究创建了Certainty Benchmark,并通过实验验证了CERTA在减少过度同意和提供谨慎行为方面的有效性。

Comments To be published in VALE 2025 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14607 2026-05-05 cs.AI 81%

GDPR Auto-Formalization with AI Agents and Human Verification

GDPR自动形式化与AI代理和人类验证

Ha Thanh Nguyen, Wachara Fungwacharakorn, Sabine Wehnert, May Myo Zin, Yuntao Kong, Jieying Xue, Michał Araszkiewicz, Randy Goebel, Ken Satoh

机构 * Center for Juris-Informatics, ROIS-DS(法律信息中心,ROIS-DS) Ruhr-University Bochum, RC-Trust(波恩鲁尔大学,RC-Trust) Alberta Machine Intelligence Institute, University of Alberta(阿尔伯塔机器智能研究所,阿尔伯塔大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究利用大语言模型在人类在环验证框架下实现GDPR条款自动形式化的整体过程,通过角色专业化工作流结合人类审查,构建高质量数据集并分析成功与问题案例,证明结构化验证和针对性人类监督对可靠法律形式化至关重要。

Comments Accepted at ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01311 2026-05-05 cs.LG econ.EM stat.AP stat.ML 79%

The Partial Testimony of Logs: Evaluation of Language Model Generation under Confounded Model Choice

日志的部分证词:在混杂模型选择下语言模型生成的评估

Jikai Jin, Vasilis Syrgkanis

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本文研究了在混杂模型选择下语言模型生成评估的偏差问题,提出结合大规模观察日志、小规模随机实验和离线模拟器的三源设计,通过识别定理证明随机实验和模拟器可恢复因果模型值,日志用于减少估计误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00907 2026-05-05 cs.CV cs.AI cs.LG 79%

TRIP-Evaluate: An Open Multimodal Benchmark for Evaluating Large Models in Transportation

TRIP-Evaluate: 一个用于评估交通领域大模型的开放多模态基准

Han Gong, Zhen Zhou, Yunyang Shi, Yan Tan, Jinbiao Huo, Qi Hong, Zhiyuan Liu

机构 * School of Transportation(交通学院) Southeast University(东南大学) School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) Jiangnan University(江南大学) Department of Civil and Environmental Engineering(土木与环境工程系) Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 TRIP-Evaluate是首个开放多模态交通评估基准,通过837项任务覆盖车辆、交通管理、旅行者和规划设计功能,提供能力、模态和难度标签,支持跨模态诊断,揭示大模型在多步工程计算、规则约束推理和多模态场景理解方面的不足。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24056 2026-05-05 cs.CR cs.CL cs.LG 79%

Logit-Gap Steering: A Forward-Pass Diagnostic for Alignment Robustness

Logit-Gap Steering:一种对齐鲁棒性的前向传递诊断

Tung-Ling Li, Hongliang Liu

机构 * Palo Alto Networks(帕洛阿尔托网络)

专题命中 评测与基准 :RLHF(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出logit-gap steering方法,通过前向传递发现短的分布内后缀以关闭对齐间隙,验证了当前对齐边距的薄且可测量,强调防御策略需考虑分布内后缀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00970 2026-05-05 cs.IT math.IT 78%

Split and Aggregation Learning for Foundation Models Over Mobile Embodied AI Network (MEAN): A Comprehensive Survey

分割与聚合学习用于移动具身人工智能网络(MEAN)上的基础模型:综合综述

Qianzhou Chen, Siqi Sun, Minrui Xu, Sijie Ji, Jiawen Kang, Yijie Mao, Zhouxiang Zhao, Zhaohui Yang, Dusit Niyato

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文综述了6G通信系统中分割学习与聚合学习的应用,分析了其架构、技术方法及与AI原生6G通信技术的结合,探讨了其在语义通信、RIS、SAGIN和量子通信中的应用,旨在提升分布式基础模型的效率、隐私保护与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏