arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-18 至 2026-05-18 共收录 320 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 60 篇

2409.11022 2026-05-18 cs.CL cs.AI 88%

DynamicNER: A Dynamic, Multilingual, and Fine-Grained Dataset for LLM-based Named Entity Recognition

DynamicNER: 一种动态、多语言和细粒度的用于基于大语言模型的命名实体识别的数据集

Hanjun Luo, Yingbin Jin, Xinfeng Li, Xuecheng Liu, Ruizhe Chen, Tong Shang, Kun Wang, Qingsong Wen, Zuozhu Liu

机构 * New York University Abu Dhabi(纽约大学阿布扎赫德分校) Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technology University(南阳技术大学) University of Electronic Science and Technology of China(电子科技大学) Texas A&M University(德克萨斯大学) Squirrel AI

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DynamicNER数据集,用于改进基于大语言模型的命名实体识别方法,通过动态实体分类和多语言支持,提升模型泛化能力与细粒度任务的准确率。

Comments This paper is accepted by EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15669 2026-05-18 cs.LG 87%

Rule2DRC: Benchmarking LLM Agents for DRC Script Synthesis with Execution-Guided Test Generation

Rule2DRC:用于DRC脚本合成的LLM代理基准测试

Jinuk Kim, Junsoo Byun, Donghwi Hwang, Seong-Jin Park, Hyun Oh Song

机构 * Department of Computer Science and Engineering, Seoul National University(首尔国立大学计算机科学与工程系) Neural Processing Research Center(神经处理研究所以) Samsung Electronics Co., Ltd(三星电子公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 Rule2DRC是一个大规模基准,用于评估DRC脚本生成代理,包含1000个规则到脚本任务和13921个用于执行评分的评估芯片布局。它提供了一种通过DRC执行结果衡量功能正确性的评估流程,并引入SplitTester生成区分性测试用例以提升Best-of-N选择性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16052 2026-05-18 cs.AI cs.CL 87%

Reasoners or Translators? Contamination-aware Evaluation and Neuro-Symbolic Robustness in Tax Law

理由者还是翻译者?面向污染的评估与税法中的神经符号鲁棒性

Parisa Kordjamshidi, Samer Aslan, Madhavan Seshadri, Leslie Barrett, Enrico Santus

机构 * Bloomberg(彭博社) Michigan State University(密歇根州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了税法推理中LLM性能受数据污染影响的问题,提出神经符号框架提升法律AI的可靠性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03707 2026-05-18 cs.CL 86%

AirNav: A Large-Scale UAV Vision-and-Language Navigation Dataset with Natural and Diverse Instructions

AirNav: 一个大规模无人机视觉与语言导航数据集,包含自然且多样的指令

Hengxing Cai, Yijie Rao, Ligang Huang, Zanyang Zhong, Jinhan Dong, Jingjun Tan, Changhao Nai, Jue Hou, Wenhao Lu, Renxin Zhong

机构 * School of Intelligent Systems Engineering, Sun Yat-Sen University(中山大学智能系统工程学院) Beihang University(北京航空航天大学) Peking University(北京大学) Beijing University Of Posts and Telecommunications(北京邮电大学) Harbin Institute of Technology(哈尔滨工业大学) Xiamen University(厦门大学) National University of Defense Technology(国防科技大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AirNav数据集,包含137K自然多样指令的导航样本,评估了多种方法,提出AirVLN-R1模型在测试中取得51.82%的成功率,并通过实际无人机实验验证了仿真到现实的迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02039 2026-05-18 cs.CL 86%

Prompt Stability Scoring for Text Annotation with Large Language Models

基于大语言模型的文本标注提示稳定性评分

Christopher Barrie, Elli Palaiologou, Petter Törnberg

机构 * Department of Sociology, New York University(纽约大学社会学系) Independent Researcher(独立研究者) Institute for Logic, Language, and Computation, University of Amsterdam(阿姆斯特丹大学逻辑、语言与计算研究所)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 本文提出一种通用框架,通过传统方法改进内在和跨编码器可靠性评分,提出提示稳定性评分(PSS)及Python包promptstability,用于诊断低稳定性提示并展示功能。

Comments 39 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15503 2026-05-18 cs.CR 86%

uGen: An Agentic Framework for Generating Microarchitectural Attack PoCs

uGen:一种用于生成微架构攻击PoC的代理框架

Debopriya Roy Dipta, Thore Tiemann, Eduard Marin, Thomas Eisenbarth, Berk Gulmezoglu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出uGen框架,利用LLM生成微架构攻击代码,解决现有方法的可移植性问题,通过多代理设计提升攻击代码的准确性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16193 2026-05-18 cs.CL cs.CY 84%

Improving Cross-Cultural Survey Simulation with Calibrated Value Personas

通过校准价值人设提升跨文化调查模拟

Axel Abels, Elias Fernandez Domingos, Apurva Shah, Tom Lenaerts

机构 * Machine Learning Group, Université Libre de Bruxelles(布鲁塞尔自由大学机器学习小组) AI Lab, Vrije Universiteit Brussel(布鲁塞尔自由大学人工智能实验室) FARI Institute, Université Libre de Bruxelles - Vrije Universiteit Brussel(布鲁塞尔自由大学-布鲁塞尔自由大学FARI研究所) Center for Human-Compatible AI, UC Berkeley(伯克利大学人机兼容人工智能中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出基于价值的人设构建方法,通过校准提升跨文化调查模拟的准确性,减少预测误差,尤其在少数群体中效果显著。

Comments Submitted to the Fourth International Workshop on Value Engineering in AI (VALE 2026), held at IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15569 2026-05-18 cs.CR cs.AI cs.SE 84%

Detecting Privilege Escalation in Polyglot Microservices via Agentic Program Analysis

通过代理程序分析检测多语言微服务中的特权提升

Penghui Li, Hong Yau Chong, Yinzhi Cao, Junfeng Yang

机构 * Columbia University(哥伦比亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Neo框架,结合LLM和经典程序分析,解决微服务中特权提升检测的复杂性问题,发现24个零日漏洞,精度和召回率均优于现有方法。

Comments In Proceedings of the 47th IEEE Symposium on Security and Privacy (S&P)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15223 2026-05-18 cs.AR cs.AI 84%

GenAI-Driven Approach to RISC-V Supply Chain Exploration

基于生成式人工智能的RISC-V供应链探索方法

Nenad Petrovic, Andre Schamschurko, Yingjie Xu, Alois Knoll

机构 * Chair of Robotics, Artificial Intelligence and Real-Time Systems(机器人、人工智能与实时系统教授会) Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用LLM和VLM的供应链分析流程,结合MDE技术提升对异构数据的分析能力,通过知识图谱揭示供应链组件间的依赖关系,支持供应链韧性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14296 2026-05-18 cs.CY 82%

On the Trustworthiness of Generative Foundation Models: Guideline, Assessment, and Perspective

生成基础模型的可信度:指南、评估与视角

Yue Huang, Chujie Gao, Siyuan Wu, Haoran Wang, Xiangqi Wang, Yujun Zhou, Yanbo Wang, Jiayi Ye, Jiawen Shi, Qihui Zhang, Yuan Li, Han Bao, Zhaoyi Liu, Tianrui Guan, Dongping Chen, Ruoxi Chen, Kehan Guo, Andy Zou, Bryan Hooi Kuen-Yew, Caiming Xiong, Elias Stengel-Eskin, Hongyang Zhang, Hongzhi Yin, Huan Zhang, Huaxiu Yao, Jaehong Yoon, Jieyu Zhang, Kai Shu, Kaijie Zhu, Ranjay Krishna, Swabha Swayamdipta, Taiwei Shi, Weijia Shi, Xiang Li, Yiwei Li, Yuexing Hao, Zhihao Jia, Zhize Li, Xiuying Chen, Zhengzhong Tu, Xiyang Hu, Tianyi Zhou, Jieyu Zhao, Lichao Sun, Furong Huang, Or Cohen Sasson, Prasanna Sattigeri, Anka Reuel, Max Lamparth, Yue Zhao, Nouha Dziri, Yu Su, Huan Sun, Heng Ji, Chaowei Xiao, Mohit Bansal, Nitesh V. Chawla, Jian Pei, Jianfeng Gao, Michael Backes, Philip S. Yu, Neil Zhenqiang Gong, Pin-Yu Chen, Bo Li, Dawn Song, Xiangliang Zhang

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract)

AI总结 本文提出生成基础模型的可信度框架,通过多学科协作制定指导原则,引入动态评估平台TrustGen,揭示可信度进展与挑战,并探讨未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15218 2026-05-18 cs.AI cs.CE 81%

CAX-Agent: A Lightweight Agent Harness for Reliable APDL Automation

CAX-Agent:一种轻量级代理工具用于可靠的APDL自动化

Chenying Lin, Yichen Hai, Yi He, Ran Wang, Haiyan Qiang, Liang Yu

机构 * Shanghai Ultradimension Technology Co., Ltd.(上海超维科技有限公司) College of Logistics Engineering, Shanghai Maritime University(上海海洋大学物流学院) School of Civil Aviation, Northwestern Polytechnical University(西北工业大学航空学院) State Key Laboratory of Airliner Integration Technology(航空器集成技术国家重点实验室) National Key Laboratory of Strength(强度与结构完整性国家实验室) Wuhan University(武汉大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CAX-Agent,一种轻量级代理工具,用于可靠APDL自动化。通过引入领域特定的 orchestration 中间件,管理工具生命周期、工作流状态和恢复升级。评估了三种恢复策略,模型_only表现最佳。

Comments 8 pages, 6 figures, IEEE conference format

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15654 2026-05-18 cs.RO 80%

PCASim: Promptable Closed-loop Adversarial Simulation for Urban Traffic Environment

PCASim:可提示的闭环对抗模拟用于城市交通环境

Chuancheng Zhang, Zhenhao Wang, Kaizheng Li, Yaran Lin, Qiang Guo, Bin Jiang

机构 * Shenzhen Research Institute of Shandong University(山东大学深圳研究院) School of Airspace Science and Engineering(空天科学与工程学院) School of Computer Science and Technology(计算机科学与技术学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出PCASim框架,通过结合对抗场景生成与安全代理训练,提升城市交通环境中的安全性和鲁棒性,实验表明其在领域特定语言生成准确率、场景转换成功率和避障能力方面均有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15598 2026-05-18 cs.CR cs.SE 80%

Compositional Jailbreaking: An Empirical Analysis of Mutator Chain Interactions in Aligned LLMs

组合式劫持:对齐大语言模型中突变链相互作用的实证分析

Reinelle Jan Bugnot, Soohyeon Choi, Hoon Wei Lim, Yue Duan

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了对齐大语言模型中突变链的相互作用,通过十二个基线突变器评估有害提示的组合效果,揭示了突变器间的非均匀交互特性及安全对齐结构的潜在属性。

Comments 16 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22918 2026-05-18 cs.CL 79%

Where Vision Becomes Text: Locating the OCR Routing Bottleneck in Vision-Language Models

视觉成为文本:在视觉-语言模型中定位OCR路由瓶颈

Jonathan Steinberg, Oren Gal

机构 * Swarms & AI Lab (SAIL), University of Haifa(Swarms与AI实验室(SAIL),海法大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 研究揭示了视觉-语言模型中OCR信息进入语言处理流的瓶颈,通过因果干预分析三种架构,发现不同架构对场景文本和单阶段投影模型的敏感层不同,且PCA方向在不同数据集间可迁移,模块化OCR电路模型中移除OCR可提升计数性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16144 2026-05-18 eess.SP cs.MA cs.NI 78%

MAxLM: Multi-Agent Language Model-Based Scheduling and Resource Allocation in MU-MIMO-OFDMA-Enabled Wireless Networks

MAxLM:基于多智能体语言模型的MU-MIMO-OFDMA无线网络调度与资源分配

Adnan Quadri, Hongxiang Li

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出MAxLM框架,利用预训练语言模型优化无线网络的上行调度接入,通过WiSER平台实现自主调度与资源分配,实验表明其在不同STA数量和天线设置下均优于基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08063 2026-05-18 cs.CV 78%

SkyLink: A Large Vision-Language Model Driven Re-ranking Framework for Cross-View UAV geolocalization

SkyLink:一种由大型视觉-语言模型驱动的跨视图无人机地理定位重排序框架

Bowen Liu, Pengyue Jia, Wanyu Wang, Derong Xu, Jiawei Cheng, Jiancheng Dong, Xiao Han, Zimo Zhao, Chao Zhang, Bowen Yu, Fangyu Hong, Xiangyu Zhao

机构 * Department of Data Science, City University of Hong Kong, Hong Kong(香港城市大学数据科学系) Information Systems, City University of Hong Kong, Hong Kong(香港城市大学信息系统系) College of Computer Science and Technology, Zhejiang University of Technology, Zhejiang(浙江工业大学计算机科学与技术学院)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出SkyLink框架,利用大型视觉-语言模型建模无人机与卫星视图间的视觉语义关系,通过引入关系感知损失提升跨视图地理定位的排序效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15871 2026-05-18 cs.AI 77%

Agentic Discovery of Neural Architectures: AIRA-Compose and AIRA-Design

代理发现神经架构:AIRA-Compose和AIRA-Design

Alberto Pepe, Chien-Yu Lin, Despoina Magka, Bilge Acun, Yannan Nellie Wu, Anton Protopopov, Carole-Jean Wu, Yoram Bachrach

机构 * FAIR at Meta(Meta的FAIR)

专题命中 评测与基准 :LLM(abstract,abstract_cn);foundation model(abstract);分类 cs.AI

AI总结 本文提出AIRA-Compose和AIRA-Design框架,通过自主设计神经网络架构,实现超越标准Transformer的基础模型,提升模型性能和效率。

Comments 55 pages, 28 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15221 2026-05-18 cs.SE cs.AI cs.CL 73%

Effective Harness Engineering for Algorithm Discovery with Coding Agents

高效Harness工程在编码代理算法发现中的应用

Yoichi Ishibashi, Taro Yano, Masafumi Oyamada

机构 * Gemini Algorithmicsuperintelligence(算法智能)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了在固定token预算下,生成更多算法还是更深入思考每个算法的优劣,以及如何处理评估黑客和安全并行执行的问题,通过Vesper框架验证了深入思考每个算法更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00674 2026-05-18 cs.CL 70%

Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs

超越基准:MathArena作为LLMs数学评估平台

Jasper Dekoninck, Nikola Jovanović, Tim Gehrunger, Kári Rögnvaldsson, Ivo Petrov, Chenhao Sun, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院) INSAIT

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MathArena作为持续维护的数学评估平台,涵盖广泛任务,展示前沿模型在数学推理中的进步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18145 2026-05-18 cs.CV cs.AI 70%

Region-Grounded Report Generation for 3D Medical Imaging: A Fine-Grained Dataset and Graph-Enhanced Framework

基于3D医学影像的区域 grounded 报告生成:一个细粒度数据集和图增强框架

Cong Huy Nguyen, Son Dinh Nguyen, Guanlin Li, Tuan Dung Nguyen, Aditya Narayan Sankaran, Mai Huy Thong, Thanh Trung Nguyen, Mai Hong Son, Reza Farahbakhsh, Phi Le Nguyen, Noel Crespi

机构 * AI4LIFE, Hanoi University of Science and Technology, Vietnam(AI4LIFE,河内科学技术大学,越南) SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris, France(SAMOVAR,Telecom SudParis,巴黎理工学院,法国) Military Central Hospital, Vietnam(108军区中央医院,越南)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出VietPET-RoI数据集和HiRRA框架,通过图增强模块捕捉RoI属性依赖,提升3D PET/CT报告生成的临床可靠性,实验表明其在BLEU、ROUGE-L和临床指标上均优于现有方法。

Comments 16 pages; Accepted to appear in ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04299 2026-05-18 cs.CL 70%

The Company You Keep: How LLMs Respond to Dark Triad Traits

你所交往的公司:大语言模型如何回应黑暗三联特质

Zeyi Lu, Angelica Henestrosa, Pavel Chizhov, Ivan P. Yamshchikov

机构 * Technical University of Applied Sciences Würzburg-Schweinfurt(韦尔堡-施维林应用科学大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨LLMs对表达不同黑暗三联特质(操纵、自大、精神病态)的用户提示的回应方式,发现模型在不同严重程度下表现出纠正与强化行为的差异,对设计更安全的对话系统有启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05583 2026-05-18 cs.CL 70%

KG-HTC: Integrating Knowledge Graphs into LLMs for Effective Zero-shot Hierarchical Text Classification

KG-HTC:将知识图谱整合进LLMs以实现有效的零样本层次文本分类

Qianbo Zang, Christophe Zgrzendek, Igor Tchappi, Afshin Khadangi, Johannes Sedlmeir

机构 * Interdisciplinary Centre for Security, Reliability and Trust (SnT)(安全、可靠与信任交叉学科中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出KG-HTC方法,通过整合知识图谱与大语言模型,解决层次文本分类中标注数据不足、标签空间大和长尾分布等问题,实验表明其在零样本设置下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15761 2026-05-18 cs.LG 70%

A Unified Perturbation Framework for Analyzing Leaderboard Stability and Manipulation

用于分析排行榜稳定性和操纵的统一扰动框架

Hosna Oyarhoseini, Jimmy Lin, Amir-Hossein Karimi

机构 * University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出统一扰动框架分析Bradley-Terry排行榜在结构数据修改下的鲁棒性,研究Drop、Add、Flip等扰动对排行榜稳定性的影响,揭示现代排行榜在三个目标上的非鲁棒性,并提供评估工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15734 2026-05-18 cs.AI 70%

Can We Trust AI-Inferred User States. A Psychometric Framework for Validating the Reliability of Users States Classification by LLMs in Operational Environments

我们能否信任AI推断的用户状态。一种用于验证由LLMs在操作环境中对用户状态分类的可靠性的人格测量框架

Izabella Krzeminska, Michal Butkiewicz, Ewa Komkowska

机构 * Orange Research, AI Center(Orange研究院、人工智能中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过实证测试检验了使用大语言模型评估用户状态的假设,探讨了AI测量在人格测量中的可靠性问题,并提出可复制的评估框架以提高适应性系统的AI设计可靠性。

Comments Full survey article with data tables for futher possible replicabilty and comparison

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15581 2026-05-18 cs.AI 70%

STAR: A Stage-attributed Triage and Repair framework for RCA Agents in Microservices

STAR: 一种针对微服务中RCA代理的阶段属性分诊与修复框架

Junle Wang, Xingchuang Liao, Wenjun Wu

机构 * School of Artificial Intelligence, Beihang University Beijing, China(人工智能学院,北京航空航天大学,北京,中国)

专题命中 评测与基准 :LLM(abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出STAR框架,通过将RCA流程分解为四个阶段,提升微服务中RCA代理的可靠性与自修复能力。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15537 2026-05-18 cs.AI 70%

RTL-BenchMT: Dynamic Maintenance of RTL Generation Benchmark Through Agent-Assisted Analysis and Revision

RTL-BenchMT:通过代理辅助分析和修订动态维护RTL生成基准

Jing Wang, Shang Liu, Hangan Zhou, Zhiyao Xie

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出RTL-BenchMT框架,通过自动识别和修正错误案例及检测更新过拟合案例,解决RTL基准中的缺陷和过拟合问题,降低人工维护成本。

Comments This paper has been accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15282 2026-05-18 cs.CL 70%

Fluency and Faithfulness in Human and Machine Literary Translation

文学翻译中的人类与机器翻译的流畅性与忠实性

Sarah Griebel, Ted Underwood

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) School of Information Sciences(信息科学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过分析13万段翻译文本,探讨流畅性与忠实性之间的平衡,发现流畅性与忠实性呈负相关,尤其在机器翻译中表现较弱。

Comments Accepted NLP4DH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15226 2026-05-18 cs.AR cs.AI cs.SE 70%

Is Agentic AI Ready for Real-World Hardware Engineering? A Deep Dive with Phoenix-bench

代理AI是否准备好进行现实世界硬件工程?通过Phoenix-bench的深入探讨

Qingyun Zou, Feng Yu, Hongshi Tan, Bingsheng He, WengFai Wong

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过Phoenix-bench评估代理AI在硬件工程中的表现,发现软件与硬件工程本质不同,且故障集中于设计控制流、验证测试用例等,定位精度比定位本身更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15205 2026-05-18 cs.AI 70%

Does Theory of Mind Improvement Really Benefit Human-AI Interactions? Empirical Findings from Interactive Evaluations

理论思维能力提升真的能促进人机交互吗?来自交互评估的实证发现

Nanxu Gong, Zixin Chen, Haotian Li, Zishu Zhao, Jianxun Lian, Huamin Qu, Yanjie Fu, Xing Xie

机构 * Arizona State University(亚利桑那州立大学) Hong Kong University of Science and Technology(香港科学与技术大学) Microsoft Research Asia(微软亚洲研究院) Smith College(史密斯学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过交互评估探讨了理论思维能力提升对人机交互的实际影响,发现静态基准测试的改进未必能提升动态交互表现,强调了交互评估在开发下一代社交感知大语言模型中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15397 2026-05-18 cs.CV 67%

ELDOR: A Dataset and Benchmark for Illegal Gold Mining in the Amazon Rainforest

ELDOR:亚马逊雨林非法金矿开采的数据集和基准

Kangning Cui, Surendra Bohara, Suraj Prasai, Zishan Shao, Wei Tang, Martin Pillaca, Edwin Flores, Zhen Yang, Gregory Larsen, Evan Dethier, David Lutz, Jean-Michel Morel, Miles Silman, Victor Pauca, Fan Yang

机构 * Wake Forest University(威克森林大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Duke University(杜克大学) City University of Hong Kong(香港城市大学) Yale University(耶鲁大学) Alaska Spatial Science(阿拉斯加空间科学) Colby College(科林斯学院) Colby-Sawyer College(科林斯-萨威尔学院) Lingnan University(岭南大学) Centro de Innovación Cientifica Amazónica(亚马逊科学创新中心)

专题命中 评测与基准 :language model(abstract);foundation model(abstract)

AI总结 ELDOR通过大规模无人机基准监测亚马逊雨林非法金矿开采对环境和景观的影响,包含2500多公顷的手动标注正射影像,涵盖采矿活动和生态结构的像素级语义标签,评估多种模型在细粒度和小规模结构识别上的性能。

Comments 70 pages, 35 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏