arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-18 至 2026-05-18 共收录 60 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 60 篇

2605.16077 2026-05-18 cs.CL 94%

Can Large Language Models Imitate Human Speech for Clinical Assessment? LLM-Driven Data Augmentation for Cognitive Score Prediction

大型语言模型能否用于临床评估中的语音模仿?基于LLM的数据增强用于认知评分预测

Si-Belkacem Yamine Ketir, Lenard Paulo Tamayo, Shohei Hisada, Shaowen Peng, Shoko Wakamiya, Eiji Aramaki

机构 * Télécom SudParis(Telecom SudParis) Nara Institute of Science and Technology(奈良科学技术大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出基于LLM的数据增强框架,通过生成不同风格的口语独白来提升语音认知评分预测。采用相似性引导的增强策略,有效减少少数低分群体的预测误差,同时保持多数群体性能。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15680 2026-05-18 cs.CL cs.LG q-bio.QM 93%

Few-Shot Large Language Models for Actionable Triage Categorization of Online Patient Inquiries

少样本大语言模型在在线患者咨询可操作分诊中的应用

Liqi Zhou, Jiafu Li

机构 * seas.upenn.edu(宾夕法尼亚大学塞as学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本文研究少样本条件下大语言模型在在线患者咨询分诊中的应用,通过构建不同数据集比较TF-IDF和BioBERT与六个LLM在0-shot、4-shot和12-shot条件下的表现,发现Claude Haiku 4.5在12-shot条件下达到0.475的宏F1值,优于监督基线模型。

Comments 4 figures, 19 tables, 23 pages (including appendix and reference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16238 2026-05-18 cs.AI 92%

Prospective multi-pathogen disease forecasting using autonomous LLM-guided tree search

前瞻性多病原体疾病预测使用自主LLM引导的树搜索

Sarah Martinson, Michael P. Brenner, Martyna Plomecka, Brian P. Williams, Nicholas G. Reich, Zahra Shamsi

机构 * Google Research(谷歌研究) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院) Google Deepmind(谷歌DeepMind) University of Massachusetts(马萨诸塞大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出自主系统,利用LLM引导树搜索生成、评估和优化可执行预测软件,在2025-2026年美国呼吸道季节中实现了流感、新冠和呼吸道合胞病毒的多方法模型,其集成模型在样本外表现优于CDC标准模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00417 2026-05-18 cs.CL 92%

CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency

CryptoBench: 一种动态基准,用于评估LLM代理在加密货币领域的专家级能力

Jiacheng Guo, Suozhi Huang, Zixin Yao, Yifan Zhang, Yifu Lu, Jiashuo Liu, Zihao Li, Nicholas Deng, Qixin Xiao, Jia Tian, Kanghong Zhan, Tianyi Li, Xiaochen Liu, Jason Ge, Chaoyang He, Kaixuan Huang, Lin Yang, Wenhao Huang, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Zenith Lab(Zenith实验室) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CryptoBench,首个专家 curated 的动态基准,用于严格评估LLM在加密货币领域的真实能力。通过50题/月的动态任务,细分子类评估数据获取与预测能力,揭示LLM在检索与预测上的不平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15213 2026-05-18 cs.IR cs.AI 92%

An LLM-RAG Approach for Healthy Eating Index-Informed Personalized Food Recommendations

一种基于LLM-RAG的健康饮食指数指导的个性化食品推荐方法

Yibin Wang, Yanjie Yang, Grace Melo Guerrero, Rodolfo M. Nayga, Azlan Zahid

机构 * Department of Biological and Agricultural Engineering, Texas A&M AgriLife Research(生物与农业工程系,德克萨斯A&M农业生命研究)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种结合标准化营养数据库与大语言模型的LLM-RAG框架,通过健康饮食指数(HEI)指导实现个性化食品推荐,实验结果显示HEI平均提升6.45,用户HEI超过50的比例提升至61.26%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12601 2026-05-18 cs.LG 92%

Rethinking Predictive Modeling for LLM Routing: When Simple kNN Beats Complex Learned Routers

重新思考LLM路由的预测建模:当简单kNN胜过复杂学习路由

Yang Li

机构 * Independent researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过简单性视角重新审视LLM路由,发现经过调优的kNN方法在多种任务中优于现有学习路由方法,引入标准化基准测试和多模态数据集,揭示嵌入空间局部性属性使非参数方法在样本复杂度更低的情况下实现强路由决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15766 2026-05-18 cs.CE 91%

BioXArena: Benchmarking LLM Agents on Multi-Modal Biomedical Machine Learning Tasks

BioXArena:在多模态生物医学机器学习任务上评估LLM代理的基准测试

Loka Li, Duzhen Zhang, Xingbo Du, Leonard Song, Zixiao Wang, Assanali Aukenov, Noel Thomas, Shakhnazar Sailaukan, Yonghan Yang, Feilong Chen, Jiahua Dong, Kun Zhang, Bin Zhang, Le Song

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出BioXArena基准测试,旨在评估LLM代理能否为异构多模态生物医学数据集生成任务特定的模型训练流程,包含9个领域76个端到端任务,评估指标涵盖隐藏标签、隐藏评分者和生物意识度量,通过标准化环境评估11种代理配置。

Comments 69 pages, 13 figures, 34 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08300 2026-05-18 cs.CL cs.AI 91%

Large Language Models Could Be Rote Learners

大语言模型可能只是机械学习者

Yuyang Xu, Renjun Hu, Haochao Ying, Jian Wu, Xing Shi, Wei Lin

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) State Key Laboratory of Transvascular Implantation Devices and TIDRI(血管植入设备国家重点实验室和TIDRI) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江医学影像人工智能重点实验室) School of Data Science of Engineering, East China Normal University(华东师范大学工程数据科学学院) Second Affiliated Hospital and Liangzhu Laboratory, Zhejiang University School of Medicine(浙江大学医学院第二附属医院和良渚实验室) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文研究大语言模型在基准测试中的可靠性问题,提出TrinEval框架以区分真实能力学习与机械记忆,发现主流模型在知识点上依赖机械记忆的比例高达19.6%。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25099 2026-05-18 cs.CE cs.AI 90%

Large Language Models as Optimization Controllers: Adaptive Continuation for SIMP Topology Optimization

大语言模型作为优化控制器:SIMP拓扑优化的自适应延续

Shaoliang Yang, Jun Wang, Yunsheng Wang

机构 * Department of Mechanical Engineering, Santa Clara University(圣克拉拉大学机械工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出利用大语言模型作为SIMP拓扑优化的在线自适应控制器,通过实时状态条件参数决策替代传统固定调度延续方法,提升优化效果。

Comments 32 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16207 2026-05-18 cs.AI cs.CL 90%

Confirming Correct, Missing the Rest: LLM Tutoring Agents Struggle Where Feedback Matters Most

确认正确,遗漏其余:LLM辅导代理在反馈最关键的地方表现不佳

Tahreem Yasir, Wenbo Li, Sam Gilson, Sutapa Dey Tithi, Xiaoyi Tian, Tiffany Barnes

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文研究了LLM在逻辑推理中的辅导性能,发现其在区分最优解、次优解和错误解方面存在系统性偏差,影响适应性教学效果。

Comments 22 pages, 20 fgures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16143 2026-05-18 cs.AI cs.CL 90%

Look Before You Leap: Autonomous Exploration for LLM Agents

先看再跳:面向LLM代理的自主探索

Ziang Ye, Wentao Shi, Yuxin Liu, Yu Wang, Zhengzhou Cai, Yaorui Shi, Qi Gu, Xunliang Cai, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出自主探索能力,通过探索检查点覆盖率指标,改进LLM代理在陌生环境中的适应性,采用探索与执行交替训练策略,提升任务执行的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17915 2026-05-18 cs.CL cs.AI 90%

IndicSafe: A Benchmark for Evaluating Multilingual LLM Safety in South Asia

IndicSafe:评估南亚多语言大语言模型安全性的基准

Priyaranjan Pattnayak, Sanchari Chowdhuri

机构 * Oracle America Inc.(Oracle美洲公司)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IndicSafe基准,评估12种南亚语言中LLM的安全性,发现跨语言一致性仅12.8%,安全率波动超17%,揭示多语言LLM安全泛化缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15384 2026-05-18 cs.LG cs.AI 90%

Is One Score Enough? Rethinking the Evaluation of Sequentially Evolving LLM Memory

一个评分够吗?重新思考序列演进LLM记忆的评估

Songwei Dong, Zihan Chen, Chengshuai Shi, Peng Wang, Jundong Li, Cong Shen

机构 * University of Virginia(弗吉尼亚大学) Princeton University(普林斯顿大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SeqMem-Eval框架,通过评估记忆状态的演变、泛化、经验巩固和信息保留,揭示传统指标无法捕捉的记忆质量差异。

Comments 29 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19923 2026-05-18 cs.CL cs.AI 90%

Structure-BiEval: A Self-Supervised, Dual-Track Framework for Decoupling Structure and Content in LLM Evaluation for Web Information Systems

Structure-BiEval: 一种自监督、双轨框架,用于解耦Web信息系统中LLM评估的结构与内容

Boxiang Zhao, Qince Li, Zhonghao Wang, Zelin Cao, Yi Wang, Peng Cheng, Bo Lin

机构 * Tele-Communication Technology Bureau, Xinhua News Agency(新华通讯社电信技术局)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Structure-BiEval框架,通过确定性中间表示解耦结构与内容,利用内容语义准确性和归一化树编辑距离评估Web数据工程中的LLM结构 fidelity,发现不同模型在Web数据格式化中表现差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15486 2026-05-18 cs.RO cs.AI 90%

Hybrid LLM-based Intelligent Framework for Robot Task Scheduling

基于混合大语言模型的智能机器人任务调度框架

Swayamjit Saha, Subhabrata Das, Haonan Duan, Xiao-Yang Liu

机构 * Department of Computer Science and Engineering, Mississippi State University(密苏里州立大学计算机科学与工程系) Graduate School of Arts and Sciences, Columbia University(哥伦比亚大学研究生院) Consumer and Community Banking, JPMorgan Chase(摩根大通消费与社区银行业) Department of Data Science, Columbia University(哥伦比亚大学数据科学系) Department of Electrical Engineering, Columbia University(哥伦比亚大学电气工程系)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型提升建筑机器人任务调度效率,通过平衡时间效率与资源利用,结合自然语言处理接口实现与专业人员的实时沟通,并采用两个LLM代理生成更精确的任务计划。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04459 2026-05-18 cs.CR cs.AI cs.SE 90%

Benchmark of Benchmarks: Unpacking Influence and Code Repository Quality in LLM Safety Benchmarks

基准的基准:解构影响与代码仓库质量在LLM安全基准中的作用

Junjie Chu, Xinyue Shen, Ye Leng, Michael Backes, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心) University of Waterloo(滑铁卢大学) Flexera(Flexera公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文通过系统研究31个LLM安全基准及382篇非基准论文,发现仅39%的基准仓库可直接运行,且缺乏伦理考量。研究揭示社区采用基准与作者声望和代码运行性相关,但与代码质量无关,指出安全基准可能存在安全隐患和不可比性问题。

Comments 24 pages. 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16085 2026-05-18 cs.DB cs.AI 89%

Towards Foundation Models for Relational Databases with Language Models and Graph Neural Networks

面向关系数据库的foundation models的语言模型与图神经网络方法

Jingcheng Wu, Ratan Bahadur Thapa, Mojtaba Nayyeri, Lucas Etteldorf, Max Finkenbeiner, Fabian Leeske, Steffen Staab

机构 * University of Stuttgart, Stuttgart, Germany(斯图加特大学) Internet Science Research Group, University of Southampton, Southampton, United Kingdom(互联网科学研究组,南安普顿大学)

专题命中 评测与基准 :foundation model(title,title_cn);language model(title);分类 cs.AI

AI总结 本文提出结合语言模型和图神经网络的混合架构,通过关系实体图建模提升关系数据库的预测性能,实验表明其在多个任务中表现优异,接近监督基线并缩小与RDL的差距。

Comments 15 pages, 7 figures, 4 tables. Preprint of a paper accepted at the 1st Workshop on Extraction from Triplet Text-Table-Knowledge Graph and associated Challenge (TRIPLET), co-located with ESWC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15589 2026-05-18 cs.CL 89%

MHGraphBench: Knowledge Graph-Grounded Benchmarking of Mental Health Knowledge in Large Language Models

MHGraphBench: 用于评估大语言模型中心理健康知识的图知识基准

Weixin Liu, Congning Ni, Shelagh A. Mulvaney, Susannah L. Rose, Murat Kantarcioglu, Bradley A. Malin, Zhijun Yin

机构 * Vanderbilt University(范德比大学) Vanderbilt University Medical Center(范德比大学医学院) Virginia Tech(弗吉尼亚理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本文提出MHGraphBench基准,评估大语言模型在心理健康实体识别、关系判断及双跳推理能力,发现模型在实体类型识别和小关系类型判断上表现优异,但在关系预测和双跳推理上仍有不足,且输出格式可靠性对性能有显著影响。

Comments Accepted to GEM 2026, ACL 2026 Workshop; 9 pages main text plus references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15341 2026-05-18 cs.LG cs.AI 88%

LEAP: Trajectory-Level Evaluation of LLMs in Iterative Scientific Design

LEAP:LLM在迭代科学设计中的轨迹级评估

Marilyn Zhang, Tianfeng Chen, Fabián Barzuna, Ankita Rathod, Mark E. Whiting

专题命中 评测与基准 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LEAPBench框架,通过轨迹级评估方法揭示LLM在迭代科学设计中的学习效率,发现传统基于结果的评估方法存在偏差,轨迹指标能更准确反映效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11022 2026-05-18 cs.CL cs.AI 88%

DynamicNER: A Dynamic, Multilingual, and Fine-Grained Dataset for LLM-based Named Entity Recognition

DynamicNER: 一种动态、多语言和细粒度的用于基于大语言模型的命名实体识别的数据集

Hanjun Luo, Yingbin Jin, Xinfeng Li, Xuecheng Liu, Ruizhe Chen, Tong Shang, Kun Wang, Qingsong Wen, Zuozhu Liu

机构 * New York University Abu Dhabi(纽约大学阿布扎赫德分校) Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technology University(南阳技术大学) University of Electronic Science and Technology of China(电子科技大学) Texas A&M University(德克萨斯大学) Squirrel AI

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DynamicNER数据集,用于改进基于大语言模型的命名实体识别方法,通过动态实体分类和多语言支持,提升模型泛化能力与细粒度任务的准确率。

Comments This paper is accepted by EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15669 2026-05-18 cs.LG 87%

Rule2DRC: Benchmarking LLM Agents for DRC Script Synthesis with Execution-Guided Test Generation

Rule2DRC:用于DRC脚本合成的LLM代理基准测试

Jinuk Kim, Junsoo Byun, Donghwi Hwang, Seong-Jin Park, Hyun Oh Song

机构 * Department of Computer Science and Engineering, Seoul National University(首尔国立大学计算机科学与工程系) Neural Processing Research Center(神经处理研究所以) Samsung Electronics Co., Ltd(三星电子公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 Rule2DRC是一个大规模基准,用于评估DRC脚本生成代理,包含1000个规则到脚本任务和13921个用于执行评分的评估芯片布局。它提供了一种通过DRC执行结果衡量功能正确性的评估流程,并引入SplitTester生成区分性测试用例以提升Best-of-N选择性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16052 2026-05-18 cs.AI cs.CL 87%

Reasoners or Translators? Contamination-aware Evaluation and Neuro-Symbolic Robustness in Tax Law

理由者还是翻译者?面向污染的评估与税法中的神经符号鲁棒性

Parisa Kordjamshidi, Samer Aslan, Madhavan Seshadri, Leslie Barrett, Enrico Santus

机构 * Bloomberg(彭博社) Michigan State University(密歇根州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了税法推理中LLM性能受数据污染影响的问题,提出神经符号框架提升法律AI的可靠性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03707 2026-05-18 cs.CL 86%

AirNav: A Large-Scale UAV Vision-and-Language Navigation Dataset with Natural and Diverse Instructions

AirNav: 一个大规模无人机视觉与语言导航数据集,包含自然且多样的指令

Hengxing Cai, Yijie Rao, Ligang Huang, Zanyang Zhong, Jinhan Dong, Jingjun Tan, Changhao Nai, Jue Hou, Wenhao Lu, Renxin Zhong

机构 * School of Intelligent Systems Engineering, Sun Yat-Sen University(中山大学智能系统工程学院) Beihang University(北京航空航天大学) Peking University(北京大学) Beijing University Of Posts and Telecommunications(北京邮电大学) Harbin Institute of Technology(哈尔滨工业大学) Xiamen University(厦门大学) National University of Defense Technology(国防科技大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AirNav数据集,包含137K自然多样指令的导航样本,评估了多种方法,提出AirVLN-R1模型在测试中取得51.82%的成功率,并通过实际无人机实验验证了仿真到现实的迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02039 2026-05-18 cs.CL 86%

Prompt Stability Scoring for Text Annotation with Large Language Models

基于大语言模型的文本标注提示稳定性评分

Christopher Barrie, Elli Palaiologou, Petter Törnberg

机构 * Department of Sociology, New York University(纽约大学社会学系) Independent Researcher(独立研究者) Institute for Logic, Language, and Computation, University of Amsterdam(阿姆斯特丹大学逻辑、语言与计算研究所)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 本文提出一种通用框架,通过传统方法改进内在和跨编码器可靠性评分,提出提示稳定性评分(PSS)及Python包promptstability,用于诊断低稳定性提示并展示功能。

Comments 39 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15503 2026-05-18 cs.CR 86%

uGen: An Agentic Framework for Generating Microarchitectural Attack PoCs

uGen:一种用于生成微架构攻击PoC的代理框架

Debopriya Roy Dipta, Thore Tiemann, Eduard Marin, Thomas Eisenbarth, Berk Gulmezoglu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出uGen框架,利用LLM生成微架构攻击代码,解决现有方法的可移植性问题,通过多代理设计提升攻击代码的准确性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16193 2026-05-18 cs.CL cs.CY 84%

Improving Cross-Cultural Survey Simulation with Calibrated Value Personas

通过校准价值人设提升跨文化调查模拟

Axel Abels, Elias Fernandez Domingos, Apurva Shah, Tom Lenaerts

机构 * Machine Learning Group, Université Libre de Bruxelles(布鲁塞尔自由大学机器学习小组) AI Lab, Vrije Universiteit Brussel(布鲁塞尔自由大学人工智能实验室) FARI Institute, Université Libre de Bruxelles - Vrije Universiteit Brussel(布鲁塞尔自由大学-布鲁塞尔自由大学FARI研究所) Center for Human-Compatible AI, UC Berkeley(伯克利大学人机兼容人工智能中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出基于价值的人设构建方法,通过校准提升跨文化调查模拟的准确性,减少预测误差,尤其在少数群体中效果显著。

Comments Submitted to the Fourth International Workshop on Value Engineering in AI (VALE 2026), held at IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15569 2026-05-18 cs.CR cs.AI cs.SE 84%

Detecting Privilege Escalation in Polyglot Microservices via Agentic Program Analysis

通过代理程序分析检测多语言微服务中的特权提升

Penghui Li, Hong Yau Chong, Yinzhi Cao, Junfeng Yang

机构 * Columbia University(哥伦比亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Neo框架,结合LLM和经典程序分析,解决微服务中特权提升检测的复杂性问题,发现24个零日漏洞,精度和召回率均优于现有方法。

Comments In Proceedings of the 47th IEEE Symposium on Security and Privacy (S&P)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15223 2026-05-18 cs.AR cs.AI 84%

GenAI-Driven Approach to RISC-V Supply Chain Exploration

基于生成式人工智能的RISC-V供应链探索方法

Nenad Petrovic, Andre Schamschurko, Yingjie Xu, Alois Knoll

机构 * Chair of Robotics, Artificial Intelligence and Real-Time Systems(机器人、人工智能与实时系统教授会) Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用LLM和VLM的供应链分析流程,结合MDE技术提升对异构数据的分析能力,通过知识图谱揭示供应链组件间的依赖关系,支持供应链韧性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14296 2026-05-18 cs.CY 82%

On the Trustworthiness of Generative Foundation Models: Guideline, Assessment, and Perspective

生成基础模型的可信度:指南、评估与视角

Yue Huang, Chujie Gao, Siyuan Wu, Haoran Wang, Xiangqi Wang, Yujun Zhou, Yanbo Wang, Jiayi Ye, Jiawen Shi, Qihui Zhang, Yuan Li, Han Bao, Zhaoyi Liu, Tianrui Guan, Dongping Chen, Ruoxi Chen, Kehan Guo, Andy Zou, Bryan Hooi Kuen-Yew, Caiming Xiong, Elias Stengel-Eskin, Hongyang Zhang, Hongzhi Yin, Huan Zhang, Huaxiu Yao, Jaehong Yoon, Jieyu Zhang, Kai Shu, Kaijie Zhu, Ranjay Krishna, Swabha Swayamdipta, Taiwei Shi, Weijia Shi, Xiang Li, Yiwei Li, Yuexing Hao, Zhihao Jia, Zhize Li, Xiuying Chen, Zhengzhong Tu, Xiyang Hu, Tianyi Zhou, Jieyu Zhao, Lichao Sun, Furong Huang, Or Cohen Sasson, Prasanna Sattigeri, Anka Reuel, Max Lamparth, Yue Zhao, Nouha Dziri, Yu Su, Huan Sun, Heng Ji, Chaowei Xiao, Mohit Bansal, Nitesh V. Chawla, Jian Pei, Jianfeng Gao, Michael Backes, Philip S. Yu, Neil Zhenqiang Gong, Pin-Yu Chen, Bo Li, Dawn Song, Xiangliang Zhang

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract)

AI总结 本文提出生成基础模型的可信度框架,通过多学科协作制定指导原则,引入动态评估平台TrustGen,揭示可信度进展与挑战,并探讨未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15218 2026-05-18 cs.AI cs.CE 81%

CAX-Agent: A Lightweight Agent Harness for Reliable APDL Automation

CAX-Agent:一种轻量级代理工具用于可靠的APDL自动化

Chenying Lin, Yichen Hai, Yi He, Ran Wang, Haiyan Qiang, Liang Yu

机构 * Shanghai Ultradimension Technology Co., Ltd.(上海超维科技有限公司) College of Logistics Engineering, Shanghai Maritime University(上海海洋大学物流学院) School of Civil Aviation, Northwestern Polytechnical University(西北工业大学航空学院) State Key Laboratory of Airliner Integration Technology(航空器集成技术国家重点实验室) National Key Laboratory of Strength(强度与结构完整性国家实验室) Wuhan University(武汉大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CAX-Agent,一种轻量级代理工具,用于可靠APDL自动化。通过引入领域特定的 orchestration 中间件,管理工具生命周期、工作流状态和恢复升级。评估了三种恢复策略,模型_only表现最佳。

Comments 8 pages, 6 figures, IEEE conference format

详情

展开后加载摘要…

URL PDF HTML 收藏