arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-27 至 2026-05-27 共收录 437 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 88 篇

2605.26747 2026-05-27 cs.AI 77%

A Dataset of Robot-Patient and Doctor-Patient Medical Dialogues for Spoken Language Processing Tasks

面向口语处理任务的机器人-患者与医生-患者医疗对话数据集

Heriberto Cuayahuitl, Grace Jang

机构 * UK’s NHS(英国国家医疗服务体系)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MeDial-Speech数据集,包含机器人-患者和医生-患者的真实医疗对话语音数据,用于训练和评估医疗AI,并通过句子选择基准测试评估三个大语言模型。

Journal ref IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP-2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14702 2026-05-27 cs.AI cs.CV cs.RO 77%

Drive-P2D: A Progressive Perception-to-Decision Benchmark for VLMs in Autonomous Driving

Drive-P2D:自动驾驶中视觉语言模型的渐进式感知到决策基准

Zecong Tang, Zixu Wang, Yifei Wang, Weitong Lian, Tianjian Gao, Haoran Li, Tengju Ru, Lingyi Meng, Zhejun Cui, Yichen Zhu, Qi Kang, Kaixuan Wang, Yu Zhang

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出Drive-P2D基准,通过分离推理与答案的协议,在目标、场景和决策三个层级上评估视觉语言模型的感知到决策能力,并分析错误模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26712 2026-05-27 cs.CV 75%

METATR: A Multilingual, Evolving Benchmark for Automatic Text Recognition

METATR:一个多语言、不断演进的自动文本识别基准

Mélodie Boillet, Solène Tarride, Christopher Kermorvant

机构 * TEKLIA

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出METATR基准,通过多样化多语言文档、标准化评估框架和动态更新机制,全面评估自动文本识别系统(尤其是视觉大语言模型)的性能,支持模型比较与选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19667 2026-05-27 cs.CL cs.AI cs.CV cs.LG cs.MA 75%

Chat2Workflow: A Benchmark for Generating Executable Visual Workflows with Natural Language

Chat2Workflow: 用自然语言生成可执行可视化工作流的基准

Yi Zhong, Buqiang Xu, Yijun Wang, Zifei Shan, Shuofei Qiao, Guozhou Zheng, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Tencent(腾讯)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Chat2Workflow基准,用于评估大语言模型从自然语言生成可执行可视化工作流的能力,并设计了一个智能体基线以提升性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07073 2026-05-27 cs.SE 75%

Assessing REST API Test Generation Strategies with Log Coverage

使用日志覆盖率评估REST API测试生成策略

Nana Reinikainen, Mika Mäntylä, Yuqing Wang

专题命中 评测与基准 :LLM(summary_cn,abstract_cn)

AI总结 针对黑盒REST API测试缺乏代码覆盖率的问题,提出日志覆盖率指标,并评估进化计算、LLM和人工编写三种测试生成策略在Light-OAuth2系统上的效果。

Comments Accepted for publication in Proceedings of the 30th International Conference on Evaluation and Assessment in Software Engineering (EASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26662 2026-05-27 cs.CL cs.AI econ.GN q-fin.EC 73%

AI evaluation may bias perceptions: The importance of context in interpreting academic writing

AI评估可能扭曲认知:语境在解读学术写作中的重要性

Shang Wu, Randol Yao

机构 * UC Irvine(加州大学欧文分校) MIT(麻省理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文通过构建AI相似度基准,发现忽略国家和领域差异的评估方法会系统性高估或低估某些群体中的AI使用,提出基于具体语境的基准以更准确评估科学写作中的AI使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26463 2026-05-27 cs.CL cs.AI 73%

Towards Error-Free EHRs: Reasoning-Intensive Consistency Verification Between Clinical Notes and Structured Tables in Electronic Health Records

迈向无差错的电子健康记录:临床笔记与结构化表格之间的推理密集型一致性验证

Yeonsu Kwon, Jiho Kim, Junseong Choi, Paloma Rabaey, Minseo Kim, Sujeong Im, Jeewon Yang, Jun-Min Lee, Sangji Lee, Jiwon Kim, Hangyul Yoon, Hyunwook Kwon, Edward Choi

机构 * KAIST(韩国科学技术院) Ghent University(根特大学) Samsung Medical Center(三星医疗中心) Samsung Changwon Hospital(三星昌原医院) Asan Medical Center(亚山医疗中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对电子健康记录中临床笔记与结构化表格数据不一致的问题,提出推理密集型基准EHR-ReasonCon和基于大语言模型的框架EHR-Inspector,通过锚点实体提取、时间引用和表格探索工具实现高效一致性验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26438 2026-05-27 cs.CL cs.AI 73%

LURE: Live-Usage Replay Evaluations for Reducing Evaluation Awareness

LURE: 减少评估感知的实时使用回放评估

Igor Ivanov, David Demitri Africa

机构 * Meridian Cambridge(梅里登剑桥)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出LURE方法,通过回放真实代理交互轨迹并附加评估提示来构建类似部署的评估,以减少大语言模型的评估感知,并引入自动化评估真实性流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04948 2026-05-27 cs.IR cs.AI cs.LG 73%

From PDF to RAG-Ready: Evaluating Document Conversion Frameworks for Domain-Specific Question Answering

从PDF到RAG就绪:评估面向特定领域问答的文档转换框架

José Guilherme Marques dos Santos, Ricardo Yang, Rui Humberto Pereira, Alexandre Sousa, Brígida Mónica Faria, Henrique Lopes Cardoso, José Duarte, José Luís Reis, Luís Paulo Reis, Pedro Pimenta, José Paulo Marques dos Santos

机构 * Faculty of Engineering, University of Porto(葡萄牙波尔图大学工程学院) Department of Business Administration, University of Maia(马亚大学商业管理系) LIACC—Artificial Intelligence and Computer Science Laboratory, University of Porto(葡萄牙波尔图大学人工智能与计算机科学实验室) Department of Communication Sciences and Information Technologies, University of Maia(马亚大学通讯科学与信息科技系) School of Health, Polytechnic of Porto(波尔图理工学院健康学院) School of Technology and Management, Polytechnic Institute of Maia(马亚理工学院技术与管理学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 通过系统比较四种开源PDF转Markdown框架的21种流水线配置,发现文档预处理质量(尤其是层次化分块和元数据增强)对RAG系统问答准确率的影响远超转换工具本身,最佳配置(Docling+层次化分块+图像描述)达到94.1%准确率,超越人工整理。

Comments 27 pages, 3 figures, 7 tables

Journal ref Applied Sciences 16 (2026) 5069

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21008 2026-05-27 cs.LG cs.AI math.OC 73%

ORLoopBench: Solver-in-the-Loop Benchmarks for Self-Correction and Behavioral Rationality in Operations Research

ORLoopBench:运筹学中自我修正与行为理性的求解器在环基准测试

Ruicheng Ao, David Simchi-Levi, Xinshang Wang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出ORLoopBench基准套件,通过将不可行模型修复形式化为求解器在环马尔可夫决策过程,利用不可约不可行子系统(IIS)反馈,结合验证强化学习训练(RLVR),使8B模型在LP修复上超越前沿API(95.3% vs 92.4% RR@5),并揭示全模型代码再生中的语义漂移问题。

Comments 58 pages, accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26999 2026-05-27 cs.CL cs.CR 70%

Prompt Injection Detection is Regime-Dependent: A Deployment-Aware Evaluation with Interpretable Structural Signals

提示注入检测是依赖于场景的:一种基于可解释结构信号的部署感知评估

Akindoyin Akinrele, Shreyank N Gowda

机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过多模型、多场景的实验框架,评估了提示注入检测方法,发现检测性能高度依赖于部署场景和阈值选择,其中基于Transformer的模型表现最佳,结构信号在特定场景下提供适度但一致的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26840 2026-05-27 cs.CL 70%

Optimising Factual Consistency in Summarisation via Preference Learning from Multiple Imperfect Metrics

通过来自多个不完美指标的偏好学习优化摘要的事实一致性

Yuxuan Ye, Raul Santos-Rodriguez, Edwin Simpson

机构 * Intelligent System Laboratory(智能系统实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种自动化训练流程,通过聚合多个弱事实性指标的分数并映射为偏好,过滤高分歧样本,利用词汇相似摘要对进行偏好学习,从而提升摘要的事实一致性。

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26819 2026-05-27 cs.IR cs.AI 70%

RAGEAR: Retrieval-Augmented Graph-Enhanced Academic Recommender

RAGEAR: 检索增强的图增强学术推荐器

Francesco Granata, Lorenzo Lamazzi, Misael Mongiovì, Francesco Poggi, Valeria Secchini

机构 * Department of Mathematics and Computer Science, University of Catania, Italy(卡塔尼亚大学数学与计算机科学系,意大利) Institute for Cognitive Science and Technology, National Research Council, Italy(意大利国家研究委员会认知科学与技术研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出RAGEAR,一种神经符号推荐系统,结合密集检索和知识图谱,通过图感知聚合函数将片段级证据传播到课程级推荐,在学术课程推荐中优于元数据基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26485 2026-05-27 cs.CV cs.CL 70%

OmniInteract: Benchmarking Real-World Streaming Interaction for Real-Time Omnimodal Assistants

OmniInteract:面向实时全模态助手的流式交互基准测试

Xudong Lu, Xueying Li, Annan Wang, Yang Bo, Jinpeng Chen, Zengliang Li, Nianzu Yang, Rui Liu, Xue Yang, Jingwen Hou, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) SJTU(上海交通大学) NTU(国立新加坡大学) McMaster(麦马斯特大学) CityUHK(香港城市大学) JUFE(吉林大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出OmniInteract基准,通过在线推理音视频流评估全模态大模型的实时交互能力,发现现有模型在流式交互中表现薄弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26380 2026-05-27 cs.CV cs.AI 70%

VisualNeedle: Benchmarking Active Visual Search in Information-Dense Scenes

VisualNeedle: 信息密集场景中的主动视觉搜索基准

Jingru Chen, Yiming Liu, Mingtao Chen, Sijie Chen, Richeng Xuan, Liang Yang, Zhichao Hu, Fanyang Lu

机构 * Hunyuan, Tencent(腾讯 Hunyuan) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型在细粒度感知基准中依赖捷径而非真实视觉证据的问题,提出VisualNeedle基准,通过反事实裁剪-黑化设置评估模型在信息密集场景中的主动视觉搜索能力,实验表明最佳模型准确率仅56.01%,落后人类63.00%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08146 2026-05-27 cs.CV cs.AI 70%

VT-Bench: A Unified Benchmark for Visual-Tabular Multi-Modal Learning

VT-Bench:视觉-表格多模态学习的统一基准

Zi-Yi Jia, Zi-Jian Cheng, Xin-Yue Zhang, Kun-Yang Yu, Zhi Zhou, Yu-Feng Li, Lan-Zhe Guo

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学,中国) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 提出首个视觉-表格多模态基准VT-Bench,涵盖9个领域14个数据集,评估23个模型,揭示视觉-表格学习的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08586 2026-05-27 cs.AI 70%

DIANOIA: Diagnostic Decomposition and Joint Optimization for Multi-Agent Reasoning

DIANOIA: 多智能体推理的诊断性分解与联合优化

Yiming Yang, Zhuoyuan Li, Fanxiang Zeng, Hao Fu, Yue Liu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出DIANOIA框架,通过覆盖度、保真度和综合度三个可测量通道分解多智能体推理增益,并基于此设计诊断协议和对应系统,在多个基准上以更少token实现更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13428 2026-05-27 cs.CV cs.AI 70%

"PhyWorldBench": A Comprehensive Evaluation of Physical Realism in Text-to-Video Models

PhyWorldBench:文本到视频模型中物理真实性的全面评估

Jing Gu, Xian Liu, Yu Zeng, Ashwin Nagarajan, Fangrui Zhu, Daniel Hong, Yue Fan, Qianqi Yan, Kaiwen Zhou, Ming-Yu Liu, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) NVIDIA Research(NVIDIA研究) Northeastern University(东北大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出PhyWorldBench基准,通过1050个提示评估12个视频生成模型在物理规律遵循上的表现,并引入反物理类别,利用多模态大语言模型进行零样本评估。

Comments 35 pages, 21 figures

Journal ref ICLR 2026 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18381 2026-05-27 cs.AI cs.SE 70%

AI Agent for Reverse-Engineering Legacy Finite-Difference Code and Translating to Devito

AI Agent 用于逆向工程遗留有限差分代码并转换为 Devito

Yinghan Hou, Zongyou Yang

机构 * Department of Earth Science and Engineering(地球科学与工程系) Imperial College London(帝国理工学院伦敦分校) Department of Computer Science(计算机科学系) University College London(伦敦大学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出一个集成 AI Agent 框架,结合检索增强生成(RAG)和开源大语言模型,通过多阶段迭代工作流将遗留有限差分代码转换为 Devito 环境,并引入强化学习反馈机制实现动态自适应代码翻译。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27304 2026-05-27 cs.CV 67%

PlayClass: Automated Play Behaviour Classification in Poultry

PlayClass: 家禽自动玩耍行为分类

Prince Ravi Leow, Neil Scheidwasser, Rebecca Oscarsson, Per Jensen, Samir Bhatt, David Alejandro Duchêne

机构 * Section for Health Data Science & AI, University of Copenhagen(哥本哈根大学健康数据科学与人工智能部门) AVIAN Behaviour Genomics and Physiology Group, Linköping University(林雪平大学鸟类行为基因组学与生理学组) Department of Infectious Disease Epidemiology, Imperial College London(伦敦帝国学院传染病流行病学系)

专题命中 评测与基准 :foundation model(abstract);prompting(abstract)

AI总结 提出PlayClass流水线,利用SAM 3长时跟踪和V-JEPA 2.1基础模型,从俯拍视频中自动分类家禽玩耍行为,达到77.0宏平均F1。

Comments Accepted at CV4Animals Workshop @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27604 2026-05-27 cs.CV cs.CE 67%

Decoding Scientific Experimental Images: The SPUR Benchmark for Perception, Understanding, and Reasoning

解码科学实验图像:用于感知、理解和推理的SPUR基准

Junpeng Ding, Zichen Tang, Haihong E, Mengyuan Ji, Yang Liu, Haolin Tian, Haiyang Sun, Pengqi Sun, Yang Xu, Yichen Liu, Haocheng Gao, Zijie Xi, Ruomeng Jiang, Peizhi Zhao, Rongjin Li, Yuanze Li, Jiacheng Liu, Zhongjun Yang, Jintong Chen, Siying Lin

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出SPUR基准,通过4264个问答对评估多模态大模型在科学实验图像上的细粒度感知、跨面板关系理解和专家级推理能力,揭示当前模型与专家水平的差距。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21884 2026-05-27 cs.IR 67%

Exploration on Demand: From Algorithmic Control to User Empowerment

按需探索:从算法控制到用户赋权

Edoardo Bianchi

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出一种自适应聚类框架,通过用户控制的探索机制平衡电影推荐的个性化和多样性,实验表明能有效降低列表内相似度并提升意外性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26340 2026-05-27 cs.AI cs.CL cs.MA 62%

ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence

ScientistOne: 迈向基于证据链的人类级自主研究

Rui Meng, Bhavana Dalvi Mishra, Jiefeng Chen, Chun-Liang Li, Palash Goyal, Mihir Parmar, Yiwen Song, Yale Song, Rajarishi Sinha, Parthasarathy Ranganathan, Burak Gokturk, Jinsung Yoon, Tomas Pfister

机构 * Google Cloud AI Research(谷歌云人工智能研究)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出证据链框架Chain-of-Evidence和自主研究系统ScientistOne,通过可追溯性解决可验证性失败问题,在多项任务上达到或超越人类专家水平。

Comments Project website: https://scientist-one.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07053 2026-05-27 cs.CL cs.AI 62%

GSM-SEM: Benchmark and Framework for Generating Semantically Variant Augmentations

GSM-SEM: 生成语义变体增强的基准与框架

Jyotika Singh, Fang Tu, Aziza Mirsaidova, Amit Agarwal, Hitesh Laxmichand Patel, Sandip Ghoshal, Miguel Ballesteros, Karan Dua, Yassine Benajiba, Weiyi Sun, Tao Sheng, Graham Horwood, Sujith Ravi, Dan Roth

机构 * Oracle AI

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 提出GSM-SEM框架,通过修改实体、属性和关系生成语义多样的数学问题变体,降低模型对固定测试集的记忆偏差,并在多个基准上验证性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27195 2026-05-27 cs.CL 57%

EpiCurveBench: Evaluating VLMs on Epidemic Curve Digitization

EpiCurveBench: 评估视觉语言模型在流行病曲线数字化中的表现

Thomas Berkane, Maimuna S. Majumder

机构 * Computational Health Informatics Program(计算健康信息学项目) Boston Children’s Hospital & Harvard Medical School(波士顿儿童医院及哈佛医学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 针对现有图表数据提取基准中忽略时间序列结构的问题,提出包含1000张真实流行病曲线图像的EpiCurveBench基准和基于动态规划的EpiCurveSimilarity评估指标,实验表明最强模型仅达52.3% ECS,且ECS能更好区分模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27003 2026-05-27 cs.CV cs.AI 57%

Timestep-Aware SVDQuant-GPTQ for W4A4 Quantization of Wan2.2-I2V

时间步感知的 SVDQuant-GPTQ 用于 Wan2.2-I2V 的 W4A4 量化

Junhao Wu, Dezhong Yao, Hai Jin

机构 * National Engineering Research Center for Big Data Technology and System(大数据技术与系统国家工程研究中心) Services Computing Technology and System Lab(服务计算技术与系统实验室) Cluster and Grid Computing Lab(集群与网格计算实验室) School of Computer Science and Technology(计算机科学与技术学院) Huazhong University of Science and Technology(华中科技大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 针对 Wan2.2-I2V 视频扩散 Transformer 的 W4A4 量化,提出结合 SVDQuant 低秩异常补偿、GPTQ 重建感知残差权重量化和时间步分箱逐层激活裁剪比搜索的后训练量化框架,在 OpenS2V-Eval 上降低 59.3% 峰值显存且仅损失 0.9% VBench 平均分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25382 2026-05-27 cs.CL 57%

AuthTrace: Diagnosing Evidence Construction in Thematically Dense Single-Author Corpora

AuthTrace: 主题密集的单作者语料库中的证据构建诊断

Xiaoqing Wu, Feifei Li, Haoliang Ming, Wenhui Que

机构 * Tencent Inc.(腾讯公司) Beijing, China(中国北京)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出AuthTrace基准,通过扇入梯度诊断主题密集单作者语料库中证据构建系统的召回率、精度和答案正确性,发现证据召回是答案正确性的最强预测因子。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26476 2026-05-27 cs.CL cs.IR 57%

FAB-Bench: A Framework for Adaptive RAG Benchmarking in Semiconductor Manufacturing

FAB-Bench:半导体制造中自适应RAG基准测试框架

Jingbin Qian, Congwen Yi, Min Xia, Wen Wu, Jun Zhu, Jian Guan

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 提出FAB-Bench框架,通过六项诊断指标和三种合成策略,评估半导体制造领域RAG系统在不同上下文窗口下的性能,发现注意力稀释是极端上下文长度下性能下降的主要原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26203 2026-05-27 cs.MA cs.AI cs.CY cs.GT 57%

AgentSociety: Incentivizing Agentic Social Intelligence

AgentSociety: 激励代理社交智能

Aditya Vema Reddy Kesari, Krishna Reddy Kesari

机构 * IIT Bombay(印度理工学院班加罗尔) Amazon(亚马逊)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出一种基于流动民主和信息扩散的激励机制AgentSociety,使去中心化代理能够自主协作、策略性沟通并最大化效用,同时通过共识路由实现集体成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05248 2026-05-27 cs.PL cs.AI 57%

Governed Metaprogramming for Intelligent Systems: Reclassifying Eval as a Governed Effect

智能系统的受控元编程:将Eval重新分类为受控效应

Alan L. McCann

机构 * Mashin, Inc.(Mashin公司)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 针对AI系统运行时动态生成可执行代码带来的权限放大问题,提出受控元编程语言设计,将程序表示视为一等值,将形式到可执行机器的转换作为受控效应,并通过形式化证明和mashinTalk DSL实现验证。

Comments 15 pages. Companion proofs: https://github.com/mashin-live/governance-proofs. Project: https://mashin.live. Update: Abstract typo fixes. Updated license

详情

展开后加载摘要…

URL PDF HTML 收藏