arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-04 至 2026-06-04 共收录 358 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 63 篇

2606.04483 2026-06-04 cs.CL 86%

Off-Distribution Voices: Fanfiction Subgenres as Universal Vernacular Jailbreaks for Aligned LLMs

分布外声音:同人小说子类型作为对齐LLM的通用白话越狱

Zhongze Luo, Ruihe Shi, Zhenshuai Yin, Haoyue Liu, Weixuan Wan, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院) The Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来网络智能研究院) The Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能重点实验室) School of Microelectronics, Xi’an Jiaotong University(西安交通大学微电子学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 本文发现安全训练覆盖不足的自然人类写作语域是对齐LLM的真正失败模式,并提出首个利用真实同人小说子类型作为通用攻击载体的越狱方法,显著提升攻击成功率。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04231 2026-06-04 cs.CL cs.AI 85%

MM-BizRAG: Rethinking Multimodal Retrieval-Augmented Generation for General Purpose Enterprise Q&A

MM-BizRAG:面向通用企业问答的多模态检索增强生成再思考

Hanoz Bhathena, Parin Rajesh Jhaveri, Rohan Mittal, Prateek Singh, Aymen Kallala, Rachneet Kaur, Yiqiao Jin, Zhen Zeng, Adwait Ratnaparkhi, Denis Kochedykov

机构 * JPMorgan Chase & Co.(摩根大通公司) Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出MM-BizRAG框架,通过文档结构感知分割和布局感知解析,结合统一LLM驱动的工件转换与推理时多模态组装,无需微调即可提升企业文档问答性能,在异构企业数据集和两个公开基准上超越基线最多32个百分点。

Comments Accepted at ACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05085 2026-06-04 cs.CL cs.AI 84%

Automatic Generation of Titles for Research Papers Using Language Models

使用语言模型自动生成研究论文标题

Tohida Rehman, Debarshi Kumar Sanyal, Samiran Chattopadhyay

机构 * Jadavpur University(贾达沃尔大学) Indian Association for the Cultivation of Science(印度科学培养协会)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 提出利用预训练语言模型和大语言模型从摘要生成论文标题的方法,通过微调PEGASUS-large在多个数据集上取得最优性能。

Comments 24 pages, 24 tables, 01 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09081 2026-06-04 cs.LG cs.AI 84%

FactoryNet: A Large-Scale Dataset toward Industrial Time-Series Foundation Models

FactoryNet:面向工业时间序列基础模型的大规模数据集

Karim Othman, Jonas Petersen, Matei Ignuta-Ciuncanu, Camilla Mazzoleni, Federico Martelli, Alessandro Lombardi, Riccardo Maggioni, Philipp Petersen

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出首个工业时间序列通用预训练语料库FactoryNet,通过统一模式实现跨实体零样本迁移和高效异常检测。

Comments Accepted at AI4Physics and FMSD, ICML 2026. Code: https://github.com/Forgis-Labs/FactoryNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04010 2026-06-04 q-bio.NC cs.AI 83%

The Variance Brain Foundation Models Forgot: Third-Order Statistics Predict Cognition Where Billion-Parameter Models Fail

大脑基础模型遗忘的方差:三阶统计在十亿参数模型失败时预测认知

Giovanni Marraffini, Gabriel Mahuas, Trinidad Borrell, Victoria Shevchenko, Demian Wassermann

机构 * Inria Saclay Île-de-France, CEA, Université Paris-Saclay, Palaiseau, France(法国巴黎萨克雷大学Inria萨克雷研究中心、CEA、巴黎萨克雷大学、帕莱索分校) Sigma Nova Sorbonne Université, Institut du Cerveau - Paris Brain Institute - ICM(索邦大学、巴黎脑研究所-巴黎脑研究所-ICM) Forschungszentrum Jülich(茹里希研究中心)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 研究发现,大脑基础模型(BFMs)的预训练主要捕获了fMRI信号中的方差成分,但忽略了预测认知的高阶结构,而基于三阶协偏度张量的线性管道无需预训练即可超越现有BFMs。

Comments 37 pages, 16 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04507 2026-06-04 cs.CL cs.AI 82%

Self-Evolving Deep Research via Joint Generation and Evaluation

通过联合生成与评估实现自我进化的深度研究

Han Zhu, Chengkun Cai, Yuanfeng Song, Xing Chen, Sirui Han, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) ByteDance, China(字节跳动) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SCORE框架,通过共享参数的协同进化训练联合优化评估器与求解器,解决深度研究报告生成中奖励不可验证的问题,持续提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04095 2026-06-04 cs.CL cs.AI 82%

POLARIS: Guiding Small Models to Write Long Stories

POLARIS:引导小模型撰写长篇小说

Rishanth Rajendhran, Jenna Russell, Mohit Iyyer, John Frederick Wieting

机构 * University of Maryland(马里兰大学) Google(谷歌) DeepMind(深Mind)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出POLARIS训练方法,结合LLM裁判奖励和人类参考注入,使9B小模型在长故事写作中达到与27B模型相当的质量,并展现出长度泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04300 2026-06-04 cs.IR 82%

Argus-Retriever: Vision-LLM Late-Interaction Retrieval with Region-Aware Query-Conditioned MoE for Visual Document Retrieval

Argus-Retriever: 基于区域感知查询条件混合专家模型的视觉-大语言模型后期交互检索用于视觉文档检索

Abdelrahman Abdallah, Mahmoud Abdalla, Mohammed Ali, Adam Jatowt

专题命中 评测与基准 :LLM(title,abstract)

AI总结 提出Argus系列查询条件后期交互检索器,通过区域感知混合专家模块使文档表示依赖查询,在ViDoRe基准上以更低维度和更少训练数据取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04769 2026-06-04 cs.CR cs.AI cs.SE 81%

Description-Code Inconsistency in Real-world MCP Servers: Measurement, Detection, and Security Implications

现实世界 MCP 服务器中的描述-代码不一致性:测量、检测与安全影响

Yutao Shi, Xiaohan Zhang, Xiangjing Zhang, Xihua Shen, Hui Ouyang, Huming Qiu, Mi Zhang, Min Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对 MCP 服务器中工具描述与代码实现不一致的问题,提出结合结构感知静态分析与 Direct-Reverse-Arbitration 提示方法的自动检测框架 DCIChecker,并在大规模数据集上揭示 9.93% 的不一致率及其安全风险。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04599 2026-06-04 cs.AI cs.CE 81%

Plan First, Judge Later, Run Better: A DMAIC-Inspired Agentic System for Industrial Anomaly Detection

先计划,后评判,更优运行:一种受DMAIC启发的工业异常检测智能体系统

Yongzi Yu, Ao Li, Le Wang, Ziyue Li, Fugee Tsung, Yuxuan Liang, Man Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Shanghai University of Finance and Economics(上海财经大学) Technische Universität München(慕尼黑技术大学) Southwestern University of Finance and Economics(西南财经大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出受DMAIC启发的多智能体系统DMAIC-IAD,通过先制定标准化操作程序(SOP)再生成策略,并引入预训练的无执行评判模型来排序候选策略,无需昂贵运行时试验,在四种模态上平均检测性能提升37.76%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18134 2026-06-04 cs.LG cs.CC cs.PL cs.SE 81%

Learning Randomized Reductions

学习随机归约

Ferhat Erata, Orr Paradise, Thanos Typaldos, Timos Antonopoulos, ThanhVu Nguyen, Shafi Goldwasser, Ruzica Piskac

机构 * Yale University, USA(耶鲁大学) EPFL, Switzerland(瑞士联邦理工学院) George Mason University, USA(乔治·梅onn大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 提出 Bitween 框架自动学习随机自归约(RSR),通过线性回归、遗传编程等后端和 LLM 代理,在 80 个函数中分别发现 54% 和 80% 的 RSR,包括首个 sigmoid 归约。

Comments Accepted at ICML 2026 (Spotlight). 9 pages main text + appendix

Journal ref Proceedings of the 43rd International Conference on Machine Learning, PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03373 2026-06-04 cs.CL 81%

WETBench: A Benchmark for Detecting Task-Specific Machine-Generated Text on Wikipedia

WETBench:用于检测维基百科上特定任务机器生成文本的基准

Gerrit Quaremba, Elizabeth Black, Denny Vrandečić, Elena Simperl

机构 * King’s College London(伦敦国王学院) Wikimedia Foundation(维基媒体基金会)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出WETBench,一个多语言、多生成器、任务特定的基准,用于检测维基百科编辑场景下的机器生成文本,实验表明训练型检测器平均准确率78%,零样本检测器平均58%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04438 2026-06-04 cs.LG cs.AI 81%

LoopMoE: Unifying Iterative Computation with Mixture-of-Experts for Language Modeling

LoopMoE:统一迭代计算与混合专家模型用于语言建模

Wenkai Chen, Tianshu Li, Wenyong Huang, Yichun Yin, Lifeng Shang, Chengwei Qin

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Huawei Technologies Co.,Ltd.(华为技术有限公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出LoopMoE,通过迭代自适应层归一化和容量平衡策略,在相同参数和FLOPs下,循环MoE语言模型在多个基准上优于标准MoE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12433 2026-06-04 cs.CV cs.AI cs.LG 81%

Revisiting Model Stitching In the Foundation Model Era

重新审视基础模型时代的模型拼接

Zheda Mai, Ke Zhang, Fu-En Wang, Zixiao Ken Wang, Albert Y. C. Chen, Lu Xia, Min Sun, Wei-Lun Chao, Cheng-Hao Kuo

机构 * The Ohio State University(俄亥俄州立大学) Boston University(波士顿大学) Amazon(亚马逊)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过系统协议研究视觉基础模型(如CLIP、DINOv2、SigLIP 2)的可拼接性,提出基于目标模型倒数第二层特征匹配损失的拼接方法,并构建VFM拼接树(VST)实现多模态大模型中多个VFM的准确率-延迟权衡。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04580 2026-06-04 cs.CR 80%

TIBlender: Early-Warning Threat Intelligence from Cross-Platform Social Media Evidence

TIBlender:来自跨平台社交媒体证据的早期预警威胁情报

Hiroki Nakano, Takashi Koide, Daiki Chiba

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出多智能体系统TIBlender,通过角色专业化LLM代理整合四个社交媒体平台的威胁信号,生成结构化威胁情报报告,在真实部署中提前检测到所有四类威胁,且大多数IoC未被现有情报源覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05161 2026-06-04 cs.SD cs.CL 79%

Beyond Text Following: Repairable Arbitration Reversals in Audio-Language Models

超越文本跟随:音频-语言模型中的可修复仲裁反转

Yichen Gao, Yiqun Zhang, Zijing Wang, Yujia Li, Heng Guo, Xi Wu, Xiaocui Yang, Shi Feng, Yifei Zhang, Daling Wang

机构 * Northeastern University, China(东北大学) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文通过同音频反事实实验发现,音频-语言模型在冲突任务中常因文本主导而忽略音频证据,并提出无训练解码规则GACL,通过插值联合分数与同音频分数来修复仲裁反转,显著提升忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05087 2026-06-04 cs.CL 79%

Light or Full Verb? A Minimal-Pair Dataset for Probing Phraseological Competence in Language Models

轻动词还是实义动词?用于探究语言模型短语能力的极小对比数据集

Francesca Franzon, Nicolas Rosàs Gómez, Leo Wanner

机构 * Universitat Pompeu Fabra (UPF)(庞培法布拉大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 通过构建极小对比数据集,探究语言模型在轻动词与实义动词用法上的区分能力,发现模型能在最小上下文中区分这两种用法,并表现出跨宾语类型的可分离模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04773 2026-06-04 cs.CV cs.CL 79%

NextMotionQA: Benchmarking and Judging Human Motion Understanding with Vision-Language Models

NextMotionQA: 使用视觉语言模型基准测试和评判人体运动理解

Yong Cao, Chuqiao Li, Xianghui Xie, Gerard Pons-Moll, Andreas Geiger

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学院) Saarland Informatics Campus(萨尔兰州信息学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 提出NextMotionQA基准,通过三项互补任务和多粒度难度分层,系统评估视觉语言模型在人体运动理解中的能力,并揭示其在细粒度评判中的局限性。

Comments 23 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04199 2026-06-04 cs.CL cs.LG 79%

Cross-Prompt Generalization in Detecting AI-Generated Fake News Using Interpretable Linguistic Features

使用可解释语言特征检测AI生成假新闻的跨提示泛化

Aya Vera-Jimenez, Samuel Jaeger, Calvin Ibenye, Dhrubajyoti Ghosh

机构 * Department of Mathematics(数学系) School of Data Science and Analytics(数据科学与分析学院) Department of Computer Science(计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 研究通过提取词汇多样性、可读性和情感特征,在跨提示框架下使用随机森林分类器检测AI生成假新闻,发现模型在不同提示下均表现稳定(AUC 0.988-1.000),表明这些特征可泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04792 2026-06-04 cs.CV 78%

A Pathology Foundation Model for Gastric Cancer with Real-World Validation

用于胃癌的病理基础模型及真实世界验证

Ling Liang, Jiabo Ma, Zhengyu Zhang, Fengtao Zhou, Yingxue Xu, Yihui Wang, Cheng Jin, Zhengrui Guo, On Ki Tang, Zhijian Cen, Zhen Wang, Qi Xie, Chengyu Lu, Chenglong Zhao, Feifei Wang, Yu Cai, Hongyi Wang, Jing Zhang, Yaping Ye, Shijun Sun, Shenglei Li, Yu Wang, Zhenhui Li, Ronald Cheong Kin Chan, Xiuming Zhang, Zhe Wang, Hao Chen, Li Liang

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR, China(计算机科学与工程系,香港科技大学,香港特别行政区,中国) Department of Pathology, Nanfang Hospital, Southern Medical University, Guangzhou, China(病理学系,南方医科大学南芳医院,广州,中国) Department of Pathology, School of Basic Medical Sciences, Southern Medical University, Guangzhou, China(病理学系,南方医科大学基础医学学院,广州,中国) Guangdong Province Key Laboratory of Molecular Tumor Pathology, Guangzhou, China(广东省分子肿瘤病理学重点实验室,广州,中国) Department of Anatomical and Cellular Pathology, The Chinese University of Hong Kong, Hong Kong SAR, China(解剖学与细胞病理学系,香港中文大学,香港特别行政区,中国) Pathology Artificial Intelligence Development and Assessment Laboratory, State Key Laboratory of Translational Oncology, The Chinese University of Hong Kong, Hong Kong SAR, China(病理人工智能发展与评估实验室,转化肿瘤学国家重点实验室,香港中文大学,香港特别行政区,中国)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 提出胃癌专用基础模型GRACE,基于多中心HE染色全切片图像,在28项临床任务中优于通用PFM,并通过前瞻性验证和读者研究证实其辅助诊断效能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03920 2026-06-04 cs.RO cs.HC 78%

How Users Understand Robot Foundation Model Performance through Task Success Rates and Beyond

用户如何通过任务成功率及其他方式理解机器人基础模型性能

Isaac Sheidlower, Jindan Huang, James Staley, Bingyu Wu, Qicong Chen, Reuben Aronson, Elaine Short

机构 * Brown University(布朗大学) Tufts University(塔夫茨大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 通过用户研究,探讨非机器人专家如何理解机器人基础模型(RFM)评估中的任务成功率(TSR)及其他信息,发现用户不仅按专家预期使用TSR,还重视未常报告的失败案例,并希望获取历史评估数据和机器人对新任务的性能估计。

Comments Submitted to IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04500 2026-06-04 cs.CL 77%

SANE Schema-aware Natural-language Evaluation of Biological Data

SANE:生物数据的模式感知自然语言评估

Rolf Gattung, Martin Krueger, Markus Reischl

机构 * Institute for Automation and Applied Informatics (IAI), Karlsruhe Institute of Technology (KIT)(自动化与应用信息研究所(IAI)、卡尔斯鲁厄理工学院(KIT))

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 提出SANE范式,通过模式感知的自动生成基准,评估少样本大语言模型在特定领域文本到SQL任务中的可靠性,发现结构化提示和约束可实现准确查询生成。

Comments 5 pages, 3 figures, submitted but not yet reviewed by BMT2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03318 2026-06-04 cs.CL 77%

Beyond Ideal Instruction: A Comprehensive Framework for Evaluating LLMs in Realistic Interactions

超越理想指令:现实交互中评估大语言模型的综合框架

Xuan Yang, Hao Xu, Tingfeng Hui, Hongsheng Xin, Kaike Zhang, Chunxiao Liu, Ning Miao

机构 * Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Hong Kong Institute of AI for Science, City University of Hong Kong(香港城市大学人工智能科学研究院) Li Auto Inc.(Li汽车公司) Beijing University of Posts and Telecommunications(北京邮电大学) Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出RUT-Bench基准,通过高保真模拟理想与非理想用户行为,评估大语言模型在现实工具调用场景中的表现,发现所有测试模型成功率低于40%且面对复杂非理想输入时性能显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10246 2026-06-04 cs.AI 77%

SciIntegrity-Bench: A Benchmark for Evaluating Academic Integrity in AI Scientist Systems

SciIntegrity-Bench:评估AI科学家系统学术诚信的基准

Zonglin Yang, Xingtong Liu, Xinyan Xu

机构 * Tongji University(同济大学) University of Tübingen(图宾根大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出SCIINTEGRITY-BENCH基准,通过困境评估范式测试7个LLM在33个场景中的学术诚信,发现整体诚信问题率达34.2%,所有模型均存在失败,其中数据缺失场景下所有模型生成合成数据而非承认不可行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12147 2026-06-04 cs.LG 77%

It's TIME: Towards the Next Generation of Time Series Forecasting Benchmarks

是时候了:迈向下一代时间序列预测基准

Zhongzheng Qiao, Sheng Pan, Anni Wang, Viktoriya Zhukova, Yong Liu, Xudong Jiang, Qingsong Wen, Mingsheng Long, Ming Jin, Chenghao Liu

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 针对现有时间序列基准在数据组成、完整性、任务设计和分析视角上的局限,提出TIME基准,包含50个新数据集和98个预测任务,采用人机协作管道确保数据完整性,并引入模式级评估视角,对12个基础模型进行多粒度排名。

Comments Accepted to ICML 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04646 2026-06-04 cs.CL cs.AI cs.IR 73%

QO-Bench: Diagnosing Query-Operator-Preserving Retrieval over Typed Event Tuples

QO-Bench: 诊断类型化事件元组上的查询操作符保持检索

Mengao Zhang, Xiang Yang, Chang Liu, Tianhui Tan, Ke-wei Huang

机构 * Asian Institute of Digital Finance, National University of Singapore(亚洲数字金融研究所,新加坡国立大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出QO-Bench基准,通过类型化事件元组上的确定性评估,诊断检索增强生成系统在查询操作符(如连接、交集)上的执行瓶颈。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04522 2026-06-04 cs.IR cs.AI cs.DB cs.LG 73%

ANN Search: Recall What Matters

ANN搜索:召回真正重要的

Dimitris Dimitropoulos, Nikos Mamoulis

机构 * University of Ioannina(伊奥尼亚大学) Archimedes, Athena RC(阿基米德,雅典RC)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出用逆近似比1/Ratio@k替代Recall@k来评估近似最近邻搜索质量,实验表明前者能更准确反映实际效用并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09853 2026-06-04 cs.CL cs.AI 73%

MedRedFlag: Investigating how LLMs Redirect Misconceptions in Real-World Health Communication

MedRedFlag:探究LLMs如何在真实健康沟通中纠正误解

Sraavya Sambara, Yuan Pu, Ayman Ali, Vishala Mishra, Lionel Wong, Monica Agrawal

机构 * Independent Researcher(独立研究者) Duke University(杜克大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过构建MedRedFlag数据集(1100+个来自Reddit的需纠正问题),系统比较了先进LLMs与临床医生的回应,发现LLMs常未能纠正问题中的错误前提,可能导致次优医疗决策,揭示了患者面向医疗AI系统的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10912 2026-06-04 cs.AI cs.CL 73%

Breaking Bad Molecules: Are MLLMs Ready for Structure-Level Molecular Detoxification?

Breaking Bad Molecules: MLLMs 是否准备好进行结构级分子解毒?

Fei Lin, Ziyang Gong, Cong Wang, Tengchao Zhang, Yonglin Tian, Yining Jiang, Ji Dai, Chao Guo, Xiaotong Yu, Xue Yang, Gen Luo, Fei-Yue Wang

机构 * Department of Engineering Science, Macau University of Science and Technology, Macau, China(澳门科学技术大学工程科学系) School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) School of Pharmacy, Macau University of Science and Technology, Macau, China(澳门科学技术大学药学院) Faculty of Electrical Engineering and Computer Science, Ningbo University, Ningbo, China(宁波大学电气与计算机科学学院) State Key Laboratory of Biopharmaceutical Preparation and Delivery, Institute of Process Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院生物制药制备与递送国家重点实验室) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, Shanghai, China(上海交通大学自动化与智能感知学院) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 ToxiMol 基准任务,利用多模态大语言模型进行分子毒性修复,并构建数据集、提示流程和自动评估框架 ToxiEval,实验表明当前模型虽面临挑战但展现出毒性理解与结构编辑的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05058 2026-06-04 cs.CV cs.AI 70%

UniCAD: A Unified Benchmark and Universal Model for Multi-Modal Multi-Task CAD

UniCAD:面向多模态多任务CAD的统一基准与通用模型

Jingyuan Chen, Sheng Jin, Haopeng Sun, Wentao Liu, Chen Qian

机构 * SenseTime Research and Tetras.AI(秒速科技研究院和Tetras.AI)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对CAD领域缺乏统一多模态基准的问题,提出UniCAD基准和UniCAD-MLLM通用多模态大语言模型,在点云到CAD重建、文本/图像到CAD生成和CAD问答等任务上实现端到端统一处理,并在多个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏