arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-20 至 2026-03-20 共收录 263 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 66 篇

2510.10846 2026-03-20 cs.CL 79%

DUAL-Bench: Measuring Over-Refusal and Robustness in Vision-Language Models

DUAL-Bench: 测量视觉语言模型中的过度拒绝与鲁棒性

Kaixuan Ren, Preslav Nakov, Usman Naseem

机构 * Macquarie University(麦考瑞大学) MBZUAI(马克斯·普朗克智能系统研究所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文提出DUAL-Bench,通过评估18种VLM在12类危险场景下的表现,揭示模型在双重使用场景中的脆弱安全边界,强调安全完成与过度拒绝的平衡需求。

Comments 26pages, 13 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18300 2026-03-20 cs.HC cs.AI cs.CY cs.IR cs.LG 79%

Auditing Preferences for Brands and Cultures in LLMs

对LLM中品牌和文化偏好的审计

Jasmine Rienecker, Katarina Mpofu, Naman Goel, Siddhartha Datta, Jun Zhao, Oscar Danielsson, Fredrik Thorsen

机构 * University of Oxford(牛津大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ChoiceEval框架,用于审计LLM中品牌和文化偏好,通过生成多样化查询和量化偏好指标,揭示模型在不同主题上的系统性偏好差异。

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18161 2026-03-20 cs.CL cs.AI 79%

How LLMs Distort Our Written Language

大语言模型如何扭曲我们的书面语言

Marwa Abdulhai, Isadora White, Yanming Wan, Ibrahim Qureshi, Joel Leibo, Max Kleiman-Weiner, Natasha Jaques

机构 * UC Berkeley(加州大学伯克利分校) UC San Diego(加州大学圣地亚哥分校) University of Washington(华盛顿大学) Zaytuna College(扎亚图纳学院) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示大语言模型不仅改变写作语气,还持续改变写作本意,通过用户研究和数据集分析发现,即使在专家反馈下,LLM仍会显著改变文本语义,影响科学机构和文化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18010 2026-03-20 cs.CL cs.AI cs.CY 79%

Agentic Framework for Political Biography Extraction

政治传记提取的代理框架

Yifei Zhu, Songpo Yang, Jiangnan Zhu, Junyan Jiang

机构 * Department of Politics and Public Administration, The University of Hong Kong(政治与公共行政系,香港大学) School of International Studies, Peking University(国际关系学院,北京大学) Department of Political Science, Columbia University(政治学系,哥伦比亚大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种两阶段的合成-编码框架,利用大语言模型自动化提取多维精英传记,提升政治科学研究的效率和准确性。

Comments 70 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10294 2026-03-20 cs.CV q-bio.TO 78%

MIPHEI-ViT: Multiplex Immunofluorescence Prediction from H&E Images using ViT Foundation Models

MIPHEI-ViT:基于H&E图像的多重免疫荧光预测方法

Guillaume Balezo, Roger Trullo, Albert Pla Planas, Etienne Decenciere, Thomas Walter

机构 * Digital R&D, Sanofi(桑福数字研发部) Center for Computational Biology (CBIO) Mines Paris - PSL(计算生物学中心(CBIO)巴黎 Mines-PSL) Center for Statistics and Images (STIM) Mines Paris - PSL(统计与图像中心(STIM)巴黎 Mines-PSL) Institut Curie, INSERM, U1331(curie研究所,INSERM,U1331) InstaDeep

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出MIPHEI-ViT模型,利用预训练的ViT基础模型从H&E图像预测多重免疫荧光信号,通过丰富的预训练表示实现细胞类型分类,验证结果在多个数据集上均优于基线模型。

Comments Accepted manuscript, 24 pages, 9 figures, 5 tables. Published in Computers in Biology and Medicine (DOI: https://doi.org/10.1016/j.compbiomed.2026.111564)

Journal ref Computers in Biology and Medicine, vol. 206, 2026, 111564

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18465 2026-03-20 cs.CV 78%

MedQ-UNI: Toward Unified Medical Image Quality Assessment and Restoration via Vision-Language Modeling

MedQ-UNI: 向通过视觉-语言建模实现医学图像质量评估与修复的统一迈进

Jiyao Liu, Junzhi Ning, Wanying Qu, Lihao Liu, Chenglong Ma, Junjun He, Ningsheng Xu

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出MedQ-UNI,一种统一的视觉-语言模型,通过先评估再修复的范式,利用医学图像质量评估指导医学图像修复,实现了跨模态和降质类型的统一处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18119 2026-03-20 eess.IV 78%

Dual Agreement Consistency Learning with Foundation Models for Semi-Supervised Fetal Heart Ultrasound Segmentation and Diagnosis

双同意见一致性学习与基础模型在半监督胎儿心脏超声分割与诊断中的应用

Fangyijie Wang, Guénolé Silvestre, Kathleen M. Curran

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出FM-DACL框架,结合预训练超声基础模型与卷积网络,通过异质协同训练和指数移动平均教师,提升低标注胎儿心脏超声分析的可行性,实验显示Dice分数达59.66,NSD为42.82。

Comments Accepted to the ISBI 2026 Fetal HearT UltraSound Segmentation and Diagnosis (FETUS) Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18415 2026-03-20 cs.MM cs.CV 78%

DuoTeach: Dual Role Self-Teaching for Coarse-to-Fine Decision Coordination in Vision--Language Models

DuoTeach: 视觉-语言模型中粗到细决策协调的双角色自教学

Wei Yang, Yiran Zhu, Zilin Li, Xunjia Zhang, Jun Xia, Hongtao Wang

机构 * Department of Computer, North China Electric Power University, Baoding, China(华北电力大学计算机学院) AIMS Lab, HKUST (GZ), Guangzhou, China(香港科技大学(广州)人工智能实验室) HKUST, Hong Kong SAR, China(香港科技大学) School of Information and Intelligent Science, Donghua University, Shanghai, China(东华大学信息与智能科学学院)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出DuoTeach框架,通过双角色自教学提升视觉-语言模型在粗到细决策协调中的性能,改进领域内DWPA指标并提升零样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18894 2026-03-20 cs.AI cs.MA 77%

I Can't Believe It's Corrupt: Evaluating Corruption in Multi-Agent Governance Systems

我难以相信它腐败了:评估多智能体治理系统中的腐败

Vedanta S P, Ponnurangam Kumaraguru

机构 * IIIT Kottayam(科瓦亚姆理工学院) IIIT Hyderabad(海得拉巴理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过多智能体治理模拟评估机构AI的腐败问题,发现治理结构比模型身份更影响腐败结果,强调机构设计对安全委托的重要性。

Comments Short Paper, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18418 2026-03-20 cs.CV cs.AI 77%

Mind the Rarities: Can Rare Skin Diseases Be Reliably Diagnosed via Diagnostic Reasoning?

注意罕见病:罕见皮肤疾病能否通过诊断推理可靠诊断?

Yang Liu, Jiyao Yang, Hongjin Zhao, Xiaoyong Li, Yanzhe Ji, Xingjian Li, Runmin Jiang, Tianyang Wang, Saeed Anwar, Dongwoo Kim, Yue Yao, Zhenyue Qin, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Australian National University(澳大利亚国立大学) University of Western Australia(西澳大学) POSTECH Yale University(耶鲁大学)

专题命中 评测与基准 :language model(abstract);instruction tuning(abstract);preference optimization(abstract);分类 cs.AI

AI总结 本文提出DermCase基准,通过多模态数据评估罕见皮肤疾病诊断推理能力,揭示现有模型在诊断准确性和临床推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18173 2026-03-20 cs.CL 77%

GRAFITE: Generative Regression Analysis Framework for Issue Tracking and Evaluation

GRAFITE:用于问题跟踪和评估的生成回归分析框架

Ja Young Lee, Mírian Silva, Mohamed Nasr, Shonda Witherspoon, Enzo Bozzani, Veronique Demers, Radha Ratnaparkhi, Hui Wu, Sara Rosenthal

机构 * IBM Research - AI(IBM人工智能研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 GRAFITE通过持续评估平台追踪和评估模型问题,利用LLM作为裁判进行质量测试,支持多模型对比和回归检测。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19059 2026-03-20 cs.CV 75%

SignAgent: Agentic LLMs for Linguistically-Grounded Sign Language Annotation and Dataset Curation

SignAgent:用于语言学基础的手语标注和数据集整理的代理LLM

Oliver Cory, Ozge Mercanoglu Sincan, Richard Bowden

机构 * Centre for Vision, Speech and Signal Processing(视觉、语音和信号处理中心)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出SignAgent,一种利用大语言模型进行可扩展、语言学基础的手语标注和数据集整理的新框架。通过SignAgent协调器和SignGraph,解决传统方法和手动标注的瓶颈,实现大规模语言感知数据标注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18005 2026-03-20 cs.IR 75%

Negative Sampling Techniques in Information Retrieval: A Survey

信息检索中的负采样技术:综述

Laurin Wischounig, Abdelrahman Abdallah, Adam Jatowt

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文综述了密集信息检索中负采样技术,探讨了随机、静态/动态挖掘及合成数据集等方法,并分析了效果、计算成本和实现难度之间的权衡。

Comments Accepted at findings EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04904 2026-03-20 cs.HC 75%

Toward Scalable Patient Safety Training: A Prototype for Root Cause Analysis Simulation With AI Virtual Avatars

迈向可扩展的患者安全培训:一种基于AI虚拟仿真的根因分析原型

Yuqi Hu, Qiwen Xiong, Zhenzhen Qin, Brandon Watanabe, Yujing Wang, Mirjana Prpa, Ilmi Yoon

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种AI驱动的仿真平台,通过根因分析模拟提升患者安全培训的可扩展性,利用虚拟角色和AI技术实现沉浸式学习,降低培训成本。

Comments This works has been accepted at the 2026 IEEE Conference on Artificial Intelligence, where a revised version of this work will be published

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18753 2026-03-20 cs.CV 71%

CrossHOI-Bench: A Unified Benchmark for HOI Evaluation across Vision-Language Models and HOI-Specific Methods

CrossHOI-Bench: 一个统一的HOI评估基准,涵盖视觉-语言模型和特定HOI方法

Qinqian Lei, Bo Wang, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学) University of Mississippi(密西西比大学) ASUS Intelligent Cloud Services(ASUS智能云服务)

专题命中 评测与基准 :language model(title)

AI总结 本文提出CrossHOI-Bench,通过显式正例和 curated 负例,统一评估VLM和HOI方法,揭示两者在多任务和细粒度交互上的互补优劣。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18343 2026-03-20 cs.CV 71%

VISTA: Validation-Guided Integration of Spatial and Temporal Foundation Models with Anatomical Decoding for Rare-Pathology VCE Event Detection

VISTA:基于解剖解码的时空基础模型验证引导整合用于罕见病理VCE事件检测

Bo-Cheng Qiu, Yu-Fan Lin, Yu-Zhe Pien, Chia-Ming Lee, Fu-En Yang, Yu-Chiang Frank Wang, Chih-Chung Hsu

机构 * National Cheng Kung University(国立成功大学) National Yang Ming Chiao Tung University(国立阳明交通大学) NVIDIA

专题命中 评测与基准 :foundation model(title)

AI总结 本文提出VISTA方法,通过整合时空基础模型与解剖解码,提升罕见病理事件检测的准确性,实验显示其在隐藏测试集上达到较高的mAP指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18750 2026-03-20 cs.CL 70%

Automatic detection of Gen-AI texts: A comparative framework of neural models

自动检测生成式人工智能文本:神经网络模型的比较框架

Cristian Buttaro, Irene Amerini

机构 * Sapienza University in Rome(罗马萨皮恩扎大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文设计并评估了多种机器学习检测器,通过比较不同神经网络架构在多语言和领域中的性能,揭示了监督检测器在稳定性与鲁棒性上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18729 2026-03-20 cs.AI 70%

Analysis Of Linguistic Stereotypes in Single and Multi-Agent Generative AI Architectures

单Agent和多Agent生成式AI架构中语言刻板印象的分析

Martina Ullasci, Marco Rondina, Riccardo Coppola, Flavio Giobergia, Riccardo Bellanca, Gabriele Mancari Pasi, Luca Prato, Federico Spinoso, Silvia Tagliente

机构 * Politecnico di Torino(托斯卡纳理工学院)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 本文分析了生成式AI在单Agent和多Agent架构中对不同方言的刻板印象生成,探讨了通过提示工程和多Agent架构缓解偏见的效果,发现不同模型在刻板印象表现上存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18614 2026-03-20 cs.AI 70%

ZEBRAARENA: A Diagnostic Simulation Environment for Studying Reasoning-Action Coupling in Tool-Augmented LLMs

ZEBRAARENA:一种用于研究工具增强大语言模型中推理-动作耦合的诊断模拟环境

Wanjia Zhao, Ludwig Schmidt, James Zou, Vidhisha Balachandran, Lingjiao Chen

机构 * Stanford University(斯坦福大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ZEBRAARENA通过可控难度和知识最小化设计,研究工具增强大语言模型中的推理-动作耦合,强调深度推理与精准工具调用的结合,揭示理论最优与实际工具使用间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15030 2026-03-20 cs.AI 70%

VTC-Bench: Evaluating Agentic Multimodal Models via Compositional Visual Tool Chaining

VTC-Bench:通过组合视觉工具链评估代理多模态模型

Xuanyu Zhu, Yuhao Dong, Rundong Wang, Yang Shi, Zhipeng Wu, Yinlun Peng, YiFan Zhang, Yihang Lou, Yuanxing Zhang, Ziwei Liu, Yan Bai, Yuan Zhou

机构 * PKU(北京大学) NTU(国立台湾大学) USTC(中国科学技术大学) CQU(重庆大学) NUDT(南京理工大学) CASIA(中国科学院自动化研究所) Meituan(美团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 VTC-Bench通过组合视觉工具链评估多模态大语言模型的工具使用能力,揭示了当前模型在复杂任务中适应性和多工具组合方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08890 2026-03-20 cs.CL 70%

PlainQAFact: Retrieval-augmented Factual Consistency Evaluation Metric for Biomedical Plain Language Summarization

PlainQAFact: 用于生物医学平白语言摘要的检索增强事实一致性评估指标

Zhiwen You, Yue Guo

机构 * School of Information Sciences, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PlainQAFact,一种针对生物医学平白语言摘要中详尽解释的事实一致性评估指标,通过检索增强的问答方法,有效评估源简化和详尽解释句子的事实一致性。

Comments Accepted by Journal of Biomedical Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18253 2026-03-20 cs.CL 70%

Enhancing Multi-Label Emotion Analysis and Corresponding Intensities for Ethiopian Languages

增强埃塞俄比亚语言的多标签情感分析及相应强度

Tadesse Destaw Belay, Dawit Ketema Gete, Abinew Ali Ayele, Olga Kolesnikova, Iqra Ameer, Grigori Sidorov, Seid Muhie Yimam

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过扩展EthioEmo数据集,加入情感强度标注,评估了基于编码器的预训练语言模型在多标签情感分类中的表现,发现非洲中心模型在情感理解中表现更优。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19217 2026-03-20 cs.CV 67%

LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs

LVOmniBench:开创性长音频视频理解评估用于多模态大语言模型

Keda Tao, Yuhua Zheng, Jia Xu, Wenjie Du, Kele Shao, Hesong Wang, Xueyi Chen, Xin Jin, Junhan Zhu, Bohan Yu, Weiqiang Wang, Jian Liu, Can Qin, Yulun Zhang, Ming-Hsuan Yang, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) University of California Merced(加州大学默塞德分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 LVOmniBench旨在评估多模态大语言模型在长音频视频中的跨模态理解能力,通过275个10至90分钟的高质量视频和1014个问题-答案对,揭示当前模型在处理长形式输入时的挑战。

Comments Project page: https://kd-tao.github.io/LVOmniBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19166 2026-03-20 cs.RO cs.AI cs.CL cs.CV cs.LG 67%

Meanings and Measurements: Multi-Agent Probabilistic Grounding for Vision-Language Navigation

含义与测量:多智能体概率性视觉语言导航

Swagat Padhan, Lakshya Jain, Bhavya Minesh Shah, Omkar Patil, Thao Nguyen, Nakul Gopalan

机构 * Arizona State University(亚利桑那州立大学) Haverford College(哈弗福德学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MAPG框架,通过分解语言查询并利用VLM进行语义 grounding,解决复杂度量-语义语言查询的难题,同时引入MAPG-Bench评估指标,展示在现实机器人中的应用效果。

Comments Equal contribution: Swagat Padhan and Lakshya Jain, 9 pages, 6 figures, paper website: https://lakshya-asu.github.io/Meanings-Measurements-Multi-Agent-Probabilistic-Grounding/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19160 2026-03-20 stat.ME stat.ML 67%

PPI is the Difference Estimator: Recognizing the Survey Sampling Roots of Prediction-Powered Inference

PPI是差额估计器:识别预测驱动推断的调查抽样根源

Reagan Mozer

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文探讨PPI推断框架与调查抽样文献中已确立的估计器的等价性,分析其在方法和贡献上的继承与创新,并呼吁两个领域更深入的整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18089 2026-03-20 cs.CV cs.AI cs.LG 62%

CytoSyn: a Foundation Diffusion Model for Histopathology -- Tech Report

CytoSyn:一种用于病理学的基准扩散模型——技术报告

Thomas Duboudin, Xavier Fontaine, Etienne Andrier, Lionel Guillou, Alexandre Filiot, Thalyssa Baiocco-Rodrigues, Antoine Olivier, Alberto Romagnoni, John Klein, Jean-Baptiste Schiratti

机构 * Owkin, Inc(Owkin公司)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CytoSyn,一种先进的潜在扩散模型,用于生成高真实性和多样性的病理H&E染色图像,通过改进方法和训练策略,对比PixCell模型,展示了对预处理细节的敏感性。

Comments 21 pages, 5 figures, tech report, model page: https://huggingface.co/Owkin-Bioptimus/CytoSyn

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18012 2026-03-20 cs.CL cs.AI cs.IR 62%

DynaRAG: Bridging Static and Dynamic Knowledge in Retrieval-Augmented Generation

DynaRAG:连接静态与动态知识的检索增强生成

Penghao Liang, Mengwei Yuan, Jianan Liu, Jing Yang, Xianyou Li, Weiran Yan, Yichao Wu

机构 * Northeastern University(东北大学) Independent Researcher(独立研究员) Washington University in St. Louis(华盛顿大学圣路易斯分校) New York University(纽约大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 DynaRAG通过动态知识整合处理静态和时效性信息需求,采用LLM重排器、充分性分类器和Gorilla v2模型提升回答准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18879 2026-03-20 cs.CL 57%

A Human-in/on-the-Loop Framework for Accessible Text Generation

面向可及性文本生成的人机协同框架

Lourdes Moreno, Paloma Martínez

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出一种融合人类参与的文本生成框架,通过人机协同机制提升生成文本的可及性,引入检查清单、触发规则和KPIs实现系统性评估与反馈。

Comments Accepted at LREC 2026. To appear in the Proceedings of the 14th International Conference on Language Resources and Evaluation (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18822 2026-03-20 cs.CL 57%

Detecting Basic Values in A Noisy Russian Social Media Text Data: A Multi-Stage Classification Framework

在噪声的俄罗斯社交媒体文本数据中检测基本价值:一种多阶段分类框架

Maria Milkova, Maksim Rudnev

机构 * Independent researcher(独立研究者) University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出一种多阶段分类框架,用于在噪声的俄语社交媒体文本中检测人类价值观,通过多阶段流程和LLM注释训练模型,最终在测试数据上达到较高的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07300 2026-03-20 cs.LG 57%

AutoResearch-RL: Perpetual Self-Evaluating Reinforcement Learning Agents for Autonomous Neural Architecture Discovery

AutoResearch-RL:持续自我评估的强化学习代理用于自主神经架构发现

Nilesh Jain, Rohit Yadav, Sagar Kotian, Claude AI

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 AutoResearch-RL通过强化学习代理持续自主发现神经网络架构和超参数,无需人工监督,通过验证位率指标优化策略,实现高效实验迭代。

Comments arXiv admin note: This submission has been withdrawn due to violation of arXiv policies for acceptable submissions

详情

展开后加载摘要…

URL PDF HTML 收藏