arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

共收录 10296
2605.24850 2026-05-26 cs.CL cs.IT math.IT stat.AP

Repeated Sequences Reveal Gaps between Large Language Models and Natural Language

重复序列揭示大语言模型与自然语言之间的差距

Kumiko Tanaka-Ishii

机构 * Waseda University(早稻田大学)

AI总结 通过分析重复子序列的分布及其与高阶Rényi熵的关系,提出一种评估大语言模型生成文本长程统计组织的框架,发现GPT生成文本在熵增长模式上与自然语言存在系统性差异。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24618 2026-05-26 eess.AS

FC-TTS: Style and Timbre Control in Zero-Shot Text-to-Speech with Disentangled Speech Representations

FC-TTS:基于解耦语音表示的零样本文本到语音中的风格与音色控制

Yoonhyung Lee, Hyunsin Park, Jinhwan Park, Jinkyu Lee

AI总结 提出FC-TTS框架,通过解耦语音表示和双参考条件实现风格与音色的独立控制,并引入架构、训练目标和辅助任务提升分离可靠性。

Comments Accepted to ACL 2026 (Main Conference). 20 pages, 8 figures, 7 tables. Demo page: https://qualcomm-ai-research.github.io/fc-tts

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24556 2026-05-26 cs.IR cs.CL cs.LG

The Multilingual Curse at the Retrieval Layer: Evidence from Amharic

多语言诅咒在检索层:来自阿姆哈拉语的证据

Yosef Worku Alemneh, Kidist Amde Mekonnen, Maarten de Rijke

机构 * Independent Researcher(独立研究者) University of Amsterdam(阿姆斯特丹大学)

AI总结 针对零样本多语言检索在低资源形态丰富语言(如阿姆哈拉语)上表现不佳的问题,通过对比实验发现单语检索器显著优于多语言检索器,并揭示了多语言基准测试的局限性。

Comments 10 pages, 4 tables. Accepted to the 1st Workshop on Multilinguality in the Era of Large Language Models (MeLLM) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24530 2026-05-26 cs.CL cs.CV

Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval

Unveil: 统一视觉-文本集成与蒸馏的多模态文档检索

Hao Sun, Yingyan Hou, Jiayan Guo, Bo Wang, Chunyu Yang, Jinsong Ni, Yan Zhang

机构 * State Key Laboratory of General Artificial Intelligence, Peking University(北京理工大学通用人工智能国家重点实验室) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) Key Laboratory of Target Cognition and Application Technology(目标认知与应用技术重点实验室) Beijing Institute of Technology(北京理工大学) Ucap Cloud(Ucap云)

AI总结 提出Unveil框架,通过视觉-文本嵌入和知识蒸馏实现鲁棒的文档检索,兼顾布局与语义信息。

Comments ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07647 2026-05-26 cs.CL cs.AI

Quality-Conditioned Agreement in Automated Short Answer Scoring: Mid-Range Degradation and the Impact of Task-Specific Adaptation

自动简答题评分中的质量条件一致性:中等范围退化与任务特定适应的影响

Abigail Victoria Gurin Schleifer, Moriah Ariely, Beata Beigman Klebanov, Asaf Salman, Giora Alexandron

机构 * Weizmann Institute of Science(魏茨曼科学研究院) ETS(教育考试服务中心)

AI总结 研究自动简答题评分中不同模型的任务适应程度与质量条件评分一致性的关系,发现所有AI模型在完全正确和完全错误的回答上表现良好,但在中等范围回答上出现显著退化,且退化程度与任务特定数据量相关。

Comments PRE-PRINT VERSION Accepted to ACL 21st Workshop on Innovative Use of NLP for Building Educational Applications (BEA26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11173 2026-05-26 cs.CL

Author-in-the-Loop Response Generation and Evaluation: Integrating Author Expertise and Intent in Responses to Peer Review

作者参与的回信生成与评估:将作者专业知识和意图整合到对同行评审的回复中

Qian Ruan, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab)(通用知识处理实验室) Department of Computer Science(计算机科学系) Hessian Center for AI (hessian.AI)(海德堡人工智能中心)

AI总结 提出作者参与的回信生成与评估框架,通过引入对齐的评审-回复-修订三元组数据集、支持灵活作者输入和可控生成的REspGen系统以及包含20+指标的综合评估套件REspEval,填补了作者信号利用和评估的空白。

Comments accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24489 2026-05-26 cs.AI q-bio.BM

TIGER: Text-Informed Generalized Enzyme-Reaction Retrieval

TIGER:文本引导的通用酶-反应检索

Yuhang Zhang, Keyan Ding, Peilin Chen, Han Liu, Can Lin, Ruixi Chen, Shiqi Wang, Qi Song

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

AI总结 提出TIGER框架,利用蛋白质到文本生成模型提取文本语义知识,通过动态门控网络融合序列特征,实现酶与反应的双向检索,显著提升跨任务泛化性和鲁棒性。

Comments Accepted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24267 2026-05-26 cs.CL

DRInQ: Evaluating Conversational Implicature with Controlled Context Variation

DRInQ: 通过受控上下文变化评估会话含义

Hirona Jacqueline Arai, Xiang Ren

机构 * University of Southern California(南加州大学)

AI总结 提出DRInQ基准,通过半自动化管道生成系统变化的问答上下文实例,评估大语言模型在会话含义中的语用推理能力,发现模型在生成与推理之间存在不对称性。

Comments To be presented at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24247 2026-05-26 cs.CL cs.AI

Improving Labeling Consistency with Detailed Constitutional Definitions and AI-Driven Evaluation

通过详细的宪法定义和AI驱动的评估提高标注一致性

Konstantin Berlin, Adam Swanda

机构 * Cisco AI Defense(思科AI防御)

AI总结 提出一种AI驱动的工作流,通过为每个类别编写详细的宪法定义并由前沿LLM解释,以比人类更一致和准确地生成黄金标签,在三个内容审核类别上将跨模型不一致性降低高达57倍。

Comments Under review at ACL Rolling Review (ARR), May 2026 cycle. Also available at https://doi.org/10.5281/zenodo.20125267

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24018 2026-05-26 cs.AI cs.MA

EvoSci: A Bio-Inspired Multi-Agent Framework for the Evolution of Scientific Discovery

EvoSci: 一种受生物启发的多智能体框架用于科学发现的演化

Xiaoyu Xiong, Yuqi Ren, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院 TJUNLP 实验室)

AI总结 提出EvoSci框架,结合生物启发式演化与知识图谱建模,通过多角色智能体协作迭代生成、评估和优化研究想法,显著提升科学探索的连贯性和创造力。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23932 2026-05-26 cs.AI cs.CL cs.CY cs.LG

When Correct Beliefs Collapse: Epistemic Resilience of LLMs under Clinical Pressure

当正确信念崩溃:LLMs在临床压力下的认知韧性

Boyu Xiao, Xiuqi Tian, Xuwen Song, Haochun Wang, Guanchun Song, Sendong Zhao, Bing Qin

机构 * Research Center for Social Computing and Interactive Robotics, Harbin Institute of Technology, China(社会计算与交互机器人研究院,哈尔滨工业大学,中国)

AI总结 研究LLMs在临床对话中面对逐步升级压力时信念稳定性问题,提出Med-Stress压力测试框架,发现知识-韧性差距,并设计RBED和R-FT方法提升鲁棒性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23721 2026-05-25 cs.CL

Is a Document Educational or Just Wikipedia-Style? -- Pitfalls of Classifier-Based Quality Filtering

文档是教育性的还是维基风格的?——基于分类器的质量过滤的陷阱

Mateusz Klimaszewski, Piotr Andruszkiewicz

机构 * Warsaw University of Technology(华沙技术大学) IDEAS Research Institute(IDEAS研究所)

AI总结 本文揭示了基于分类器的质量过滤方法中一个关键漏洞:简单的维基风格重格式化操作可显著改变模型的质量评估,使低质量内容通过过滤阈值,并量化了FineWeb-Edu CQF模型约7%文档的过滤决策反转。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23261 2026-05-25 eess.AS cs.SD

UniSRM: A Unified Speech Reward Model for Reasoning-Based Fine-grained Assessment

UniSRM:一种用于基于推理的细粒度评估的统一语音奖励模型

Yuanyuan Wang, Dongchao Yang, Yayue Deng, Zhiyong Wu, Yiwen Guo, Helen Meng, Xixin Wu

机构 * The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Independent Researcher(独立研究者)

AI总结 提出UniSRM统一语音奖励模型,通过两阶段流水线和推理一致性奖励机制,实现多维度、可解释的语音质量评估,在多种任务上优于现有方法。

Comments Accepted by ACL 2026(Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23069 2026-05-25 cs.CL

DFKI-MLT at SemEval-2026 TASK 7: Steering Multilingual Models Towards Cultural Knowledge

DFKI-MLT 在 SemEval-2026 任务 7 中:将多语言模型引导至文化知识

Yusser Al Ghussin, Daniil Gurgurov, Yasser Hamidullah, Josef van Genabith, Cristina España-Bonet, Simon Ostermann

机构 * German Research Center for Artificial Intelligence (DFKI GmbH)(德国人工智能研究中心(DFKI GmbH)) Saarland Informatics Campus(萨尔布吕肯信息学校区) Barcelona Supercomputing Center (BSC-CNS)(巴塞罗那超级计算中心(BSC-CNS))

AI总结 本研究提出使用从并行 FLORES 数据中提取的语言向量进行激活引导,在推理时调整多语言模型以提升文化知识,并在 SemEval-2026 任务 7 的 MCQ 赛道上取得 86.96% 准确率,排名第 7。

Comments Accepted to The 20th International Workshop on Semantic Evaluation at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23052 2026-05-25 cs.CL cs.AI

DreamerNLplus: Interpretable Modeling of Mental Health Dynamics from Social Media Timelines using Hybrid Rule-Based and RAG Methods

DreamerNLplus: 使用混合规则和RAG方法从社交媒体时间线进行可解释的心理健康动态建模

Maryia Zhyrko, Daisy Monika Lal, Erik van Mulligen, Lifeng Han

机构 * Leiden Institute of Advanced Computer Science (LIACS), Leiden University(莱顿高级计算机科学研究所(LIACS),莱顿大学) School of Computing and Communications (SCC), Lancaster University(计算与通信学院(SCC),兰卡斯特大学) Department of Medical Informatics, Erasmus University Medical Center Rotterdam(医学信息学系,埃因霍温医学中心鲁特万分校) Biomedical Data Sciences, Leiden University Medical Center(生物医学数据科学,莱顿大学医学中心)

AI总结 提出DreamerNLplus混合框架,结合规则与RAG方法,解决CLPsych 2026共享任务中的心理状态建模、时间变化检测和序列级总结问题。

Comments Accepted by CLPsych2026. CLPsych 2026 will be held at ACL in San Diego July 4th, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23036 2026-05-25 cs.CL

Multilingual Steering by Design: Multilingual Sparse Autoencoders and Principled Layer Selection

通过设计实现多语言引导:多语言稀疏自编码器与原则性层选择

Yusser Al Ghussin, Daniil Gurgurov, Tanja Baeumel, Josef van Genabith, Patrick Schramowski, Simon Ostermann

机构 * Saarland University(萨尔兰大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) TU Darmstadt(德累斯顿技术大学) Centre for European Research in Trusted AI (CERTAIN)(欧洲可信AI研究中心)

AI总结 针对稀疏自编码器在多语言环境中语言控制不可靠的问题,提出在多语言数据上训练SAE并基于多语言对齐与语言可分离性交集的原则性层选择规则,在LLaMA-3.1-8B和Gemma-2-9B上验证了该方法能稳定语言识别准确率与生成质量之间的权衡。

Comments Accepted to TrustNLP Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20201 2026-05-25 cs.CL cs.AI cs.LG

Long-Context Reasoning Through Proxy-Based Chain-of-Thought Tuning

基于代理思维链调优的长上下文推理

Miao Li, Irina Saparina, Alexander Gurung, Mirella Lapata

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

AI总结 提出ProxyCoT训练框架,通过将短代理上下文中的推理能力迁移到完整长上下文中,以提升大语言模型在长上下文复杂推理任务上的表现。

Comments Long paper, ACL 2026 (Main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21889 2026-05-25 cs.CL cs.AI cs.LG

TingIS: Real-time Risk Event Discovery from Noisy Customer Incidents at Enterprise Scale

TingIS:企业级规模下从嘈杂客户事件中实时发现风险事件

Jun Wang, Ziyin Zhang, Rui Wang, Hang Yu, Peng Di, Rui Wang

机构 * Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出TingIS系统,通过多阶段事件链接引擎结合高效索引与大型语言模型,从嘈杂客户事件中稳定提取可操作事件,实现企业级实时风险发现。

Comments Accepted to ACL 2026 Industry Track (oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09349 2026-05-25 cs.CV cs.AI cs.CL

Visually-Guided Policy Optimization for Multimodal Reasoning

视觉引导的多模态推理策略优化

Zengbin Wang, Feng Xiong, Liang Lin, Xuecai Hu, Yong Wang, Yanlin Wang, Man Zhang, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里集团AMAP) SYSU(南方科技大学) BUPT(北京邮电大学)

AI总结 针对视觉语言模型在推理中视觉关注不足和时序遗忘问题,提出视觉引导策略优化(VGPO)框架,通过视觉注意力补偿机制和双粒度优势重加权策略增强视觉聚焦,提升多模态推理性能。

Comments Accepted to ACL 2026, https://github.com/wzb-bupt/VGPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19167 2026-05-25 cs.CL

Evaluating Counterfactual Strategic Reasoning in Large Language Models

评估大型语言模型中的反事实策略推理

Dimitrios Georgousis, Maria Lymperaiou, Angeliki Dimitriou, Giorgos Filandrianos, Giorgos Stamou

机构 * National Technical University of Athens(希腊雅典国家技术大学)

AI总结 通过引入反事实变体(改变收益结构和行动标签)的囚徒困境和石头剪刀布博弈,评估大型语言模型的策略表现是否基于真正的推理而非记忆模式,并揭示其在激励敏感性、结构泛化和反事实环境中的策略推理方面的局限性。

Comments Accepted at GEM@ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15224 2026-05-25 cs.CV cs.CL

PROGRESSLM: Towards Progress Reasoning in Vision-Language Models

PROGRESSLM: 迈向视觉-语言模型中的进度推理

Jianshu Zhang, Chengxuan Qian, Haosen Sun, Haoran Lu, Dingcheng Wang, Letian Xue, Han Liu

机构 * Northwestern University(西北大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

AI总结 本文提出Progress-Bench基准和ProgressLM-3B模型,通过两阶段进度推理范式,评估并提升视觉-语言模型从部分观测中推断任务进度的能力。

Comments ACL 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07849 2026-05-25 cs.CL

Evaluating Customized vs. Generalist Transformer-based Models for Legal Contract Classification

评估定制化与通用型基于Transformer的模型在法律合同分类中的表现

Amrita Singh, H. Suhan Karaca, Aditya Joshi, Hye-young Paik, Jiaojiao Jiang

机构 * School of Computer Science and Engineering University of New South Wales (UNSW), Sydney(计算机科学与工程学院 新南威尔士大学(UNSW),悉尼)

AI总结 通过对比13个法律专用和9个通用Transformer模型在三个英文合同分类任务上的表现,发现法律专用模型在需要精细法律理解的任务上持续优于通用模型,并在不平衡数据集中减少罕见类别的误分类,其中Legal-BERT和Contracts-BERT以更少参数达到新最优。

Comments Accepted to Customizable NLP at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22567 2026-05-22 cs.CL

LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance

LANG: 用于多语言推理的强化学习与语言自适应提示引导

Yuchun Fan, Bei Li, Peiguang Li, Yilin Wang, Yongyu Mu, Jian Yang, Xin Chen, Rongxiang Weng, Jingang Wang, Xunliang Cai, Jingbo Zhu, Tong Xiao

机构 * NLP Lab, School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院自然语言处理实验室) Meituan Inc.(美团公司) NiuTrans Research, Shenyang, China(牛译研所)

AI总结 本文提出LANG框架,通过语言条件提示引导非英语推理任务的探索,解决了多语言环境下强化学习在输入语言一致性与推理质量之间的权衡问题,提升了推理性能而不影响语言一致性。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22205 2026-05-22 cs.AI cs.LG

Skill Weaving: Efficient LLM Improvement via Modular Skillpacks

技能编织:通过模块化技能包实现高效的LLM改进

Zhuo Li, Guodong Du, Zesheng Shi, Weiyang Guo, Weijun Yao, Yuan Zhou, Jiabo Zhang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) The Hong Kong Polytechnic University(香港理工大学) Huawei Technologies Co., Ltd.(华为技术有限公司) Shanghai Jiaotong University(上海交通大学)

AI总结 本研究提出SkillWeave框架,通过模块化技能包使LLM在固定内存预算下实现领域专业化,通过SkillZip压缩技术实现高效部署,实验表明其在多任务和代理基准上表现优异,速度提升达4倍。

Comments Accepted by ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22175 2026-05-22 cs.SE cs.AI

SWE-Mutation: Can LLMs Generate Reliable Test Suites in Software Engineering?

SWE-Mutation:LLMs能否在软件工程中生成可靠的测试套件?

Yuxuan Sun, Yuze Zhao, Yufeng Wang, Yao Du, Zhiyuan Ma, Jinbo Wang, Mengdi Zhang, Kai Zhang, Zhenya Huang

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) Beihang University(北航) School of Mathematical Sciences, Peking University(北京大学数学科学学院) NeoShell AI Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

AI总结 本文提出SWE-Mutation基准,用于评估LLM生成的测试套件质量,通过系统性地变异解决方案来测试测试套件的可靠性,并发现当前LLM在生成可靠且具有判别力的测试套件方面存在不足。

Comments 24 pages, 8 figures

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28177 2026-05-22 cs.CV cs.CY

AEGIS: A Holistic Benchmark for Evaluating Forensic Analysis of AI-Generated Academic Images

AEGIS:一个评估人工智能生成学术图像取证分析的综合基准

Bo Zhang, Tzu-Yen Ma, Zichen Tang, Junpeng Ding, Zirui Wang, Yizhuo Zhao, Peilin Gao, Zijie Xi, Zixin Ding, Haiyang Sun, Haocheng Gao, Yuan Liu, Liangjia Wang, Yiling Huang, Yujie Wang, Yuyue Zhang, Ronghui Xi, Yuanze Li, Jiacheng Liu, Zhongjun Yang, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 本文提出AEGIS基准,通过七个学术类别和39个细粒度子类型覆盖,揭示了人工智能生成学术图像取证分析的内在难度,同时评估了多种模型在检测、推理和定位方面的性能,揭示了不同模型家族的互补优势。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05094 2026-05-22 cs.CV

VChain: Chain-of-Visual-Thought for Reasoning in Video Generation

VChain:用于视频生成中推理的视觉思维链

Ziqi Huang, Ning Yu, Gordon Chen, Haonan Qiu, Paul Debevec, Ziwei Liu

机构 * eyeline-labs(Eyeline Labs)

AI总结 本文提出VChain,一种在视频生成中引入多模态模型视觉推理信号的新型推理时间视觉思维链框架,通过生成关键帧来指导预训练视频生成器的稀疏推理时间视觉状态适应,从而提升视频生成质量。

Comments ACL 2026 (Findings Paper), ICCV 2025 Workshop Outstanding Paper Award, Project page: https://eyeline-labs.github.io/VChain

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17123 2026-05-22 cs.CL

MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation

MTR-Bench:多轮推理评估的综合性基准

Xiaoyuan Li, Keqin Bao, Yubo Ma, Moxin Li, Wenjie Wang, Rui Men, Yichang Zhang, Fuli Feng, Dayiheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

AI总结 本文提出MTR-Bench,一个包含4类、40个任务和3600个实例的综合性基准,用于评估大型语言模型的多轮推理能力,通过自动化框架实现大规模评估,并揭示了当前先进推理模型在多轮交互任务中的不足。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05406 2026-05-22 cs.CL

Frame In, Frame Out: Measuring Framing Bias in LLM-Generated News Summaries

框入框出:衡量LLM生成新闻摘要中的框架偏差

Valeria Pastorino, Nafise Sadat Moosavi

机构 * Department of Computer Science University of Sheffield (UK)(计算机科学系谢菲尔德大学(英国))

AI总结 本文提出FIFO基准测试,用于衡量LLM生成的新闻摘要中的框架存在性,发现LLM生成的摘要在科学和公共卫生领域显示出较高的框架率,表明框架是摘要质量的一个被忽视但重要的维度。

Comments Accepted to The 15th Joint Conference on Lexical and Computational Semantics (*SEM 2026) co-located with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21491 2026-05-22 cs.LG cs.AI cs.CL

Teaching Language Models to Forecast Research Success Through Comparative Idea Evaluation

通过比较想法评估教授语言模型预测研究成功的技巧

Srujan P Mule, Aniketh Garikaparthi, Manasi Patwardhan

机构 * IISER Pune(印度理工学院帕内尔)

AI总结 本研究探讨了语言模型能否在无需实验的情况下预测研究想法的实证成功,通过构建基于PapersWithCode客观结果的11488对想法数据集,发现通过强化学习可提升模型性能至71.35%,证明小型语言模型可以作为有效的客观验证器,为自主科学发现提供可扩展路径。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏