arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-22 至 2026-04-22 共收录 327 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 78 篇

2603.16497 2026-04-22 cs.LG cs.AI 81%

Bridging the High-Frequency Data Gap: A Millisecond-Resolution Network Dataset for Advancing Time Series Foundation Models

弥合高频数据缺口:一种毫秒级分辨率的网络数据集以推进时间序列基础模型

Subina Khanal, Seshu Tirupathi, Merim Dzaferagic, Marco Ruffini, Torben Bach Pedersen

机构 * Department of Computer Science, Aalborg University, Aalborg, Denmark(奥尔堡大学计算机科学系) IBM Research Europe, Dublin, Ireland(IBM欧洲研究院) Trinity College Dublin, The University of Dublin, Dublin, Ireland(都柏林大学三一学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个毫秒级分辨率的数据集,用于提升时间序列基础模型对高频数据的处理能力,并展示传统模型在该数据集上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05090 2026-04-22 cs.CL cs.LG 81%

Multilingual Language Models Encode Script Over Linguistic Structure

多语言语言模型编码脚本而非语言结构

Aastha A K Verma, Anwoy Chatterjee, Mehak Gupta, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度理工学院德里)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究揭示多语言模型通过表面形式而非语言结构组织表示,发现正字法影响显著,深层结构逐渐显现。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18914 2026-04-22 cs.CL cs.AI cs.LG 80%

MORPHOGEN: A Multilingual Benchmark for Evaluating Gender-Aware Morphological Generation

MORPHOGEN:一种多语言基准,用于评估性别意识的形态生成

Mehul Agarwal, Aditya Aggarwal, Arnav Goel, Medha Hira, Anubha Gupta

机构 * SBILab, Indraprastha Institute of Information Technology Delhi(SBILab,印度理工学院信息技术研究所德里)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MORPHOGEN通过构建三门语法有性语言的合成数据集,评估15种多语言大模型在性别意识形态生成任务中的表现,揭示当前模型在处理形态性别时的不足。

Comments 25 pages, accepted to ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02779 2026-04-22 cs.CV cs.AI 79%

3D Foundation Model for Generalizable Disease Detection in Head Computed Tomography

用于头部CT图像通用疾病检测的3D基础模型

Weicheng Zhu, Haoxu Huang, Huanze Tang, Rushabh Musthyala, Boyang Yu, Long Chen, Emilio Vega, Thomas O'Donnell, Seena Dehkharghani, Jennifer A. Frontera, Arjun V. Masurkar, Kara Melmed, Narges Razavian

机构 * New York University, Center for Data Science(纽约大学数据科学中心) New York University, Courant Institute of Mathematical Sciences(纽约大学Courant数学科学研究所) NYU Grossman School of Medicine, Department of Radiology(纽约大学 Grossman 医学院放射科) Siemens Healthineers(西门子医疗科技) NYU Grossman School of Medicine, Department of Neurology(纽约大学 Grossman 医学院神经病学部) NYU Grossman School of Medicine, Department of Neuroscience and Physiology(纽约大学 Grossman 医学院神经科学与生理学部) NYU Grossman School of Medicine, Neuroscience Institute(纽约大学 Grossman 医学院神经科学研究所)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出FM-CT模型,通过自监督学习在无需人工标注的情况下训练,提升头部CT图像中疾病检测的泛化能力,验证了自监督学习在医学影像中的有效性。

Comments Nature Biomedical Engineering (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19300 2026-04-22 cs.SD cs.AI 79%

HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models

HalluAudio:大型音频-语言模型中幻觉检测的综合基准

Feiyu Zhao, Yiming Chen, Wenhuan Lu, Daipeng Zhang, Xianghu Yue, Jianguo Wei

机构 * College of Intelligence and Computing, Tianjin University, China(天津大学智能计算学院) ASUS Intelligent Cloud Services, Singapore(ASUS智能云服务)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 HalluAudio是首个大规模评估语音、环境声音和音乐中幻觉的基准,包含5000多对人工验证的问答对,通过对抗性提示和混合音频条件系统诱导幻觉,评估准确率、幻觉率、偏差等,揭示了大型音频-语言模型在声音接地、时间推理和音乐属性理解上的缺陷。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18942 2026-04-22 cs.CL 79%

Disparities In Negation Understanding Across Languages In Vision-Language Models

多语言中否定理解差异在视觉-语言模型中的表现

Charikleia Moraitaki, Sarah Pan, Skyler Pulling, Gwendolyn Flusche, Kumail Alhamoud, Marzyeh Ghassemi

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 研究探讨了视觉-语言模型在不同语言中对否定理解的差异,通过多语言基准测试发现,CLIP在非拉丁文字语言表现不佳,而MultiCLIP在多语言中表现更优,SpaceVLM在部分语言中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19728 2026-04-22 cs.RO cs.AI cs.CV cs.LG cs.SE 79%

VLA Foundry: A Unified Framework for Training Vision-Language-Action Models

VLA Foundry:一种统一训练视觉-语言-动作模型的框架

Jean Mercat, Sedrick Keh, Kushal Arora, Isabella Huang, Paarth Shah, Haruki Nishimura, Shun Iwase, Katherine Liu

机构 * Toyota Research Institute(丰田研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 VLA Foundry 提供了一个统一的训练框架,整合了大语言模型、视觉语言模型和视觉-语言-动作模型的训练,支持从头训练和预训练模型,并在 LBM Eval 模拟器上评估了闭合回路策略性能。

Comments 32 pages, 16 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07995 2026-04-22 eess.SY cs.SY 78%

Trustworthiness Layer for Foundation Models in Power Systems: Application to N-k Contingency Screening

面向电力系统基础模型的可信层:应用于N-k contingency筛查

Antonio Alcántara, Spyros Chatzivasileiadis

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出一种通用可信层,为电力系统基础模型提供统计有效的预测区间,通过分层置信预测和核加权置信预测方法提升N-k contingency筛查的可靠性,减少误报并提高关键违规检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17141 2026-04-22 cs.CL 77%

SciImpact: A Multi-Dimensional, Multi-Field Benchmark for Scientific Impact Prediction

SciImpact:一个多维度、多领域的科学影响预测基准

Hangxiao Zhu, Yuyu Zhang, Ping Nie, Yu Zhang

机构 * Texas A&M University(德克萨斯A&M大学) Verdent AI University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SciImpact基准,涵盖19个领域,通过整合异构数据源评估科学影响的多维度,验证了多任务监督微调对不同模型性能的影响。

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15755 2026-04-22 cs.CL 77%

Beyond Marginal Distributions: A Framework to Evaluate the Representativeness of Demographic-Aligned LLMs

超越边缘分布:评估与文化价值观对齐的大型语言模型代表性的框架

Tristan Williams, Franziska Weeber, Sebastian Padó, Alan Akbik

机构 * Humboldt University of Berlin(柏林洪堡大学) University of Stuttgart(斯图加特大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出评估对齐模型代表性的框架,通过多变量相关性模式和边缘分布相结合,比较两种模型引导技术,发现尽管细调模型更接近边缘分布,但提示方法在再现调查项目相关性结构上更优,但两者均未与人类相关性模式一致。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06380 2026-04-22 cs.SD cs.AI 77%

Protecting Bystander Privacy via Selective Hearing in Audio LLMs

通过选择性聆听保护旁观者隐私

Xiao Zhan, Guangzhi Sun, Jose Such, Phil Woodland

机构 * VRAIN, Universitat Politècnica de València(VRAIN,瓦伦西亚理工大学) Department of Engineering, University of Cambridge(剑桥大学工程系) INGENIO (CSIC-Universitat Politècnica de València)(INGENIO(CSIC-瓦伦西亚理工大学))

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SH-Bench基准和BPFT训练方法,评估音频大语言模型的选择性聆听能力,发现现有模型存在旁观者隐私泄露问题,BPFT显著提升隐私保护效果。

Comments To Appear at ACL 2026 main conference; Dataset: https://huggingface.co/datasets/BrianatCambridge/SelectiveHearingBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19400 2026-04-22 cs.SE 75%

CASCADE: Detecting Inconsistencies between Code and Documentation with Automatic Test Generation

CASCADE:通过自动测试生成检测代码与文档之间的一致性问题

Tobias Kiecker, Jan Arne Sparka, Martin Reuter, Albert Ziegler, Lars Grunske

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 CASCADE利用大语言模型生成单元测试,通过代码与文档生成的测试结果对比,检测代码与文档不一致问题,验证其在真实代码库中的有效性与精度。

Comments 23 pages, 3 figures. To appear in the proceedings of FSE 2026. Code available at https://github.com/TobiasKiecker/CASCADE/releases/tag/FSE2026-v1.0.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19281 2026-04-22 cs.HC cs.AI cs.CL cs.LG 75%

Beyond Semantic Similarity: A Component-Wise Evaluation Framework for Medical Question Answering Systems with Health Equity Implications

超越语义相似性:面向医疗问答系统的组件评估框架及其健康公平性影响

Abu Noman Md Sakib, Md. Main Oddin Chisty, Zijie Zhang

机构 * University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Khulna University of Engineering and Technology(库尔纳工程科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出VB-Score框架,评估医疗问答模型的四个组件,揭示模型在慢性病等特定群体中的性能差异,指出语义评估不足以确保医疗AI的安全性。

Comments Accepted in the Ninth Annual ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16968 2026-04-22 cs.AR cs.AI cs.CL cs.LG cs.PL 75%

CASS: Nvidia to AMD Transpilation with Data, Models, and Benchmark

CASS:Nvidia到AMD的跨架构代码转换:数据、模型和基准

Ahmed Heakl, Gustavo Bertolo Stahl, Sarim Hashmi, Seung Hun Eddie Han, Mukul Ranjan, Arina Kharlamova, Salman Khan, Abdulrahman Mahmoud

机构 * MBZUAI Australian National University(澳大利亚国立大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 CASS是首个用于GPU代码转换的数据库和模型集,通过6万对验证的主机-设备代码实现跨ISA和运行时边界的学习转换,其模型在CUDA到HIP和SASS到RDNA3转换中准确率分别达88.2%和69.1%,超越商业基线。

Comments 20 pages, 11 figures, 5 tables

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18164 2026-04-22 cs.CL cs.AI cs.CV 73%

MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge

MM-JudgeBias:一个评估MLLM-as-a-Judge中组合偏见的基准

Sua Lee, Sanghee Park, Jinbae Im

机构 * Seoul National University(首尔国立大学) NAVER Cloud AI(NAVER云AI) KAIST AI(韩国科学技术院人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MM-JudgeBias基准,通过引入控制扰动和两个互补指标,评估MLLM-as-a-Judge中的组合偏见,揭示了九种偏见类型,并发现现有模型存在模态忽视和评估倾向性问题。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08608 2026-04-22 cs.CR cs.AI cs.LG 73%

Semantic Intent Fragmentation: A Single-Shot Compositional Attack on Multi-Agent AI Pipelines

语义意图碎片化:一种针对多智能体AI流水线的单次组合攻击

Tanzim Ahad, Ismail Hossain, Md Jahangir Alam, Sai Puppala, Yoonpyo Lee, Syed Bahauddin Alam, Sajedul Talukder

机构 * Department of Computer Science, University of Texas at El Paso(德克萨斯理工大学计算机科学系) School of Computing, Southern Illinois University Carbondale(南方伊利诺伊大学卡本代尔分校计算机学院) Hanyang University(翰阳大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出语义意图碎片化攻击,通过单个合法请求导致任务分解为看似无害但联合违反安全策略的子任务,利用OWASP LLM06:2025框架实现无注入内容、无系统修改的攻击,验证了组合安全漏洞的可修复性。

Comments This paper got accepted for AAAI 2026 Summer Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17014 2026-04-22 cs.CR 71%

False Security Confidence in Benign LLM Code Generation

良性大语言模型代码生成中的虚假安全信心

Xiaolei Ren

专题命中 评测与基准 :LLM(title)

AI总结 本文研究在无攻击场景下,功能正确但存在安全漏洞的代码生成现象,提出FSC率作为衡量指标,并定义FSC-hard作为新的评估层次。

Comments 6 pages; technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22737 2026-04-22 cs.CV 71%

Lingua-SafetyBench: A Benchmark for Safety Evaluation of Multilingual Vision-Language Models

Lingua-SafetyBench: 一个多语言视觉-语言模型安全评估基准

Enyi Shi, Pengyang Shao, Yanxin Zhang, Chenhang Cui, Jiayi Lyu, Xiaobo Xia, Fei Shen, Tat-Seng Chua

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) School of Engineering Science, University of the Chinese Academy of Sciences(中国科学院工程科学学院) NExT++ Research Centre, National University of Singapore(新加坡国立大学NExT++研究中心)

专题命中 评测与基准 :language model(title)

AI总结 本文提出Lingua-SafetyBench,通过10万多个多语言图像-文本对评估多模态模型的安全性,发现非高资源语言和非拉丁文在文本主导风险下安全性更差,强调需要专门的语言和模态对齐策略以提升安全性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19689 2026-04-22 cs.AI 70%

A-MAR: Agent-based Multimodal Art Retrieval for Fine-Grained Artwork Understanding

A-MAR:基于代理的多模态艺术检索用于细粒度艺术作品理解

Shuai Wang, Hongyi Zhu, Jia-Hong Huang, Yixian Shen, Chengxi Zeng, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) University of Bristol(布里斯托大学) Amazon AGI(亚马逊人工智慧) College of Business and Economics(商学院和经济学学院) University of Johannesburg(约翰内斯堡大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出A-MAR框架,通过结构化推理计划显式指导多模态艺术检索,提升解释质量和证据 grounding 能力,在艺术领域验证了代理式多模态推理的有效性。

Journal ref ICMR 2026, ACM International Conference on Multimedia Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19508 2026-04-22 cs.CL 70%

Bangla Key2Text: Text Generation from Keywords for a Low Resource Language

孟加拉语关键词到文本生成:为低资源语言设计的关键词驱动文本生成数据集

Tonmoy Talukder, G M Shahariar

机构 * Ahsanullah University of Science and Technology(阿萨努拉大学科学与技术学院) University of California - Riverside(加州大学河滨分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Bangla Key2Text数据集,用于低资源语言的关键词驱动文本生成。通过BERT基模型提取关键词,生成260万对孟加拉语关键词-文本对,评估mT5和BanglaT5模型,显示任务特定微调显著提升生成效果。

Comments 18 pages, uses lrec2026.sty

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17925 2026-04-22 cs.SE cs.AI 70%

SpecAgent: A Speculative Retrieval and Forecasting Agent for Code Completion

SpecAgent:一种用于代码补全的推测性检索与预测代理

George Ma, Anurag Koul, Qi Chen, Yawen Wu, Sachit Kuhar, Yu Yu, Aritra Sengupta, Varun Kumar, Murali Krishna Ramanathan

机构 * UC Berkeley(加州大学伯克利分校) Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SpecAgent通过预索引探索和构建推测上下文,提升代码生成质量与推理效率,实验显示其在代码补全任务中比基线模型提升9-11%,显著降低推理延迟。

Comments In Proceedings of the Sixty-Fourth Annual Meeting of the Association for Computational Linguistics (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16822 2026-04-22 cs.CV cs.AI 70%

ReefNet: A Large-Scale Dataset and Benchmark for Fine-Grained Coral Reef Recognition

ReefNet:一个大规模数据集和基准,用于细粒度珊瑚礁识别

Abdulwahab Felemban, Yahia Battach, Faizan Farooq Khan, Yuqian Fu, Xuhui Liu, Yesmeen M. Khattab, Yousef A. Radwan, Xiang Li, Fabio Marchese, Sara Beery, Burton H. Jones, Francesca Benzoni, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology (KAUST)(国王阿卜杜勒·阿齐兹科技大学) Massachusetts Institute of Technology (MIT)(麻省理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ReefNet,一个大规模珊瑚礁图像数据集,用于细粒度识别。通过专家验证和过滤,构建了高置信度基准子集,揭示了多模态模型在生物多样性监测中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18982 2026-04-22 cs.AI 70%

SAVOIR: Learning Social Savoir-Faire via Shapley-based Reward Attribution

SAVOIR:通过基于Shapley的奖励归因学习社交能力

Xiachong Feng, Yi Jiang, Xiaocheng Feng, Deyi Yin, Libo Qin, Yangfan Ye, Lei Huang, Weitao Ma, Yuxuan Gu, Chonghan Qin, Bing Qin, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 评测与基准 :language model(abstract);language agent(abstract);分类 cs.AI

AI总结 本文提出SAVOIR框架,基于合作博弈理论解决语言代理训练中的信用分配问题,通过预期效用转移和Shapley值实现公平奖励分配,实验显示其在SOTOPIA基准上达到新状态-of-the-art性能。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18589 2026-04-22 cs.HC cs.AI 70%

CentaurTA Studio: A Self-Improving Human-Agent Collaboration System for Thematic Analysis

CentaurTA Studio:一个自我改进的人机协作系统用于主题分析

Lei Wang, Min Huang, Eduard Dragut

机构 * Temple University(Temple大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出CentaurTA Studio,通过人机协作提升主题分析效率,实现高准确率和可靠评估,验证了反馈循环和持续优化的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16059 2026-04-22 cs.CR cs.CL 70%

ContextLeak: Auditing Leakage in Private In-Context Learning Methods

ContextLeak:私有上下文学习方法中泄露的审计

Jacob Choi, Shuying Cao, Xingjian Dong, Amin Banayeeanzade, Wang Bill Zhu, Robin Jia, Sai Praneeth Karimireddy

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ContextLeak框架,用于评估私有上下文学习中信息泄露的最坏情况,通过插入标记检测敏感信息,并揭示现有方法在隐私与效用之间的权衡不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19181 2026-04-22 cs.DC 67%

YAIFS: Yet (not) Another Intelligent Fog Simulator: A Framework for Agent-Driven Computing Continuum Modeling & Simulation

YAIFS: 又一个智能雾模拟器:一种基于智能体驱动的计算连续性建模与仿真框架

Isaac Lera, Carlos Guerrero

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出YAIFS框架,通过引入模型上下文协议实现智能体与模拟的交互,展示了多智能体系统在动态负载下的自适应行为。

Comments under review,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18845 2026-04-22 cs.IR 67%

Dual-View Training for Instruction-Following Information Retrieval

双视训练用于遵循指令的信息检索

Qingcheng Zeng, Puxuan Yu, Aman Mehta, Fuheng Zhao, Rajhans Samdani

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出双视数据合成策略,通过极性反转生成互补指令,使检索系统能重新评估候选集以满足指令要求,从而在FollowIR基准上提升45%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17072 2026-04-22 cs.MA 67%

CogGen: A Cognitively Inspired Recursive Framework for Deep Research Report Generation

CogGen:一种受认知启发的递归框架用于深度研究报告生成

Kuo Tian, Pengfei Sun, Zhen Wu, Junran Ding, Xinyu Dai

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 CogGen通过递归架构模拟认知写作,实现灵活规划与全局重构,引入抽象视觉表示和认知负荷评估框架,提升多模态内容生成质量。

Comments 28 pages, 3 figures, Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06211 2026-04-22 cs.CL cs.AI cs.CV 62%

PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts

PuzzleWorld: 一个用于谜题 hunt 中多模态、开放式推理的基准

Hengzhi Li, Justin Zhang, Brendon Jiang, Alexander Naehu, Regan Song, Megan Tjandrasuwita, Chanakya Ekbote, Steven-Shine Chen, Adithya Balachandran, Wei Dai, Rebecca Chang, Paul Pu Liang

机构 * MIT Media Lab and MIT EECS(MIT媒体实验室和MIT电子工程与计算机科学系)

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 PuzzleWorld 是一个包含667个谜题 hunt 风格问题的基准,用于评估逐步、开放式和创造性多模态推理。每个谜题都标注了最终答案、详细推理轨迹和认知技能标签,揭示了当前模型在推理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19562 2026-04-22 cs.LG 57%

Structure-guided molecular design with contrastive 3D protein-ligand learning

基于结构的分子设计与对比学习3D蛋白质-配体学习

Carles Navarro, Philipp Tholke, Gianni de Fabritiis

机构 * Acellera Labs(Acellera实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文提出结合对比学习3D结构编码与自回归分子生成的统一框架,用于解决结构导向分子设计中的挑战,生成具有优良结合性质的候选分子。

详情

展开后加载摘要…

URL PDF HTML 收藏