arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-16 至 2026-04-16 共收录 267 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 71 篇

2603.23682 2026-04-16 cs.HC cs.AI 81%

Assessment Design in the AI Era: A Method for Identifying Items Functioning Differentially for Humans and Chatbots

人工智能时代评估设计:一种识别人类与聊天机器人系统存在系统性反应差异的 方法

Licol Zeinfeld, Alona Strugatski, Ziva Bar-Dov, Ron Blonder, Shelley Rap, Giora Alexandron

机构 * Weizmann Institute of Science(魏茨曼科学研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种结合教育数据挖掘与心理测量理论的方法,用于识别人类与AI在评估项目上的系统性差异,以改进评估设计的公平性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21823 2026-04-16 cs.AI 81%

ProRe: A Proactive Reward System for GUI Agents via Reasoner-Actor Collaboration

ProRe:通过推理器-执行器协作的GUI代理前瞻性奖励系统

Gaole Dai, Shiqi Jiang, Ting Cao, Yuqing Yang, Yuanchun Li, Rui Tan, Mo Li, Lili Qiu

机构 * NTU(国立新加坡大学) Microsoft Research(微软研究院) Tsinghua University(清华大学) HKUST(香港理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ProRe通过推理器与领域特定评估器协作,提升GUI代理奖励准确性与F1分数,实验显示奖励准确性和F1分数提升达5.3%和19.4%。

Comments 23 pages, 12 figures, ICLR'2026

Journal ref The Fourteenth International Conference on Learning Representations, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11748 2026-04-16 cs.CL cs.LG 81%

LangFlow: Continuous Diffusion Rivals Discrete in Language Modeling

LangFlow: 连续扩散在语言建模中与离散模型相媲美

Yuxin Chen, Chumeng Liang, Hangke Sui, Ruihan Guo, Chaoran Cheng, Jiaxuan You, Ge Liu

机构 * UIUC(伊利诺伊大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 LangFlow通过连接嵌入空间DLM与流匹配的Bregman散度,提出三种创新方法,实现了连续扩散在语言建模中的突破,达到与离散模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13069 2026-04-16 cs.CY 80%

Geographic Blind Spots in AI Control Monitors: A Cross-National Audit of Claude Opus 4.6

AI控制监控中的地理盲区:对Claude Opus 4.6的跨国审计

Jason Hung

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文通过跨国审计揭示Claude Opus 4.6在地理知识上的缺陷,发现其对全球北半球查询的伪造率高于南半球,揭示了模型在部分知识机制下的漏洞。

Comments 21 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12400 2026-04-16 cs.NI 80%

Agentic AI for 6G: A New Paradigm for Autonomous RAN Security Compliance

面向6G的代理AI:自主RAN安全合规的新范式

Sotiris Chatzimiltis, Mahdi Boloursaz Mashhadi, Mohammad Shojafar, Merouane Debbah, Rahim Tafazolli

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文提出利用基于LLM的AI代理与RAG流程框架,实现RAN安全合规的智能自主执行,通过案例研究展示其在O-RAN联盟和3GPP标准合规性评估中的应用,并探讨模型幻觉、供应商不一致等挑战及未来发展方向。

Comments Accepted at IEEE Communications Standards Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07043 2026-04-16 cond-mat.mtrl-sci 80%

Uni2D: A Universal Machine Learning Interatomic Potential for Two-Dimensional Materials

Uni2D:一种适用于二维材料的通用机器学习交互势能模型

Haidi Wang, Yufan Yao, Haonan Song, Huimiao Wang, Xiaofeng Liu, Zhao Chen, Weiwei Chen, Weiduo Zhu, Zhongjun Li, Jinlong Yang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Uni2D,一种针对二维材料设计的交互势能模型,通过大规模数据训练实现了对能量、力和应力的可靠预测,支持高通量筛选和计算探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13803 2026-04-16 cs.CV cs.AI 79%

Gaslight, Gatekeep, V1-V3: Early Visual Cortex Alignment Shields Vision-Language Models from Sycophantic Manipulation

Gaslight, Gatekeep, V1-V3: 早期视觉皮层对齐保护视觉语言模型免受阿谀操控

Arya Shah, Vaibhav Tripathi, Mayank Singh, Chaklam Silpasuwanchai

机构 * Indian Institute of Technology Gandhinagar(印度理工学院加尔各答分校) Asian Institute of Technology(亚洲理工学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文研究了视觉语言模型在高风险场景中的脆弱性,通过评估12种模型的脑部对齐和顺从性,发现早期视觉皮层对齐能有效降低模型对阿谀操控的敏感性。

Comments 28 pages, 9 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13367 2026-04-16 cs.CV cs.AI 79%

A 3D SAM-Based Progressive Prompting Framework for Multi-Task Segmentation of Radiotherapy-induced Normal Tissue Injuries in Limited-Data Settings

一种基于3D SAM的渐进提示框架,用于有限数据设置下的放射治疗诱导正常组织损伤多任务分割

Caiwen Jiang, Lei Zeng, Wei Liu

机构 * Department of Radiation Oncology, Mayo Clinic, Phoenix, Arizona, USA(放射肿瘤科,梅奥诊所,凤凰城,亚利桑那州,美国)

专题命中 评测与基准 :prompting(title,abstract);分类 cs.AI

AI总结 本文提出一种基于3D SAM的渐进提示框架,用于在有限标注数据下实现放射治疗诱导正常组织损伤的多任务分割,通过三种互补提示提升分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13332 2026-04-16 cs.LG 79%

Selecting Feature Interactions for Generalized Additive Models by Distilling Foundation Models

通过蒸馏基础模型选择广义加性模型中的特征交互

Jingyun Jia, Chandan Singh, Rich Caruana, Ben Lengerich

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院) Intelligible AI(可解释AI)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出TabDistill方法,利用表格基础模型和事后蒸馏技术,提取显著特征交互以提升广义加性模型的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13151 2026-04-16 cs.AI 79%

Exploration and Exploitation Errors Are Measurable for Language Model Agents

语言模型代理中的探索与利用误差是可测量的

Jaden Park, Jungtaek Kim, Jongwon Jeong, Robert D. Nowak, Kangwook Lee, Yong Jae Lee

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) KRAFTON Ludo Robotics

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究探讨了语言模型代理在复杂决策任务中探索与利用误差的测量方法,设计可控环境评估不同模型的表现,发现前沿模型在任务中表现不佳,推理模型更有效,通过少量工程优化可显著提升探索与利用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09687 2026-04-16 cs.CV cs.AI 79%

Grid2Matrix: Revealing Digital Agnosia in Vision-Language Models

Grid2Matrix: 揭示视觉语言模型中的数字失读

Yunkai Zhang, Linda Li, Yingxin Cui, Xiyuan Ruan, Zeyu Zheng, Kezhen Chen, Yi Zhang, Diji Yang

机构 * BAIR, UC Berkeley(伯克利大学BAIR实验室) UC Santa Cruz(圣克拉拉大学) Analogy AI

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 Grid2Matrix通过控制视觉复杂度测试视觉语言模型在捕捉细节方面的不足,发现模型在小网格上表现不佳,揭示了视觉编码与语言表达间的差距,即'数字失读'。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15550 2026-04-16 cs.CL 79%

Common to Whom? Regional Cultural Commonsense and LLM Bias in India

属于谁?印度区域文化常识与大语言模型偏见

Sangmitra Madhusudan, Trush Shashank More, Steph Buongiorno, Renata Dividino, Jad Kabbara, Ali Emami

机构 * Emory University(埃默里大学) Brock University(布罗克大学) MIT(麻省理工学院)

专题命中 评测与基准 :LLM(title,abstract_cn);分类 cs.CL

AI总结 本文提出Indica基准测试,评估大语言模型在印度区域文化常识上的能力,发现文化常识在区域层面而非国家层面更普遍,并揭示模型存在地理偏见。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13954 2026-04-16 cs.LG cs.AI 79%

HINTBench: Horizon-agent Intrinsic Non-attack Trajectory Benchmark

HINTBench:地平线代理内在非攻击轨迹基准

Jiacheng Wang, Jinchang Hou, Fabian Wang, Ping Jian, Chenfu Bao, Zhonghou Lv

机构 * Baidu Inc(百度公司) Beijing Institute of Technology(北京理工大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究内在风险审计,提出HINTBench基准,包含629条轨迹,评估风险检测、风险步定位和内在故障识别,发现强LLM在风险步定位上表现差,揭示内在风险审计的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13705 2026-04-16 cs.CL cs.AI cs.GT cs.MA 79%

Beyond Arrow's Impossibility: Fairness as an Emergent Property of Multi-Agent Collaboration

超越阿罗不可能定理:公平性作为多智能体协作的涌现属性

Sayan Kumar Chaki, Antoine Gourru, Julien Velcin

机构 * Department of Computer Science(计算机科学系)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨多智能体协作中公平性的涌现特性,通过医院急诊框架实验发现,智能体间的互动能产生比单一模型更公平的分配结果,揭示了公平性作为系统属性而非个体属性的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13764 2026-04-16 cs.CR 78%

RealVuln: Benchmarking Rule-Based, General-Purpose LLM, and Security-Specialized Scanners on Real-World Code

RealVuln: 对现实代码中基于规则的、通用目的的大语言模型和安全专用扫描器进行基准测试

John Pellew, Faizan Raza

专题命中 评测与基准 :LLM(title,abstract)

AI总结 RealVuln通过对比基于规则的SAST、通用大语言模型和安全专用扫描器在26个故意存在漏洞的Python仓库中的表现,评估其在现实代码中的性能,揭示了三种扫描器的层次排名。

Comments 16 pages, 2 figures, 4 tables. Code and data: https://github.com/kolega-ai/Real-Vuln-Benchmark. Dashboard: https://realvuln.kolega.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05991 2026-04-16 cs.AI 77%

3D Instruction Ambiguity Detection

三维指令歧义检测

Jiayu Ding, Haoran Tang, Hongbo Jin, Wei Gao, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出三维指令歧义检测任务,构建了大规模基准Ambi3D,发现现有3D大语言模型难以判断指令歧义,提出AmbiVer框架解决该问题,提升具身AI的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06536 2026-04-16 cs.CL 77%

Exposía: Teaching and Assessment of Academic Writing Skills for Research Project Proposals and Peer Feedback

Exposía:研究项目提案与同伴反馈的学术写作技能教学与评估

Dennis Zyska, Alla Rozovskaya, Ilia Kuznetsov, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science and Hessian Center for AI (hessian.AI), Technical University of Darmstadt(普遍知识处理实验室(UKP实验室)、计算机科学系和海斯曼人工智能中心(hessian.AI)、达姆施塔特技术大学) Department of Computer Science at Queens College, City University of New York (CUNY)(纽约城市大学皇后学院计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 Exposía是首个公开连接写作与反馈的高等教育数据集,用于研究基于教育的计算方法在教学和评估学术写作中的应用。该数据集包含学生研究提案及同伴和教师反馈,通过细粒度评估方案评估写作和反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21751 2026-04-16 cs.SE cs.CL 77%

CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation

CodeFlowBench: 一个用于复杂代码生成的多轮迭代基准

Sizhe Wang, Zhengren Wang, Dongsheng Ma, Yongan Yu, Rui Ling, Zhiyu Li, Feiyu Xiong, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) Shanghai University of Finance and Economics(上海财经大学) McGill University(麦吉尔大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学))

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 CodeFlowBench通过多轮迭代重用现有代码评估LLM在复杂代码生成中的能力,包含5000+编程问题和真实GitHub仓库,揭示多轮代码流程中模型性能下降与依赖复杂度负相关的现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00414 2026-04-16 cs.CL 77%

Social media polarization during conflict: Insights from an ideological stance dataset on Israel-Palestine Reddit comments

冲突期间社交媒体极化:来自以色列-巴勒斯坦Reddit评论的意识形态立场数据集洞察

Hasin Jawad Ali, Ajwad Abrar, S. M. Hozaifa Hossain, M. Firoz Mridha

机构 * Department of Business and Technology Management, Islamic University of Technology, Gazipur, Dhaka, Bangladesh(伊斯兰科技大学商学院与技术管理系,加兹ipur,达卡,孟加拉国) Department of Computer Science and Engineering, Islamic University of Technology, Gazipur, Dhaka, Bangladesh(伊斯兰科技大学计算机科学与工程系,加兹ipur,达卡,孟加拉国) Department of Electrical and Electronic Engineering, University of Dhaka, Nilkhet Road, Dhaka, Bangladesh(达卡大学电子与电气工程系,Nilkhet Road,达卡,孟加拉国) Department of Computer Science, American International University–Bangladesh, Kuratoli, Dhaka, Bangladesh(孟加拉国美国国际大学计算机科学系,Kuratoli,达卡,孟加拉国)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究分析了9969条以色列-巴勒斯坦冲突的Reddit评论,利用多种方法检测意识形态立场,发现Mixtral 8x7B的Scoring和Reflective Re-read提示在所有指标上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13666 2026-04-16 cs.CY cs.AI cs.LG 73%

Automatically Inferring Teachers' Geometric Content Knowledge: A Skills Based Approach

自动推断教师的几何内容知识:基于技能的方法

Ziv Fenigstein, Kobi Gal, Avi Segal, Osama Swidan, Inbal Israel, Hassan Ayoob

机构 * Ben-Gurion University, Israel(本古里安大学,以色列) University of Edinburgh, U.K.(爱丁堡大学,英国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于技能的自动化方法,利用大语言模型对教师的Van Hiele几何推理水平进行分类,通过整合显式技能信息提升分类准确率,为大规模评估教师几何知识提供理论支持。

Comments The work is accepted for publication as a full paper (Main Track) at the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27064 2026-04-16 cs.CV cs.AI cs.CL 73%

ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding

ChartNet: 一个百万级、高质量的多模态数据集,用于稳健的图表理解

Jovana Kondic, Pengyuan Li, Dhiraj Joshi, Isaac Sanchez, Ben Wiesel, Shafiq Abedin, Amit Alfassy, Eli Schwartz, Daniel Caraballo, Yagmur Gizem Cinar, Florian Scheidegger, Steven I. Ross, Daniel Karl I. Weidele, Hang Hua, Ekaterina Arutyunova, Roei Herzig, Zexue He, Zihan Wang, Xinyue Yu, Yunfei Zhao, Sicong Jiang, Minghao Liu, Qunshu Lin, Peter Staar, Luis Lastras, Aude Oliva, Rogerio Feris

机构 * MIT(麻省理工学院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) IBM Research(IBM研究院) Abaka AI & 2077AI(Abaka AI及2077AI)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 ChartNet通过生成150万张不同图表样本,提升图表解释和推理能力,包含代码、图像、表格、自然语言和问答数据,支持多模态对齐,公开可用。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13849 2026-04-16 cs.CL cs.LG 73%

Language steering in latent space to mitigate unintended code-switching

在潜在空间中进行语言引导以缓解无意的代码切换

Andrey Goncharov, Nikolai Kondusov, Alexey Zaytsev

机构 * Skolkovo Institute of Science and Technology(斯克罗夫诺伊科学与技术研究所) Voronezh State University(沃罗涅日州立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种轻量级的推理时间方法,通过主成分分析在平行翻译中识别语言方向,引导令牌嵌入沿这些轴控制语言身份,有效缓解代码切换并保持语义,计算开销小且仅需少量平行数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16005 2026-04-16 cond-mat.mtrl-sci cs.AI cs.LG 73%

Autonomous Multi-objective Alloy Design through Simulation-guided Optimization

通过模拟引导的优化实现自主多目标合金设计

Penghui Yang, Chendong Zhao, Bijun Tang, Zhonghan Zhang, Xinrun Wang, Yanchen Deng, Xuyu Dong, Yuhao Lu, Jianguo Huang, Yixuan Li, Yushan Xiao, Cuntai Guan, Zheng Liu, Bo An

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore 639798, Singapore(南洋理工大学计算机与数据科学学院,新加坡) School of Materials Science and Engineering, Nanyang Technological University, Singapore 639798, Singapore(南洋理工大学材料科学与工程学院,新加坡) School of Computing and Information Systems, Singapore Management University, Singapore 188065, Singapore(新加坡管理学院计算机与信息学院,新加坡) School of Materials Science and Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学材料科学与工程学院,中国) Institute for Functional Intelligent Materials, National University of Singapore, Singapore(新加坡国立大学功能智能材料研究所,新加坡)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AutoMAT框架,整合大语言模型、自动化CALPHAD模拟等技术,实现自主合金设计,发现高性能合金并缩短研发周期。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02697 2026-04-16 cs.CV 71%

GeoBridge: A Semantic-Anchored Multi-View Foundation Model Bridging Images and Text for Geo-Localization

GeoBridge:一种语义锚定的多视图基础模型,用于图像与文本之间的地理定位

Zixuan Song, Jing Zhang, Di Wang, Zidie Zhou, Wenbin Liu, Haonan Guo, En Wang, Bo Du

机构 * School of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)

专题命中 评测与基准 :foundation model(title)

AI总结 GeoBridge通过语义锚定机制实现多视图特征桥接,提升地理定位的鲁棒性和灵活性。该模型构建了首个大规模跨模态多视图对齐数据集GeoLoc,验证了预训练对地理定位精度和跨领域泛化能力的提升。

Comments The paper is accepted by CVPR 2026! Code, dataset, and pretrained models will be released at https://github.com/MiliLab/GeoBridge

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16906 2026-04-16 physics.class-ph math.AP physics.comp-ph 71%

Transition Frequencies and Dynamic Amplification of Buried Lifelines: A Semi-Analytical Timoshenko Beam on Winkler Foundation Model

埋藏生命线的过渡频率和动态放大:基于Winkler基础的半解析Timoshenko梁模型

Gersena Banushi, Kenichi Soga

专题命中 评测与基准 :foundation model(title)

AI总结 本文提出一种半解析模型,用于分析埋藏生命线的横向振动,通过Timoshenko梁理论和弹性基础模型,揭示振动频谱由三个过渡频率分隔的四个部分组成,并通过案例研究验证了模型的有效性。

Comments Presented at and accepted for publication in the official Proceedings of the 16th International Conference on Vibration Problems & 11th International Conference on Wave Mechanics and Vibrations (ICOVP & WMVC 2025), Lisbon, Portugal, September 2-5, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13940 2026-04-16 cs.AI 70%

AI-Assisted Peer Review at Scale: The AAAI-26 AI Review Pilot

大规模AI辅助同行评审:AAAI-26 AI评审试点

Joydeep Biswas, Sheila Schoepp, Gautham Vasan, Anthony Opipari, Arthur Zhang, Zichao Hu, Sebastian Joseph, Matthew Lease, Junyi Jessy Li, Peter Stone, Kiri L. Wagstaff, Matthew E. Taylor, Odest Chadwicke Jenkins

机构 * AAAI(国际人工智能协会)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文探讨了AI在大规模同行评审中的应用,展示了AAAI-26中22977篇论文通过先进系统生成的AI评审,结果显示作者和评审委员认为AI评审在技术准确性和研究建议方面优于人类评审,并引入了新的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13756 2026-04-16 cs.CL cs.CV 70%

MedRCube: A Multidimensional Framework for Fine-Grained and In-Depth Evaluation of MLLMs in Medical Imaging

MedRCube:面向医学影像中多模态大语言模型细粒度与深入评估的多维框架

Zhijie Bao, Fangke Chen, Licheng Bao, Chenhui Zhang, Wei Chen, Jiajie Peng, Zhongyu Wei

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) School of Integrated Circuits, Zhejiang University(浙江大学集成电路学院) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MedRCube框架,通过两阶段构建流程对33个MLLM进行细粒度评估,揭示先前方法无法获取的洞察,并引入可信度评估子集,发现快捷行为与诊断性能的显著正相关,引发临床部署的担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13598 2026-04-16 cs.LG stat.ME 70%

Enhancing Reinforcement Learning for Radiology Report Generation with Evidence-aware Rewards and Self-correcting Preference Learning

通过证据感知奖励和自校正偏好学习增强放射科报告生成

Qin Zhou, Guoyan Liang, Qianyi Yang, Jingyuan Chen, Sai Wu, Chang Yao, Zhe Wang

机构 * Department of Computer Science and Engineering, ECUST(电子科技大学计算机科学与工程系) Key Laboratory of Smart Manufacturing in Energy Chemical Process, Ministry of Education, P. R. China(教育部能源化工过程智能制造重点实验室) Zhejiang University(浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出ESC-RL方法,结合证据感知对齐奖励和自校正偏好学习,提升放射科报告生成的临床准确性与持续改进能力,实验表明其在胸部X光数据集上表现优异。

Comments 13 pages,4 figures, ACL2026-main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13074 2026-04-16 cs.CL cs.CV 70%

PersonaVLM: Long-Term Personalized Multimodal LLMs

PersonaVLM:长期个性化多模态大语言模型

Chang Nie, Chaoyou Fu, Yifan Zhang, Haihua Yang, Caifeng Shan

机构 * Nanjing University(南京大学) ByteDance(字节跳动)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PersonaVLM,一种支持长期个性化多模态大语言模型框架,通过记忆、推理和响应对齐三大能力,提升个性化交互效果,并在Persona-MME基准测试中取得显著提升。

Comments Accepted by CVPR 2026. Project page: https://PersonaVLM.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14147 2026-04-16 cs.CV 67%

ROSE: Retrieval-Oriented Segmentation Enhancement

ROSE:基于检索的分割增强

Song Tang, Guangquan Jie, Henghui Ding, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出ROSE框架,通过引入网络检索模块和提示增强模块,提升多模态大语言模型在新兴实体和新实体分割任务中的性能,实验表明其在NEST基准上表现优异。

Comments CVPR 2026 Findings, Project Page: https://henghuiding.com/ROSE/

详情

展开后加载摘要…

URL PDF HTML 收藏