arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-15 至 2026-04-15 共收录 328 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 61 篇

2604.12770 2026-04-15 cs.CL 81%

Teaching LLMs Human-Like Editing of Inappropriate Argumentation via Reinforcement Learning

通过强化学习教学LLMs进行类人化的不当论证编辑

Timon Ziegenbein, Maja Stahl, Henning Wachsmuth

机构 * Leibniz University Hannover(汉诺威莱布尼茨大学) L3S Research Center(L3S研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过强化学习方法使LLMs学会进行类人化的文本编辑,提升论证适当性。方法生成可独立接受或拒绝的句子级编辑建议,通过多组件奖励函数优化语义相似性、流畅性和论证适当性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12161 2026-04-15 cs.AI 81%

Development, Evaluation, and Deployment of a Multi-Agent System for Thoracic Tumor Board

胸腔肿瘤板的多智能体系统开发、评估与部署

Tim Ellis-Caleo, Timothy Keyes, Nerissa Ambers, Faraah Bekheet, Wen-wai Yim, Nikesh Kotecha, Nigam H. Shah, Joel Neal

机构 * Division of Oncology, Department of Medicine, Stanford University School of Medicine(斯坦福大学医学院肿瘤学部) Technology and Digital Solutions, Stanford Health Care(斯坦福健康医疗技术与数字解决方案部) Department of Biomedical Data Science, Stanford University School of Medicine(斯坦福大学医学院生物医学数据科学部) Nursing Informatics, Stanford Health Care(斯坦福健康护理信息学部) Department of Medicine, Stanford University School of Medicine(斯坦福大学医学院医学部) Microsoft AI, Redmond, WA(微软人工智能,西雅图) Stanford Cancer Institute, Palo Alto, CA(斯坦福癌症研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出了一种多智能体系统,用于生成胸腔肿瘤病例摘要,以提高讨论效率和准确性,并验证了LLM在事实评分中的应用。

Comments 64 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10200 2026-04-15 cs.AI cs.CV 79%

Edu-MMBias: A Three-Tier Multimodal Benchmark for Auditing Social Bias in Vision-Language Models under Educational Contexts

Edu-MMBias: 一种三级多模态基准,用于在教育背景下审计视觉-语言模型中的社会偏见

Ruijia Li, Mingzi Zhang, Zengyi Yu, Yuang Wei, Bo Jiang

机构 * School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(东华师范大学教育人工智能研究所) Faculty of Education, East China Normal University(东华师范大学教育学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出Edu-MMBias基准,通过三级维度审计视觉-语言模型中的社会偏见,揭示模型存在补偿性类偏见和深层健康与种族刻板印象,视觉输入可触发偏见回潮。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12513 2026-04-15 cs.LG 79%

Agentic Control in Variational Language Models

变分语言模型中的代理控制

Yves Ruffenach

机构 * Conservatoire National des Arts et Métiers(法国国立艺术与工艺学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本文研究变分语言模型能否通过内部证据实现最小化的代理控制,提出结合局部变分隐藏计算、结构感知检查点保留和校准的不确定性控制器,实验证明其在语言建模任务中优于确定性模型,并展示了更丰富的不确定性特征。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05206 2026-04-15 cs.CR cs.AI cs.CL cs.CV 79%

Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety

大规模安全:大型模型和智能体安全的全面综述

Xingjun Ma, Yifeng Gao, Yixu Wang, Ruofan Wang, Xin Wang, Ye Sun, Yifan Ding, Hengyuan Xu, Yunhao Chen, Yunhan Zhao, Hanxun Huang, Yige Li, Yutao Wu, Jiaming Zhang, Xiang Zheng, Yang Bai, Zuxuan Wu, Xipeng Qiu, Jingfeng Zhang, Yiming Li, Xudong Han, Haonan Li, Jun Sun, Cong Wang, Jindong Gu, Baoyuan Wu, Siheng Chen, Tianwei Zhang, Yang Liu, Mingming Gong, Tongliang Liu, Shirui Pan, Cihang Xie, Tianyu Pang, Yinpeng Dong, Ruoxi Jia, Yang Zhang, Shiqing Ma, Xiangyu Zhang, Neil Gong, Chaowei Xiao, Sarah Erfani, Tim Baldwin, Bo Li, Masashi Sugiyama, Dacheng Tao, James Bailey, Yu-Gang Jiang

机构 * Fudan University(复旦大学) The University of Melbourne(墨尔本大学) Singapore Management University(新加坡国立大学) Deakin University(德肯大学) Hong Kong University of Science and Technology(香港科学与技术大学) City University of Hong Kong(香港城市大学) University of Oxford(牛津大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) The University of Sydney(悉尼大学) Griffith University(格里菲斯大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Sea AI Lab(Sea AI实验室) Tsinghua University(清华大学) Virginia Tech(弗吉尼亚理工大学) CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全部) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Purdue University(普渡大学) Duke University(杜克大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) RIKEN(理化学研究所) The University of Tokyo(东京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大型模型和智能体的安全性,分析了各类攻击威胁及防御策略,指出安全评估、防御机制和数据实践的重要性,强调研究社区和国际合作的必要性。

Comments 706 papers, 60 pages, 3 figures, 14 tables; GitHub: https://github.com/xingjunm/Awesome-Large-Model-Safety

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25326 2026-04-15 cs.AI cs.CY 74%

Evaluating Language Models for Harmful Manipulation

评估用于有害操控的语言模型

Canfer Akbulut, Rasmi Elasmar, Abhishek Roy, Anthony Payne, Priyanka Suresh, Lujain Ibrahim, Seliem El-Sayed, Charvi Rastogi, Ashyana Kachra, Will Hawkins, Kristian Lum, Laura Weidinger

机构 * Google(谷歌)

专题命中 评测与基准 :language model(title);分类 cs.AI

AI总结 本文提出评估AI有害操控的框架,通过人机交互研究评估AI模型在公共政策、金融和健康领域中的操控行为,发现情境影响操控效果,需在高风险情境中评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12978 2026-04-15 cs.CL cs.CV 70%

GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts

GlotOCR Bench: OCR模型在超过少数Unicode脚本之外仍面临困难

Amir Hossein Kargaran, Nafiseh Nikeghbal, Jana Diesner, François Yvon, Hinrich Schütze

机构 * LMU Munich(慕尼黑大学) TU Munich(慕尼黑工业大学) MCML Sorbonne Université & CNRS, ISIR(索邦大学与CNRS,ISIR)

专题命中 评测与基准 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 GlotOCR Bench评估OCR在100+Unicode脚本上的泛化能力,发现大多数模型在少于十种脚本上表现良好,最强模型也难以泛化到三十种以上脚本,表明当前OCR系统依赖语言模型预训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12744 2026-04-15 cs.CL 70%

Universal NER v2: Towards a Massively Multilingual Named Entity Recognition Benchmark

通用命名实体识别v2:迈向大规模多语言命名实体识别基准

Terra Blevins, Stephen Mayhew, Marek Šuppa, Hila Gonen, Shachar Mirkin, Vasile Pais, Kaja Dobrovoljc, Voula Giouli, Jun Kevin, Eugene Jang, Eungseo Kim, Jeongyeon Seo, Xenophon Gialis, Yuval Pinter

机构 * Northeastern University, USA(东北大学) Duolingo, USA(Duolingo) Comenius University Bratislava, Slovakia(布拉迪斯拉发康门尼大学) University of British Columbia, Canada(不列颠哥伦比亚大学) Alpinference, France(Alpinference) Research Institute for Artificial Intelligence, Romanian Academy, Romania(罗马尼亚科学院人工智能研究所) University of Ljubljana, Slovenia(卢布尔雅那大学) Aristotle University of Thessaloniki / ILSP, Athena Research Center, Greece(雅典纳基大学 / ILSP, 雅典研究中心) Universitas Pelita Harapan, Indonesia(佩利塔哈盼望大学) Seoul National University, South Korea(首尔国立大学) Independent Researcher, South Korea(韩国独立研究员) Democritus University of Thrace, Greece(特拉布宗大学) Ben-Gurion University of the Negev, Israel(贝尼·格里大学)

专题命中 评测与基准 :LLM(abstract_cn);language model(abstract);分类 cs.CL

AI总结 本文提出Universal NER v2,旨在构建多语言命名实体识别基准数据集,通过通用标签集和详尽标注指南实现标准化跨语言标注,提升多语言NER评估的准确性与一致性。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12700 2026-04-15 cs.AI 70%

MISID: A Multimodal Multi-turn Dataset for Complex Intent Recognition in Strategic Deception Games

MISID:一种多模态多轮对话数据集,用于战略欺骗游戏中复杂意图识别

Shufang Lin, Muyang Chen, Xiabing Zhou, Rongrong Zhang, Dayou Zhang, Fangxin Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Capital Normal University(首都师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MISID数据集,用于复杂战略欺骗游戏中多模态多轮对话的意图识别,通过系统评估发现现有多模态大语言模型在复杂场景中存在缺陷,并提出FRACTAM框架提升性能。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05795 2026-04-15 cs.CL 70%

Measuring What Matters!! Assessing Therapeutic Principles in Mental-Health Conversation

衡量重要性!!评估心理健康对话中的治疗原则

Abdullah Mazhar, Het Riteshkumar Shah, Aseem Srivastava, Smriti Joshi, Md Shad Akhtar

机构 * IIIT Delhi(印度德里理工学院) MBZUAI(马尔科姆·比尔人工智能研究所) Wysa

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CARE框架,通过多阶段方法评估AI生成的治疗回应是否符合临床标准,实验显示其在F-1分数上优于基线模型,展示了结构化推理和上下文建模的重要性。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03497 2026-04-15 cs.LG 70%

Invariant Features for Global Crop Type Classification

全局作物类型分类的不变特征

Xin-Yi Tong, Sherrie Wang

机构 * Laboratory for Information and Decision Systems, MIT(信息与决策系统实验室,麻省理工学院) Department of Mechanical Engineering, MIT(机械工程系,麻省理工学院) Institute for Data, Systems, and Society, MIT(数据、系统与社会研究所,麻省理工学院)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出CropNet,通过联合学习光谱和时间维度的不变特征,提升跨地理区域的作物分类性能,优于传统方法和基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04227 2026-04-15 cs.CR cs.AI 70%

Mobile GUI Agents under Real-world Threats: Are We There Yet?

移动GUI代理在现实威胁下的表现:我们已经到达了吗?

Guohong Liu, Jialei Ye, Jiacheng Liu, Yuanchun Li, Wei Liu, Pengzhi Gao, Jian Luan, Yunxin Liu

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) University of Electronic Science and Technology of China(电子科学与技术大学) Peking University(北京大学) MiLM Plus, Xiaomi Inc.(MiLM Plus,小米公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了移动GUI代理在现实威胁下的性能问题,提出了一种可扩展的应用内容仪器化框架,通过动态任务环境和静态数据集验证代理在第三方内容干扰下的表现,发现代理性能显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12512 2026-04-15 cs.CV cs.AI 70%

NTIRE 2026 The 3rd Restore Any Image Model (RAIM) Challenge: Professional Image Quality Assessment (Track 1)

NTIRE 2026 第三次恢复任何图像模型(RAIM)挑战:专业图像质量评估(Track 1)

Guanyi Qin, Jie Liang, Bingbing Zhang, Lishen Qu, Ya-nan Guan, Hui Zeng, Lei Zhang, Radu Timofte, Jianhui Sun, Xinli Yue, Tao Shao, Huan Hou, Wenjie Liao, Shuhao Han, Jieyu Yuan, Chunle Guo, Chongyi Li, Zewen Chen, Yunze Liu, Jian Guo, Juan Wang, Yun Zeng, Bing Li, Weiming Hu, Hesong Li, Dehua Liu, Xinjie Zhang, Qiang Li, Li Yan, Wei Dong, Qingsen Yan, Xingcan Li, Shenglong Zhou, Manjiang Yin, Yinxiang Zhang, Hongbo Wang, Jikai Xu, Zhaohui Fan, Dandan Zhu, Wei Sun, Weixia Zhang, Kun Zhu, Nana Zhang, Kaiwei Zhang, Qianqian Zhang, Zhihan Zhang, William Gordon, Linwei Wu, Jiachen Tu, Guoyi Xu, Yaoxin Jiang, Cici Liu, Yaokun Shi

机构 * NTIRE 2026 The 3rd Restore Any Image Model (RAIM) Challenge: Professional Image Quality Assessment (Track 1)(NTIRE 2026 第三次恢复任何图像模型(RAIM)挑战:专业图像质量评估(Track 1))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出NTIRE 2026挑战赛,聚焦专业图像质量评估,通过多模态大语言模型提升图像评估的准确性与解释性,吸引200多团队参与,推动专业IQA领域的发展。

Comments NTIRE Challenge Report. Accepted by CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12232 2026-04-15 cs.CR cs.AI cs.SE 70%

TEMPLATEFUZZ: Fine-Grained Chat Template Fuzzing for Jailbreaking and Red Teaming LLMs

TEMPLATEFUZZ:细粒度聊天模板模糊测试用于突破和红队测试大语言模型

Qingchao Shen, Zibo Xiao, Lili Huang, Enwei Hu, Yongqiang Tian, Junjie Chen

机构 * School of Computer Software(计算机软件学院) Tianjin University(天津大学) Monash University(墨尔本大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出TEMPLATEFUZZ框架,通过细粒度模糊测试揭示大语言模型聊天模板的漏洞,实现高攻击成功率的同时保持模型准确性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12162 2026-04-15 cs.CL 70%

AlphaEval: Evaluating Agents in Production

AlphaEval:生产环境中的代理评估

Pengrui Lu, Bingyu Xu, Wenjun Zhang, Shengjia Hua, Xuanjian Gao, Ranxiang Ge, Lyumanshan Ye, Linxuan Wu, Yiran Li, Junfei Fish Yu, Yibo Zhang, Ruixin Li, Manxiang Li, Xiao Han, Xiaocong Zhou, Guangyao Chi, Zisheng Chen, Kaishen Chen, Kun Wang, Qihua Xu, Fengyue Meng, Yuchen Ni, Jiajun Li, Jinxiu Liu, Danfeng Zhang, Jingru Zhao, Pengfei Liu

机构 * SII MiraclePlus SJTU(上海交通大学) GAIR HIT(哈尔滨工业大学) UCAS(中国科学技术大学) LangCore Jiqizhixin HunterAI CinoCore KuaFuAI POET

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 AlphaEval 是一个基于生产环境的评估基准,包含 94 个任务,涵盖六个职业领域,通过多种评估方法评估完整代理产品,提供可复现的构建框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12040 2026-04-15 cs.CR cs.AI cs.SE 70%

SIR-Bench: Evaluating Investigation Depth in Security Incident Response Agents

SIR-Bench:评估安全事件响应代理的调查深度

Daniel Begimher, Cristian Leo, Jack Huang, Pat Gaw, Bonan Zheng

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出SIR-Bench基准,通过794个测试用例评估自主安全事件响应代理的调查能力,包含三类指标:分诊准确率、新证据发现率和工具使用恰当性。

Comments 9 pages, 6 tables, 1 figure. Equal contribution by first three authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09729 2026-04-15 cs.CV cs.AI 70%

LOLGORITHM: Funny Comment Generation Agent For Short Videos

LOLGORITHM:短视频 funny 评论生成代理

Xuan Ouyang, Bouzhou Wang, Senan Wang, Siyuan Xiahou, Jinrong Zhou, Yuekang Li

机构 * University of New South Wales(新南威尔士大学) University of Sydney(悉尼大学) The University of Hong Kong(香港大学) University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出LOLGORITHM框架,通过视频摘要、分类和语义检索生成符合平台文化的短视频评论,实验显示其在YouTube和抖音上的人类偏好选择率高达80.46%和84.29%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12575 2026-04-15 cs.CV 67%

StructDiff: A Structure-Preserving and Spatially Controllable Diffusion Model for Single-Image Generation

StructDiff:一种结构保持且空间可控的单图像生成扩散模型

Yinxi He, Kang Liao, Chunyu Lin, Tianyi Wei, Yao Zhao

机构 * Institute of Information Science, Beijing Jiaotong University(信息科学研究院,北京交通大学) Visual Intelligence +X International Cooperation Joint Laboratory of MOE, Beijing(教育部视觉智能+X国际合作联合实验室,北京) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 StructDiff基于单尺度扩散模型提出,通过自适应感受野模块和3D位置编码实现结构保持与空间可控,引入基于大语言模型的新型评估标准,优于现有方法在结构一致性、视觉质量和空间可控性上。

Comments Accepted by IEEE Transactions on Multimedia (Regular Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12481 2026-04-15 cs.CV 67%

T2I-BiasBench: A Multi-Metric Framework for Auditing Demographic and Cultural Bias in Text-to-Image Models

T2I-BiasBench:一个用于审计文本到图像模型中人口和文化偏见的多指标框架

Nihal Jaiswal, Siddhartha Arjaria, Gyanendra Chaubey, Ankush Kumar, Aditya Singh, Anchal Chaurasiya

机构 * Department of Information Technology, Rajkiya Engineering College Banda(拉贾基亚工程学院班达信息科技系) School of AI and Data Science, Indian Institute of Technology Jodhpur(印度理工学院乔普拉人工智能与数据科学学院)

专题命中 评测与基准 :RLHF(abstract,abstract_cn)

AI总结 本文提出T2I-BiasBench框架,通过十三个互补指标评估扩散模型中的偏见、元素缺失和文化崩溃,揭示了开源模型在人口和文化偏见方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12090 2026-04-15 cs.DC 67%

Evaluating Cross-Architecture Performance Modeling of Distributed ML Workloads Using StableHLO

使用StableHLO评估分布式机器学习工作负载的跨架构性能建模

Jonas Svedas, Nathan Laubeuf, Ryan Harvey, Arjun Singh, Changhai Man, Abubakr Nada, Tushar Krishna, James Myers, Debjyoti Bhattacharjee

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文评估StableHLO是否能作为统一的工作负载表示,用于跨架构和跨保真度的分布式机器学习工作负载性能建模,通过建立基于StableHLO的模拟方法,展示了在不同架构和保真度下的性能评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11970 2026-04-15 cs.CV cs.AI cs.CL cs.LG 67%

INDOTABVQA: A Benchmark for Cross-Lingual Table Understanding in Bahasa Indonesia Documents

INDOTABVQA:一种用于巴厘语文档中跨语言表格理解的基准测试

Somraj Gautam, Anathapindika Dravichi, Gaurav Harit

机构 * IIT Jodhpur(印度理工学院贾尔普尔分校) Punjabi University(旁遮普大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出INDOTABVQA基准测试,用于评估跨语言表格视觉问答性能,包含1593张文档图像和四语问题-答案对,揭示了VLM在单语和跨语言设置下的性能差异,并展示了微调对提升准确性的作用。

Comments Accepted in ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11964 2026-04-15 cs.HC cs.MM 67%

When Drawing Is Not Enough: Exploring Spontaneous Speech with Sketch for Intent Alignment in Multimodal LLMs

当绘画不够时:探索通过草图进行意图对齐的自发性言语在多模态大语言模型中的应用

Weiyan Shi, Dorien Herremans, Kenny Tsu Wei Choo

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文探讨了在多模态大语言模型中,通过草图与自发性言语的结合来提升设计初期意图对齐的效果,通过实验表明加入自发性言语能显著提高生成图像的意图匹配度。

Comments Accepted at DIS 2026 PWiP

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11934 2026-04-15 cs.CY 67%

BiasIG: Benchmarking Multi-dimensional Social Biases in Text-to-Image Models

BiasIG:评估文本到图像模型中多维社会偏见的基准测试

Hanjun Luo, Zhimu Huang, Haoyu Huang, Ziye Deng, Ruizhe Chen, Xinfeng Li, Zuozhu Liu, Hanan Salam

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出BiasIG基准,通过47040个提示的定制数据集量化多维社会偏见,结合社会学和机器伦理框架,揭示生成偏见的细粒度诊断方法,并验证了公平性在AIGC中的精确分类方法。

Comments Accepted by IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12659 2026-04-15 cs.LG cs.CL 62%

Do VLMs Truly "Read" Candlesticks? A Multi-Scale Benchmark for Visual Stock Price Forecasting

视觉语言模型真的能‘解读’K线图吗?一种多尺度的视觉股票价格预测基准

Kaiqi Hu, Linda Xiao, Shiyue Xu, Ziyi Tang, Mingwen Liu

机构 * University of Leeds(利兹大学) Sun Yat-sen University(中山大学) Likelihood Lab(Likelihood实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出多尺度K线图基准,评估视觉语言模型对多尺度视觉市场动态的理解能力,发现大多数模型在持续上涨或下跌时表现良好,但在常见市场场景中预测能力较弱。

Comments We evaluate whether VLMs can comprehend multi-scale visual stock price data like human analysts with a proposed benchmark, identifying current VLMs' weak predictive power, significant biases, and limited sensitivity to forecast horizons and prompts

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12075 2026-04-15 cs.CV cs.AI cs.LG q-bio.QM 62%

OpenTME: An Open Dataset of AI-powered H&E Tumor Microenvironment Profiles from TCGA

OpenTME:一个基于AI的H&E肿瘤微环境谱开放数据集

Maaike Galama, Nina Kozar-Gillan, Christina Embacher, Todd Dembo, Cornelius Böhm, Evelyn Ramberger, Julika Ribbat-Idel, Rosemarie Krupar, Verena Aumiller, Miriam Hägele, Kai Standvoss, Gerrit Erdmann, Blanca Pablos, Ari Angelo, Simon Schallenberg, Andrew Norgan, Viktor Matyas, Klaus-Robert Müller, Maximilian Alber, Lukas Ruff, Frederick Klauschen

机构 * Aignostics, Germany(德国Aignostics公司) Institute of Pathology, Charité – Universitätsmedizin Berlin, Germany(德国柏林Charité大学医学院病理研究所) Department of Laboratory Medicine and Pathology, Mayo Clinic, Rochester, MN, US(美国明尼苏达州罗切斯特梅奥诊所实验室医学与病理学部) Machine Learning Group, Technische Universität Berlin, Germany(德国柏林技术大学机器学习小组) BIFOLD – Berlin Institute for the Foundations of Learning and Data, Germany(德国柏林学习与数据基础研究所(BIFOLD)) Department of Artificial Intelligence, Korea University, Republic of Korea(韩国韩国大学人工智能系) Max-Planck Institute for Informatics, Germany(德国马克斯·普朗克信息研究所) German Cancer Research Center (DKFZ) & German Cancer Consortium (DKTK), Berlin & Munich Partner Sites, Germany(德国癌症研究中心(DKFZ)与德国癌症联盟(DKTK)柏林及慕尼黑合作伙伴站点) Institute of Pathology, Ludwig-Maximilians-Universität München, Germany(德国慕尼黑路德维希-马克西米利安大学病理研究所) Bavarian Cancer Research Center (BZKF), Germany(德国巴伐利亚癌症研究中心(BZKF))

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 OpenTME通过AI技术对TCGA中的5种癌症类型H&E染色图像进行预计算微环境分析,提供超过4500个细胞级定量读数,支持空间生物学研究和计算方法开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12951 2026-04-15 cs.LG 57%

The Verification Tax: Fundamental Limits of AI Auditing in the Rare-Error Regime

验证税:在稀有错误领域中AI审计的根本限制

Jason Z Wang

机构 * Independent(独立)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.LG

AI总结 研究揭示了在稀有错误领域中,AI审计的根本限制,证明了校准误差估计的最小最大速率,并指出验证成本随管道深度指数增长。

Comments 25 pages, 16 figures, 6 tables. Code and data at https://github.com/Jason-Wang313/verification-tax

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12026 2026-04-15 cs.LG q-bio.BM q-bio.QM 57%

TriFit: Trimodal Fusion with Protein Dynamics for Mutation Fitness Prediction

TriFit:结合蛋白质动力学的三模态融合用于突变适应度预测

Seungik Cho

机构 * Department of Physics(物理系) Astronomy, Rice University, Texas, USA(天文学、里士满大学、德克萨斯州、美国)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 TriFit通过三模态融合模块整合序列、结构和蛋白质动力学信息,利用四专家混合专家模型提升突变适应度预测性能,实现优于现有基线模型的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08196 2026-04-15 astro-ph.IM astro-ph.GA astro-ph.HE 50%

A Statistical-AI Framework for Detecting Transient Flares in SDSS Stripe 82 Quasar Light Curves

基于统计-人工智能框架的SDSS Stripe 82类星体光变曲线暂Transient耀斑检测

Atal Agrawal

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出FLARE框架,通过物理信息学习、异常评分和识别引擎检测暂Transient耀斑,利用EVT进行异常评分,并验证候选者。

Comments 22 pages, 20 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22039 2026-04-15 cs.CV 50%

SparseWorld-TC: Trajectory-Conditioned Sparse Occupancy World Model

SparseWorld-TC: 基于轨迹的稀疏占用世界模型

Jiayuan Du, Yiming Zhao, Zhenglong Guo, Yong Pan, Wenbo Hou, Zhihui Hao, Kun Zhan, Qijun Chen

机构 * Tongji University(同济大学) Li Auto Inc(力汽车公司)

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出了一种基于轨迹的未来3D场景占用预测新架构,通过端到端方式直接从原始图像特征预测多帧占用,避免了离散token化和BEV表示的限制,实现了nuScenes基准上的1-3秒占用预测最优性能。

Comments Accepted by CVPR2026 as an oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12054 2026-04-15 cs.MA 50%

REGREACT: Self-Correcting Multi-Agent Pipelines for Structured Regulatory Information Extraction

REGREACT:用于结构化监管信息提取的自校正多智能体流程

Mohammed Ali, Abdelrahman Abdallah, Adam Jatowt

专题命中 评测与基准 :language model(abstract)

AI总结 REGREACT通过自校正多智能体框架,将监管信息提取分解为七个阶段,每个阶段包含观察-诊断-修复循环,以提高结构化合规标准提取的准确性和完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏