arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

共收录 1842
2601.10527 2026-01-19 cs.AI cs.CL cs.CV cs.LG

A Safety Report on GPT-5.2, Gemini 3 Pro, Qwen3-VL, Grok 4.1 Fast, Nano Banana Pro, and Seedream 4.5

GPT-5.2、Gemini 3 Pro、Qwen3-VL、Grok 4.1 Fast、Nano Banana Pro 和 Seedream 4.5 的安全报告

Xingjun Ma, Yixu Wang, Hengyuan Xu, Yutao Wu, Yifan Ding, Yunhan Zhao, Zilong Wang, Jiabin Hua, Ming Wen, Jianan Liu, Ranjie Duan, Yifeng Gao, Yingshui Tan, Yunhao Chen, Hui Xue, Xin Wang, Wei Cheng, Jingjing Chen, Zuxuan Wu, Bo Li, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation institute(上海创新研究院) Deakin University(德克萨斯大学) UIUC(伊利诺伊大学香槟分校)

AI总结 本报告对六个前沿模型进行综合安全性评估,揭示其在安全性和鲁棒性方面的差异,强调需要标准化评估以指导负责任的部署。

Comments 41 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10880 2026-01-19 cs.CV cs.AI

Medical SAM3: A Foundation Model for Universal Prompt-Driven Medical Image Segmentation

医学SAM3:一种通用提示驱动的医学图像分割基础模型

Chongcong Jiang, Tianxingjian Ding, Chuhan Song, Jiachen Tu, Ziyang Yan, Yihua Shao, Zhenyi Wang, Yuzhang Shang, Tianyu Han, Yu Tian

机构 * University of Central Florida, Orlando, USA(佛罗里达大学) University College London, London, UK(伦敦大学学院) University of Illinois Urbana-Champaign, Champaign, USA(伊利诺伊大学厄巴纳-香槟分校) University of Trento, Trento, Italy(特伦托大学) The Hong Kong Polytechnic University, China(香港理工大学) University of Pennsylvania, Philadelphia, USA(宾夕法尼亚大学)

AI总结 Medical SAM3通过微调SAM3模型,提升医学图像分割的通用提示驱动能力,解决领域偏移和复杂结构推理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09760 2026-01-16 cs.SE cs.AI

Investigating Tool-Memory Conflicts in Tool-Augmented LLMs

探究工具增强大语言模型中的工具-记忆冲突

Jiali Cheng, Rui Pan, Hadi Amiri

机构 * University of Massachusetts Lowell(马萨诸塞大学洛约拉分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出工具-记忆冲突的概念,发现现有LLMs在STEM任务中存在该问题,并评估了现有解决方法的不足。

Comments R2-FM Workshop @ ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09709 2026-01-16 cs.LG cs.CL cs.CY

Social Determinants of Health Prediction for ICD-9 Code with Reasoning Models

基于推理模型的ICD-9代码社会决定因素预测

Sharim Khan, Paul Landes, Adam Cross, Jimeng Sun

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Illinois Chicago Peoria(伊利诺伊大学芝加哥分校皮奥里亚分校)

AI总结 本文提出利用推理模型和传统大语言模型,在MIMIC-III数据集上对医院入院的多标签社会决定因素ICD-9代码进行分类,实现了89%的F1分数,并发现139次入院中缺失的SDoH代码。

Comments Published as part of Machine Learning for Health (ML4H) 2025 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16863 2026-01-15 cs.CV

BARL: Bilateral Alignment in Representation and Label Spaces for Semi-Supervised Volumetric Medical Image Segmentation

BARL:表示空间和标签空间的双侧对齐用于半监督体积医学图像分割

Shujian Gao, Yuan Wang, Zekuan Yu

机构 * College of Biomedical and Engineering, Fudan University(复旦大学生物医学与工程学院) ZJU-UIUC Institute, Zhejiang University(浙江大学浙大-UIUC研究院)

AI总结 BARL通过双侧对齐表示空间和标签空间,提升半监督体积医学图像分割的性能。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09083 2026-01-15 cs.LG

SRT: Accelerating Reinforcement Learning via Speculative Rollout with Tree-Structured Cache

SRT:通过树结构缓存的推测式回滚加速强化学习

Chi-Chih Chang, Siqi Zhu, Zhichen Zeng, Haibin Lin, Jiaxuan You, Mohamed S. Abdelfattah, Ziheng Jiang, Xuehai Qian

机构 * Cornell University(康奈尔大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) University of Washington(华盛顿大学) ByteDance(字节跳动)

AI总结 SRT通过树结构缓存的推测式回滚方法,有效加速语言模型的在线强化学习,提升生成效率并降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08876 2026-01-15 cs.CV

The Semantic Lifecycle in Embodied AI: Acquisition, Representation and Storage via Foundation Models

具身AI中的语义生命周期:通过基础模型实现获取、表示与存储

Shuai Chen, Hao Chen, Yuanchen Bei, Tianyang Zhao, Zhibo Zhou, Feiran Huang

机构 * College of Information Science and Technology, Jinan University(信息科学与技术学院,暨南大学) Faculty of Data Science, City University of Macau(数据科学学院,澳门城市大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Zhongguancun Laboratory(中关村实验室) College of Cyber Security, Jinan University(网络安全学院,暨南大学)

AI总结 本文提出语义生命周期框架,通过基础模型在具身AI中实现语义信息的获取、表示与存储,探讨了语义处理的连续流动与维护,并总结了当前挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08331 2026-01-14 cs.CL

CLaS-Bench: A Cross-Lingual Alignment and Steering Benchmark

CLaS-Bench: 一种跨语言对齐与引导基准

Daniil Gurgurov, Yusser Al Ghussin, Tanja Baeumel, Cheng-Ting Chou, Patrick Schramowski, Marius Mosbach, Josef van Genabith, Simon Ostermann

机构 * Saarland University(萨尔兰大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Centre for European Research in Trusted AI (CERTAIN)(可信AI欧洲研究中心(CERTAIN)) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) TU Darmstadt(德累斯顿技术大学) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所(Mila)) McGill University(麦吉尔大学)

AI总结 CLaS-Bench是首个多语言引导基准,通过评估32种语言中的语言强制行为,验证了残差基于DiffMean方法在跨语言引导中的有效性。

Comments pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08139 2026-01-14 cs.CV cs.AI

Subspace Alignment for Vision-Language Model Test-time Adaptation

子空间对齐用于视觉-语言模型测试时适应

Zhichen Zeng, Wenxuan Bao, Xiao Lin, Ruizhong Qiu, Tianxin Wei, Xuying Ning, Yuchen Yan, Chen Luo, Monica Xiao Cheng, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

AI总结 SubTTA通过子空间对齐提升视觉-语言模型测试时适应性能,有效解决模态差距和视觉噪声问题。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07963 2026-01-14 cs.CV

3DGS-Drag: Dragging Gaussians for Intuitive Point-Based 3D Editing

3DGS-Drag:基于高斯分布的直观点基3D编辑

Jiahua Dong, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 3DGS-Drag通过结合变形引导和扩散引导,实现高效直观的点基3D场景拖动编辑,提升几何内容编辑的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07854 2026-01-14 q-bio.OT cs.AI

Immunological Density Shapes Recovery Trajectories in Long COVID

免疫密度塑造长期新冠恢复轨迹

Jing Wang, Tong Zhang, Xing Niu, Jie Shen, Yiming Luo, Qiaomin Xie, Amar Sra, Zorina Galis, Jeremy Weiss

机构 * National Library of Medicine(国家医学图书馆) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stevens Institute of Technology(史蒂文斯理工学院) Columbia University(哥伦比亚大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) George Washington University(乔治华盛顿大学) National Heart, Lung, and Blood Institute(国家心肺血液研究所)

AI总结 研究发现长期新冠症状严重程度由免疫密度决定,恢复主要通过重复接种疫苗实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00982 2026-01-14 cs.MA cs.RO cs.SE

Assuring Safety of Vision-Based Swarm Formation Control

基于视觉的群体形成控制的安全性保障

Chiao Hsieh, Yubin Koh, Yangge Li, Sayan Mitra

机构 * Coordinated Science Laboratory, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校协调科学实验室)

AI总结 本文提出了一种基于感知契约的量化器,用于保障基于视觉的群体形成控制系统的安全性,通过非均匀量化器和收敛性证明,提高在复杂环境下的鲁棒性。

Comments 8 pages, 7 figures, submitted to the 2024 American Control Conference (ACC 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03637 2026-01-13 cs.CV

CrackSegFlow: Controllable Flow Matching Synthesis for Generalizable Crack Segmentation with a 50K Image-Mask Benchmark

CrackSegFlow: 可控流匹配合成用于通用裂纹分割的50K图像-掩码基准

Babak Asadi, Peiyang Wu, Mani Golparvar-Fard, Ramez Hajj

机构 * Department of Civil and Environmental Engineering, Grainger College of Engineering, University of Illinois Urbana--Champaign(土木与环境工程系,格拉inger工程学院,伊利诺伊大学厄巴纳-香槟分校) Department of Computer Science, Grainger College of Engineering, University of Illinois Urbana--Champaign(计算机科学系,格拉inger工程学院,伊利诺伊大学厄巴纳-香槟分校)

AI总结 CrackSegFlow通过可控流匹配合成方法,利用50K图像-掩码基准提升裂纹分割的泛化能力和性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10105 2026-01-13 cs.AI

Belief Is All You Need: Modeling Narrative Archetypes in Conspiratorial Discourse

信念即一切:在阴谋论话语中建模叙事原型

Soorya Ram Shimgekar, Abhay Goyal, Roy Ka-Wei Lee, Koustuv Saha, Pi Zonooz, Navin Kumar

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nimblemind(Nimblemind公司) Singapore University of Technology and Design(新加坡科技设计大学)

AI总结 本文提出SiBeGNN模型,通过分析Telegram群组中的阴谋论话语,识别出七种叙事原型,挑战了传统对网络激进化的认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19577 2026-01-13 cs.AI cs.HC

From Wearables to Warnings: Predicting Pain Spikes in Patients with Opioid Use Disorder

从可穿戴设备到预警:预测阿片类药物使用障碍患者疼痛峰值

Abhay Goyal, Navin Kumar, Kimberly DiMeola, Rafael Trujillo, Soorya Ram Shimgekar, Christian Poellabauer, Pi Zonooz, Ermonda Gjoni-Markaj, Declan Barry, Lynn Madden

机构 * Nimblemind USA(Nimblemind美国公司) APT Foundation New Haven CT USA(APT基金会) Florida International University(佛罗里达国际大学) University of Illinois – Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Yale University School of Medicine(耶鲁大学医学院)

AI总结 本研究利用AI方法预测阿片类药物使用障碍患者疼痛峰值,发现机器学习模型在预测准确性上较高,而LLMs在提供见解方面有限,强调需开发更有效的LLMs以提升治疗效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04194 2026-01-13 cs.CL cs.AI cs.LG

The Best Instruction-Tuning Data are Those That Fit

最适合指令微调的数据是那些能适应的

Dylan Zhang, Qirun Dai, Hao Peng

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Chicago(芝加哥大学)

AI总结 GRAPE通过选择与目标模型分布最匹配的响应,提升大语言模型的微调效果,实验显示其在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06307 2026-01-13 cs.CL

A Rising Tide Lifts All Boats: MTQE Rewards for Idioms Improve General Translation Quality

潮水上涨,所有船都会上升:MTQE对习语的奖励提升一般翻译质量

Ishika Agarwal, Zhenlin He, Dhruva Patil, Dilek Hakkani-Tür

机构 * UIUC(伊利诺伊大学香槟分校)

AI总结 通过MTQE奖励机制提升模型对习语的翻译能力,显著改善一般翻译质量及跨语言翻译表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06060 2026-01-13 cs.CY cs.AI cs.CL

Why Slop Matters

为何 slop 重要

Cody Kommers, Eamon Duede, Julia Gordon, Ari Holtzman, Tess McNulty, Spencer Stewart, Lindsay Thomas, Richard Jean So, Hoyt Long

机构 * The Alan Turing Institute(艾伦·图灵研究所) Purdue University(普渡大学) Duke University(杜克大学) University of Chicago(芝加哥大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Cornell University(康奈尔大学)

AI总结 本文探讨了AI生成内容(slop)的社会功能与审美价值,指出其在文化经济中的重要性,并提出其三个核心特征。

Comments To be published in ACM AI Letters (submitted 8 December 2025; accepted 23 December 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06039 2026-01-13 cs.CL

Operation Veja: Fixing Fundamental Concepts Missing from Modern Roleplaying Training Paradigms

Operation Veja: 修复现代角色扮演训练范式中缺失的根本概念

Yueze Liu, Ajay Nagi Reddy Kumdam, Ronit Kanjilal, Hao Yang, Yichi Zhang

机构 * Divergence 2% LLC Department of Electrical and Computer Engineering University of Illinois Urbana-Champaign(电气与计算机工程系伊利诺伊大学厄巴纳-香槟分校) Department of Computer Science University of Illinois Urbana-Champaign(计算机科学系伊利诺伊大学厄巴纳-香槟分校)

AI总结 Operation Veja提出VEJA框架,通过整合价值观、经历、判断和能力,改进角色扮演模型的数据整理方法,以提升角色真实性和叙述连续性。

Comments Accepted to NeurIPS 2025 PeronaLLM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11321 2026-01-13 cs.CV

JoIN: Joint GANs Inversion for Intrinsic Image Decomposition

JoIN: 用于内在图像分解的联合GAN反向求解

Viraj Shah, Svetlana Lazebnik, Julien Philip

机构 * UIUC(伊利诺伊大学) Adobe Research(Adobe研究)

AI总结 JoIN通过联合反向求解多个GAN实现内在图像分解,利用合成数据训练GAN先验并微调生成器,以提高真实图像的泛化能力。

Comments Project webpage is available at https://virajshah.com/join

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06022 2026-01-12 cs.CL cs.AI

AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs

AdaFuse: 用于大语言模型的自适应集成解码与测试时缩放

Chengming Cui, Tianxin Wei, Ziyi Chen, Ruizhong Qiu, Zhichen Zeng, Zhining Liu, Xuying Ning, Duo Zhou, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 AdaFuse通过自适应集成解码与测试时缩放,提升大语言模型在多种任务上的生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03905 2026-01-09 cs.AI cs.CL cs.LG

Current Agents Fail to Leverage World Model as Tool for Foresight

当前智能体无法利用世界模型作为前瞻性工具

Cheng Qian, Emre Can Acikgoz, Bingxuan Li, Xiusi Chen, Yuji Zhang, Bingxiang He, Qinyu Luo, Dilek Hakkani-Tür, Gokhan Tur, Yunzhu Li, Heng Ji

机构 * UIUC(伊利诺伊大学香槟分校) THU(清华大学) JHU(约翰霍普金斯大学) Columbia(哥伦比亚大学)

AI总结 本文研究了当前智能体能否利用世界模型作为工具提升前瞻性认知,发现其在模拟调用和结果整合方面存在显著不足。

Comments 36 Pages, 13 Figures, 17 Tables (Meta data updated)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13479 2026-01-08 quant-ph cs.LG q-bio.BM

Quantum-machine-assisted Drug Discovery

量子计算辅助药物发现

Yidong Zhou, Jintai Chen, Jinglei Cheng, Xu Cao, Yuanyuan Zhang, Gopal Karemore, Marinka Zitnik, Frederic T. Chong, Junyu Liu, Tianfan Fu, Zhiding Liang

机构 * Rensselaer Polytechnic Institute(拉特格斯理工大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Pittsburgh(匹兹堡大学) University of Chicago(芝加哥大学) Novo Nordisk A/S(诺和制药) Harvard University(哈佛大学)

AI总结 本文提出利用量子计算加速药物发现过程,通过分子模拟、药物-靶点相互作用预测和优化临床试验来提升效率和降低成本。

Comments 23 pages, 4 figures

Journal ref NPJ Drug Discov. 3, 1 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03600 2026-01-08 cs.LG cs.AI cs.IR

ALERT: Zero-shot LLM Jailbreak Detection via Internal Discrepancy Amplification

ALERT: 通过内部不一致放大实现零样本LLM jailbreak检测

Xiao Lin, Philip Li, Zhichen Zeng, Tingwei Li, Tianxin Wei, Xuying Ning, Gaotang Li, Yuzhong Chen, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Visa

AI总结 ALERT通过内部不一致放大技术实现零样本LLM jailbreak检测,有效提升安全检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03515 2026-01-08 cs.CL cs.AI

Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents

Mem-Gallery: 多模态长时对话记忆的基准测试用于 MLLM 代理

Yuanchen Bei, Tianxin Wei, Xuying Ning, Yanjun Zhao, Zhining Liu, Xiao Lin, Yada Zhu, Hendrik Hamann, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM沃森人工智能实验室,IBM研究) Stony Brook University(石溪大学) Brookhaven National Laboratory(布鲁赫斯国家实验室)

AI总结 Mem-Gallery 是一个用于评估多模态长时对话记忆的基准测试,通过多会话对话数据集和系统评估框架,揭示了记忆提取、推理和知识管理的关键发现。

Comments 34 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00454 2026-01-07 cs.CL

Learning an Efficient Multi-Turn Dialogue Evaluator from Multiple LLM Judges

从多个LLM裁判中学习高效的多轮对话评估器

Yuqi Tang, Kehua Feng, Yunfeng Wang, Zhiwen Chen, Chengfei Lv, Gang Yu, Qiang Zhang, Keyan Ding, Huajun Chen

机构 * ZJU–UIUC Institute(浙大UIUC研究院) ZJU–Hangzhou Global Scientific and Technological Innovation Center(浙大杭州全球科技创新中心) College of Computer Science and Technology(计算机科学与技术学院) Alibaba Group(阿里巴巴集团)

AI总结 本文提出一种高效多轮对话评估器,通过整合多个LLM裁判的偏好知识,减少计算开销并提升评估效率与鲁棒性。

Comments 20 pages, 4 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20100 2026-01-07 cs.LG cs.AI cs.CL cs.CV

MIRAGE: A Benchmark for Multimodal Information-Seeking and Reasoning in Agricultural Expert-Guided Conversations

MIRAGE:农业专家引导对话中多模态信息检索与推理的基准

Vardhan Dongre, Chi Gui, Shubham Garg, Hooshang Nayyeri, Gokhan Tur, Dilek Hakkani-Tür, Vikram S. Adve

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

AI总结 MIRAGE是一个用于农业专家引导对话中多模态信息检索与推理的基准,通过真实用户-专家交互数据,提供高保真的多模态推理评估平台。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17417 2026-01-07 cs.LG

Aha Moment Revisited: Are VLMs Truly Capable of Self Verification in Inference-time Scaling?

顿悟时刻再审视:VLMs在推理时间缩放中真的能自我验证吗?

Mingyuan Wu, Meitang Li, Jingcheng Yang, Jize Jiang, Kaizhuo Yan, Zhaoheng Li, Hanchao Yu, Minjia Zhang, Klara Nahrstedt

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan Ann Arbor(密歇根大学安娜堡分校) Meta

AI总结 本研究发现VLMs在推理时间缩放中自我验证效果有限,生成能力优于验证策略,且视觉信息整合不足。

Comments Neurips 2025 Multimodal Algorithmic Reasoning Workshop Oral. In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00933 2026-01-06 cs.LG cs.AI cs.SI

LOFA: Online Influence Maximization under Full-Bandit Feedback using Lazy Forward Selection

LOFA: 在全伯德反馈下使用懒惰前向选择的在线影响最大化

Jinyu Xu, Abhishek K. Umrawal

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 LOFA通过利用次模性质和懒惰前向选择,在全伯德反馈下实现更低的实证后悔,优于现有算法。

Comments 14 pages and 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22535 2026-01-06 cs.AI cs.CL

OFFSIDE: Benchmarking Unlearning Misinformation in Multimodal Large Language Models

OFFSIDE: 多模态大语言模型中误信信息消除的基准测试

Hao Zheng, Zirui Pang, Ling li, Zhijie Deng, Yuhan Pu, Zhaowei Zhu, Xiaobo Xia, Jiaheng Wei

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) BIAI, ZJUT & D5Data.ai(BIAI、浙江工业大学及D5Data.ai) National University of Singapore(新加坡国立大学)

AI总结 OFFSIDE通过足球转会谣言数据集,评估多模态大语言模型中误信信息消除的挑战与方法,揭示现有技术的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏