arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 2342
2510.08564 2026-04-22 cs.AI cs.CV cs.LG

How to Teach Large Multimodal Models New Skills

如何向大型多模态模型传授新技能

Zhen Zhu, Yiming Gong, Yao Xiao, Yaoyao Liu, Derek Hoiem

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google DeepMind(谷歌DeepMind) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文研究了如何在不丧失原有能力的前提下通过序列微调向大型多模态模型传授新技能,提出两种有效的微调方法以平衡学习与遗忘。

Comments In submission. Code is available at https://github.com/jessemelpolio/LMM_CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00161 2026-04-22 cs.LG cs.CL

Watch the Weights: Unsupervised monitoring and control of fine-tuned LLMs

监视权重:无监督的细调大语言模型监控与控制

Ziqian Zhong, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出通过监控权重而非激活值来理解、监控和控制细调的大语言模型,能高精度检测细调引入的新行为,并在防回火攻击和模型去学习中表现出色。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06414 2026-04-22 cs.CR cs.AI

Benchmarking Misuse Mitigation Against Covert Adversaries

对抗隐蔽攻击的误用缓解基准测试

Davis Brown, Mahdi Sabbaghi, Luze Sun, Alexander Robey, George J. Pappas, Eric Wong, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出BSD基准测试,用于评估对抗隐蔽攻击的防御策略,通过生成两个拒绝前沿模型的难数据集,揭示分解攻击的有效性及状态化防御的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18512 2026-04-21 cs.CV

S2H-DPO: Hardness-Aware Preference Optimization for Vision-Language Models

S2H-DPO:面向视觉-语言模型的硬度感知偏好优化

Nitish Shukla, Surgan Jandial, Arun Ross

机构 * Michigan State University(密歇根州立大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出S2H-DPO框架,通过三级层次推理构建多图象偏好数据,提升多图象推理性能,同时保持单图象推理能力,推动视觉偏好对齐的前沿发展。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18362 2026-04-21 cs.CL cs.IR

ArbGraph: Conflict-Aware Evidence Arbitration for Reliable Long-Form Retrieval-Augmented Generation

ArbGraph:面向可靠长形式检索增强生成的冲突感知证据仲裁

Qingying Niu, Yuhao Wang, Ruiyang Ren, Bohui Fang, Wayne Xin Zhao

机构 * Gaoling School of Artificial Intelligence(高岭人工智能学院) Renmin University of China(中国人民大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 ArbGraph通过预生成阶段的证据仲裁解决长形式RAG中的事实冲突,提升事实一致性与信息密度,减少幻觉和检索噪声影响。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17734 2026-04-21 cs.CV

Score-Based Matching with Target Guidance for Cryo-EM Denoising

基于目标引导的cryo-EM去噪评分匹配

Xiaoqi Wu, Xueying Zhan, Wen Li, Junhao Wu, Xin Huang, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) Towson University(托马斯大学)

AI总结 本文提出基于评分的cryo-EM去噪框架,通过学习干净数据评分恢复粒子信号并保留结构信息,引入目标引导变体以稳定评分学习,提升下游分析性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17629 2026-04-21 cs.CV

BioVLM: Routing Prompts, Not Parameters, for Cross-Modality Generalization in Biomedical VLMs

BioVLM:通过路由提示而非参数实现生物医学VLMs的跨模态泛化

Mainak Singha, Tanisha Gupta, Ankit Jha, Muhammad Haris Khan, Sayantani Ghosh, Biplab Banerjee

机构 * University of Trento(特伦托大学) Carnegie Mellon University(卡内基梅隆大学) LNMIIT Jaipur(贾伊普尔 LNMIIT) MBZUAI Sunandan Divatia School of Science(Sunandan Divatia 科学学院) IIT Bombay(博伊斯大学)

AI总结 BioVLM通过动态提示选择和提示银行学习,提升跨域泛化能力,无需大量骨干网络微调,在11个MedMNIST+2D数据集上取得新突破。

Comments Accepted in ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17596 2026-04-21 cs.CR cs.AI

Terminal Wrench: A Dataset of 331 Reward-Hackable Environments and 3,632 Exploit Trajectories

终端 wrench:331个可奖励黑客环境和3,632条exploit轨迹的数据集

Ivan Bercovich, Ivgeni Segal, Kexun Zhang, Shashwat Saxena, Aditi Raghunathan, Ziqian Zhong

机构 * Fewshot Corp(Fewshot公司) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文发布了一个包含331个终端代理基准环境和3,632条exploit轨迹的数据集,展示了不同任务中的特定exploit方法,并通过LLM评估检测性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17568 2026-04-21 cs.LG math.ST stat.ML stat.TH

Diverse Dictionary Learning

多样字典学习

Yujia Zheng, Zijian Li, Shunxing Fan, Andrew Gordon Wilson, Kun Zhang

机构 * CMU(卡内基梅隆大学) MBZUAI(马克斯·普朗克人工智能研究所) NYU(纽约大学)

AI总结 本文提出多样字典学习问题,探讨在无法完全辨识的情况下,如何通过集合运算恢复潜在变量的结构,并展示其在合成和真实数据中的有效性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17259 2026-04-21 cs.IR cs.AI cs.CL

HORIZON: A Benchmark for In-the-wild User Behaviour Modeling

HORIZON:一个面向真实世界用户行为建模的基准

Arnav Goel, Pranjal A Chitale, Bhawna Paliwal, Bishal Santra, Amit Sharma

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research India(微软印度研究院) University of California, Berkeley(加州大学伯克利分校)

AI总结 HORIZON基准通过跨领域、长时域的数据和任务设计,解决传统用户建模基准的局限性,提出新的任务和评估方法,评估模型在异构环境中的泛化能力。

Comments 19 pages, accepted to ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05073 2026-04-21 cs.AI

Uncertainty Quantification in LLM Agents: Foundations, Emerging Challenges, and Opportunities

大语言模型代理中的不确定性量化:基础、新兴挑战与机遇

Changdae Oh, Seongheon Park, To Eun Kim, Jiatong Li, Wendi Li, Samuel Yeh, Xuefeng Du, Hamed Hassani, Paul Bogdan, Dawn Song, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学) University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文探讨了大语言模型代理中不确定性量化的基础、挑战及未来方向,提出新的框架并分析了现实场景中的技术难题。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04717 2026-04-21 cs.CL cs.AI

Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models

超越单轮:大型语言模型多轮交互的综述

Yubo Li, Xiaobin Shen, Yidi Miao, Xinyu Yao, Xueying Ding, Ramayya Krishnan, Rema Padman

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文综述了大型语言模型在多轮交互中的评估与增强进展,探讨了多轮对话中上下文、连贯性、公平性和响应性等挑战,并总结了模型优化、外部整合和协作技术等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11338 2026-04-21 cs.AI cs.LG

Automatic Dataset Construction (ADC): Sample Collection, Data Curation, and Beyond

自动数据集构建(ADC):样本收集、数据整理与更广泛的领域

Minghao Liu, Zonglin Di, Jiaheng Wei, Zhongruo Wang, Hengxiang Zhang, Ruixuan Xiao, Haoyu Wang, Jinlong Pang, Hao Chen, Ankit Shah, Hongxin Wei, Xinlei He, Zhaowei Zhao, Haobo Wang, Lei Feng, Jindong Wang, James Davis, Yang Liu

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Amazon(亚马逊) SUSTech(华南理工大学) Zhejiang University(浙江大学) Yale University(耶鲁大学) Carnegie Mellon University(卡内基梅隆大学) HKUST (GZ)(香港科技大学) Nanyang Technological University(南洋理工大学) Microsoft(微软)

AI总结 本文提出自动数据集构建方法ADC,通过LLM实现高效数据集生成,减少人工标注成本,构建包含12个主类和12000个细粒度子类的Clothing-ADC数据集,降低标签噪声至10.7%,并设计三个针对标签噪声和类别不平衡的基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17139 2026-04-21 cs.CL cs.AI cs.MA

The Consensus Trap: Rescuing Multi-Agent LLMs from Adversarial Majorities via Token-Level Collaboration

共识陷阱:通过令牌级协作拯救多智能体大语言模型免受对抗性多数的侵害

Jiayuan Liu, Shiyi Du, Weihua Du, Mingyu Guo, Vincent Conitzer

机构 * Carnegie Mellon University(卡内基梅隆大学) Foundations of Cooperative AI Lab (FOCAL)(协作人工智能基础实验室(FOCAL)) Adelaide University(阿德莱德大学)

AI总结 本文提出令牌级轮询协作方法,通过共享自回归上下文中的序列生成,解决多智能体系统中对抗性多数导致的响应级聚合失效问题,证明其在多种推理基准上具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16741 2026-04-21 cs.RO

LiDAR-based Crowd Navigation with Visible Edge Group Representation

基于LiDAR的人群导航与可见边缘组表示

Allan Wang, Aaron Steinfeld

机构 * Miraikan, the National Museum of Emerging Science and Innovation(日本新兴科学与创新国家博物馆) the Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 本文提出基于LiDAR的人群导航方法,通过可见边缘组表示提升导航安全性与社交性,同时在密集人群环境中实现更快的计算速度。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16656 2026-04-21 cs.CL

Defragmenting Language Models: An Interpretability-based Approach for Vocabulary Expansion

语言模型去碎片化:一种基于可解释性的词汇扩展方法

Maitrey Mehta, Nishant Subramani, Zhichao Xu, Ashim Gupta, Vivek Srikumar

机构 * Kahlert School of Computing, University of Utah(犹他大学计算机学院Kahlert分校) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

AI总结 本文提出基于可解释性的词汇扩展方法,解决语言模型中词汇碎片化问题,通过改进词汇选择和嵌入初始化提升效率,提出FragMend方法验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16625 2026-04-21 cs.CL cs.AI cs.LG

AdaExplore: Failure-Driven Adaptation and Diversity-Preserving Search for Efficient Kernel Generation

AdaExplore: 基于失败的适应与多样性保持搜索用于高效内核生成

Weihua Du, Jingming Zhuo, Yixin Dong, Andre Wang He, Weiwei Sun, Zeyu Zheng, Manupa Karunaratne, Ivan Fox, Tim Dettmers, Tianqi Chen, Yiming Yang, Sean Welleck

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学) Arm Ltd(Arm有限公司)

AI总结 AdaExplore通过积累执行反馈实现自我改进,通过失败驱动适应和多样性保持搜索提升内核生成的正确性和优化性能,无需额外微调或外部知识。

Comments Preliminary work. The implementation is available at https://github.com/StigLidu/AdaExplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16541 2026-04-21 cs.CV

BOOKAGENT: Orchestrating Safety-Aware Visual Narratives via Multi-Agent Cognitive Calibration

BOOKAGENT:通过多智能体认知校准 orchestrate 安全意识的视觉叙述

Bo Gao, Chang Liu, Yuyang Miao, Siyuan Ma, Ser-Nam Lim

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Science and Technology of China(中国科学技术大学) Imperial College London(伦敦帝国理工学院) Nanyang Technological University(南洋理工大学) University of Central Florida(佛罗里达中央大学)

AI总结 本文提出BOOKAGENT,一种安全意识的多智能体协作框架,用于高质量的视觉叙述生成,通过联合规划、脚本、插图和全局修复不一致,提升叙述连贯性和视觉一致性。

Comments 18 pages, Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16428 2026-04-21 cs.LG cs.AI stat.ML

Non-Stationarity in the Embedding Space of Time Series Foundation Models

时间序列基础模型嵌入空间中的非平稳性

Jinmyeong Choi, Brad Shook, Artur Dubrawski

机构 * Auton Lab(自动化实验室) Robotics Institute(机器人研究所) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究时间序列基础模型嵌入空间中非平稳性的检测方法,分析不同分布非平稳性和时间非平稳性对模型检测能力的影响。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16381 2026-04-21 cs.RO

Interdisciplinary Workshop on Mechanical Intelligence: Summary Report

机械智能跨学科研讨会:总结报告

Victoria A. Webster-Wood, Nicholas Gravish, Amir Alavi, Andres F Arrieta, Sarah Bergbreiter, Anthony Bloch, Laura Blumenschein, C. Chase Cao, Aja Mia Carter, Paolo Celli, Tony Chen, Margaret Coad, Mark Cutkosky, Michael Dickey, Brian Do, Robert Full, Mahdi Haghshenas-Jaryani, Kaushik Jayaram, Aaron Johnson, Eva Kanso, Emma Lejeune, Chen Li, Suyi Li, Jeffrey Lipton, Rob MacCurdy, Matt McHenry, Jean-Michel Mongeau, Todd Murphey, Mark Plecnik, Jordan Raney, Ryan D. Sochol, Hannah Stuart, Zeynep Temel, Michael Tolley, Barry Trimmer, T. J. Wallin, Kon-Well Wang, Wenzhong Yan, Mark Yim, Wenlong Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Pittsburgh(匹兹堡大学) Purdue University(Purdue 大学) University of Michigan(密歇根大学) Tufts University(塔夫茨大学) Oregon State University(俄勒冈州立大学) Case Western Reserve University(凯斯西储大学) John’s Hopkins University(约翰·霍普金斯大学) Boston University(波士顿大学) University of Southern California(南加州大学) University of California at Berkeley(加州大学伯克利分校) Penn State University(宾夕法尼亚州立大学) Northeastern University(东北大学) University of Pennsylvania(宾夕法尼亚大学) University of Colorado Boulder(科罗拉多大学 Boulder 分校) New Mexico State University(新墨西哥州立大学) University of Notre Dame(诺丁汉大学) Stanford University(斯坦福大学)

AI总结 本报告总结了2024年机械智能跨学科研讨会的成果,探讨了机械结构自身通过响应性、适应性、记忆和学习编码智能的现象,以及其与计算智能的区别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02636 2026-04-21 cs.LG cs.CV

Joint Distillation for Fast Likelihood Evaluation and Sampling in Flow-based Models

基于流模型的快速似然评估与采样联合蒸馏

Xinyue Ai, Yutong He, Albert Gu, Ruslan Salakhutdinov, J Zico Kolter, Nicholas Matthew Boffi, Max Simchowitz

机构 * Carnegie Mellon University(卡内基梅隆大学) Peking University(北京大学)

AI总结 本文提出F2D2框架,通过联合蒸馏减少流模型采样和似然评估的NFE数量,实现高效计算与高精度似然估计。

Comments Project page: https://kellyyutonghe.github.io/f2d2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20409 2026-04-21 cs.CL cs.AI cs.CY

Cognitive Chain-of-Thought (CoCoT): Structured Multimodal Reasoning about Social Situations

认知链式推理(CoCoT):关于社会情境的结构化多模态推理

Eunkyu Park, Wesley Hanwen Deng, Gunhee Kim, Motahhare Eslami, Maarten Sap

机构 * Seoul National University(首尔国立大学) Human-Computer Interaction Institute, Carnegie Mellon University(人机交互研究所,卡内基梅隆大学) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

AI总结 本文提出CoCoT框架,通过感知、情境推断和规范应用三个阶段提升多模态社会推理能力,在多个任务中取得显著提升。

Comments Under review; 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13743 2026-04-21 cs.CL cs.IR

LTRR: Learning To Rank Retrievers for LLMs

基于LLM的检索排名学习检索器

To Eun Kim, Fernando Diaz

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出LTRR框架,通过动态选择检索器提升RAG性能,实验表明基于路由的RAG在多种基准上优于单一检索器,尤其在使用AC目标和成对排名时效果显著。

Comments SIGIR 2026; SIGIR 2025 LiveRAG Spotlight; Code: https://github.com/kimdanny/Starlight-LiveRAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06094 2026-04-20 cs.CL

ConlangCrafter: Constructing Languages with a Multi-Hop LLM Pipeline

ConlangCrafter:基于多跳LLM流水线的语言构建

Morris Alper, Moran Yanuka, Raja Giryes, Gašper Beguš

机构 * Tel Aviv University(特拉维夫大学) Carnegie Mellon University(卡内基梅隆大学) UC Berkeley(伯克利大学)

AI总结 本文提出ConlangCrafter,通过多阶段流水线实现语言构建,利用LLM的元语言能力生成一致且多样化的构想语言。

Comments Accepted to ACL 2026. Project page: https://conlangcrafter.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15607 2026-04-20 cs.CL cs.AI cs.CY cs.HC

Imperfectly Cooperative Human-AI Interactions: Comparing the Impacts of Human and AI Attributes in Simulated and User Studies

不完全合作的人机交互:在模拟和用户研究中比较人类和AI属性的影响

Myke C. Cohen, Mingqian Zheng, Neel Bhandari, Hsien-Te Kao, Xuhui Zhou, Daniel Nguyen, Laura Cassani, Maarten Sap, Svitlana Volkova

机构 * Aptima, Inc.(Aptima公司) Arizona State University(亚利桑那州立大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究通过模拟和用户实验比较人类和AI属性在不完全合作场景中的影响,发现AI属性,尤其是透明度,在真实用户研究中更具影响力。

Comments Will be presented at ACL 2026 and published in the Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15602 2026-04-20 cs.CL

GroupDPO: Memory efficient Group-wise Direct Preference Optimization

GroupDPO:内存高效的组级直接偏好优化

Jixuan Leng, Si Si, Hsiang-Fu Yu, Vinod Raman, Inderjit S. Dhillon

机构 * CMU(卡内基梅隆大学) Google Deepmind(谷歌DeepMind) Google(谷歌)

AI总结 本文提出GroupDPO,通过解耦样本和保留梯度实现高效的组级偏好优化,减少内存使用,提升大规模训练效果,且在离线和在线对齐中均优于单对训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15555 2026-04-20 cs.CV

CXR-LT 2026 Challenge: Multi-Center Long-Tailed and Zero Shot Chest X-ray Classification

CXR-LT 2026挑战:多中心长尾和零样本胸片分类

Hexin Dong, Yi Lin, Pengyu Zhou, Fengnian Zhao, Alan Clint Legasto, Juno Cho, Dohui Kim, Justin Namuk Kim, Mingeon Kim, Sunwoo Kwak, Gabriel Moyà-Alcover, Ky Trung Nguyen, Thanh-Huy Nguyen, Ha-Hieu Pham, Huy-Hieu Pham, Huy Le Pham, Nikhileswara Rao Sulake, Aina Tur-Serrano, Ruichi Zhang, Ang Zu, Adam E. Flanders, Zhiyong Lu, Ronald M. Summers, Mingquan Lin, Hao Chen, Yuzhe Yang, George Shih, Yifan Peng

机构 * Department of Population Health Sciences, Weill Cornell Medicine(韦尔·科恩医学中心流行病学与公共卫生科学系) Department of Radiology, Fuwai Hospital, National Center for Cardiovascular Diseases, Chinese Academy of Medical Sciences and Peking Union Medical College(中国医学科学院阜外医院心血管病国家中心放射科) Department of Radiology, West China School of Medicine, Sichuan University(四川大学西昌医学院放射科) Sichuan University Affiliated Chengdu Second People’s Hospital(四川大学附属成都第二人民医院) Department of Radiology, Weill Cornell Medicine(韦尔·科恩医学中心放射科) School of Electrical Engineering, Korea Advanced Institute of Science and Technology(韩国科学技术院电子工程学院) Gwangju Institute of Science and Technology(光州科学技术院) Department of Biomedical Engineering, Case Western Reserve University(凯斯西储大学生物医学工程系) School of Electrical and Computer Engineering, Cornell Tech(康奈尔科技学院电气与计算机工程系) Department of Mathematics and Computer Science, Universitat de les Illes Balears(巴利阿里大学数学与计算机科学系) School of Computer Science and Engineering, VNU-HCM International University(VNU-HCM国际大学计算机科学与工程系) Vietnam National University, Ho Chi Minh City(越南国家大学河内市分校) School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学系) VNU-HCM University of Science, Ho Chi Minh City(VNU-HCM科技大学河内市分校)

AI总结 本文提出CXR-LT 2026挑战,通过多中心数据集和零样本任务,研究长尾分布和开放世界下的胸片分类问题,评估视觉语言模型在罕见疾病检测中的表现。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14605 2026-04-20 cs.CV

Towards Design Compositing

面向设计合成

Abhinav Mahajan, Abhikhya Tripathy, Sudeeksha Reddy Pala, Vaibhav Methi, K J Joseph, Balaji Vasan Srinivasan

机构 * Carnegie Mellon University(卡内基梅隆大学) IIT Kharagpur(印度理工学院哈里科特) IIT Kanpur(印度理工学院坎普尔) Adobe Research(Adobe研究)

AI总结 本文提出GIST,一种无需训练的身份保持图像合成器,用于提升组件到设计流程中的视觉和谐与美学质量。

Comments Accepted to CVEU workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11490 2026-04-20 cs.AI cs.CL cs.CV

Anthropogenic Regional Adaptation in Multimodal Vision-Language Model

人为区域适应于多模态视觉-语言模型

Samuel Cahyawijaya, Peerat Limkonchotiwat, Tack Hwa Wong, Hitesh Laxmichand Patel, Amit Agarwal, Manuel Antonio Rufino, Carlos Rafael Catalan, Muhammad Reza Qorib, Vicky Feliren, Holy Lovenia, Aye Hninn Khine, Frederikus Hudi, David Anugraha, Alham Fikri Aji, Romrawin Chumpu, Viet-Thanh Pham, Minghan Wang, Mohamed Fazli Imam, Ruochen Zhang, Joseph Marvin Imperial, Khumaisa Nur'aini, Do Xuan Long, Musa Izzanardi Wijanarko, Joel Ruben Antony Moniz, Patrick Amadeus Irawan, Hanif Muhammad Zhafran, Isaiah Flores, Salsabila Zahirah Pranida, Jun Kevin, Jostin Jerico Rosal, Patricia Nicole Monderin, Kun Kerdthaisong, Ahmad Mustafid, My Chiffon Nguyen, Natchapon Jongwiriyanurak, Siva Worajitwannakul, Haochen Li, Adrian Xuan Wei Lim, Bin Wang, Muhammad Ravi Shulthan Habibi, Lynnette Hui Xian Ng, Mithil Bangera, Yeshil Bangera, Priyaranjan Pattnayak, Dun Li Chan, Sherissa Caren Djuniwar, Cho Chan Myei Oo, Hee Ming Shan

机构 * Cohere SEACrowd AI Singapore Universiti Teknologi PETRONAS Oracle Carnegie Mellon University(卡内基梅隆大学) Monash University, Indonesia(莫纳什大学(印尼)) King Mongkut’s University of Technology Thonburi(泰国孔敬大学) Nara Institute of Science and Technology(奈良科学技術大學) Stanford University(斯坦福大学) MBZUAI National University of Singapore(新加坡国立大学) Monash University, Australia(莫纳什大学(澳大利亚)) Brown University(布朗大学) University of Bath(巴斯大学) Mila - Quebec AI Institute(蒙特利尔AI研究所) Institut Teknologi Bandung(Bandung 工程技术大学) Ateneo de Manila University(马尼拉亚特内奥大学) Universitas Pelita Harapan(Pelita Harapan 大学) Seoul National University of Science and Technology(首尔科学技术大学) Thammasat University(泰国 Thammasat 大学) Independent(独立) University College London(伦敦大学学院) Nanyang Technological University(南洋理工大学) MiroMind AI University of Indonesia(印度尼西亚大学) University of New Haven(纽黑文大学) INTI International University and Colleges(INTI 国际大学和学院) Binus University(Binus 大学) National University Philippines(菲律宾国家大学) ThoughtFull

AI总结 本文提出人为区域适应框架,通过地理通用化简化方法提升多模态模型在特定区域的文化相关性,实验显示在东南亚地区提升5-15%的同时保持全球性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11698 2026-04-20 cs.CV cs.AI cs.CL

OSCBench: Benchmarking Object State Change in Text-to-Video Generation

OSCBench:文本到视频生成中对象状态变化的基准测试

Xianjing Han, Bin Zhu, Shiqi Hu, Franklin Mingzhe Li, Patrick Carrington, Roger Zimmermann, Jingjing Chen

机构 * National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理大学) Carnegie Mellon University(卡内基梅隆大学) Fudan University(复旦大学)

AI总结 本文提出OSCBench基准,用于评估文本到视频模型在对象状态变化上的性能,揭示当前模型在处理新场景时的不足。

Comments ACL 2026 Main Conference, Project page: https://hanxjing.github.io/OSCBench

详情

展开后加载摘要…

URL PDF HTML 收藏