arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 192
2606.05597 2026-08-10 cs.LG 版本更新

AsyncWebRL: Efficient Asynchronous Reinforcement Learning for Multi-Step Visual Web Agents

AsyncWebRL: 面向视觉网页智能体的高效多步强化学习

Hao Bai, Rui Yang, Chenlu Ye, Spencer Whitehead, Aviral Kumar, Tong Zhang

机构 * UIUC(伊利诺伊大学香槟分校) Microsoft(微软) CMU(卡内基梅隆大学)

AI总结 提出异步系统设计和算法改进,解决多步强化学习中GPU空闲和轨迹过长问题,实现训练吞吐量提升2.9倍,并在WebGym测试集上取得新最优结果。

Comments Updated logo and code link

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19035 2026-08-10 cs.AI 版本更新

Trustworthy Agent Network: Trust in Agent Networks Must Be Baked In, Not Bolted On

可信代理网络:在代理网络中,信任必须被内置,而非事后添加

Yixiang Yao, Yuhang Yao, Xinyi Fan, Jiechao Gao, Jie Wang, Minjia Zhang, Srivatsan Ravi, Carlee Joe-Wong

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

AI总结 本文探讨了在代理网络中信任必须被内置而非事后添加的问题,提出了一个综合的概念框架,通过四个设计支柱来建立代理网络中的信任。

Comments Accepted at SIGKDD 2026 Blue Sky Ideas Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27435 2026-08-10 cs.CL cs.AI 版本更新

Improving Attributed Long-form Question Answering with Intent Awareness

通过意图意识提升带有属性的长形式问答

Xinran Zhao, Aakanksha Naik, Jay DeYoung, Joseph Chee Chang, Jena D. Hwang, Tongshuang Wu, Varsha Kishore

机构 * Allen Institute for AI(艾伦人工智能研究所) Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学)

AI总结 本文提出通过增强模型意图意识来提升长报告生成质量,通过结构化标签方案提取隐含意图,改进零样本生成能力并生成高质量合成数据,实验显示在科学报告生成任务中模型性能平均提升2.9和12.3个百分点。

Comments 39 pages, 7 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00559 2026-08-10 cs.AI 版本更新

Social World Models

社交世界模型

Xuhui Zhou, Jiarui Liu, Akhila Yerukola, Hyunwoo Kim, Maarten Sap

机构 * Language Technologies Institute, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学语言技术研究所) NVIDIA, Santa Clara, CA, USA(英伟达)

AI总结 本文提出社交世界模型(SWMs)及结构化社交世界表示形式(S3AP),通过显式建模隐藏心理状态提升AI在社交推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28617 2026-08-07 cs.AI cs.CL cs.CY cs.HC 版本更新

AISPA: User-Centric System Prompt Auditing for Large Language Model Applications

AISPA:面向大语言模型应用的以用户为中心的系统提示审计框架

Xiangning Lin, Shenzhe Zhu, Shu Yang, Zhenyu Zhang, Haoqian Zhang, Yipeng Zhao, Chengxuan Qian, Tianwei Wang, Ziheng Zhang, Zhenlong Yuan, Dingcheng Wang, Juncheng Wu, Yuan Si, Jiaxin Liu, Baolong Bi, Robert Mahari, Tobin South, Dazza Greenwood, Zexue He, Rishi Bommasani, Sophia Kazinnik, Andreas Haupt, Samuele Marro, Erik Brynjolfsson, Alex Pentland, Jiaxin Pei

机构 * Stanford University(斯坦福大学) CMU(卡内基梅隆大学) UT Austin(德克萨斯大学奥斯汀分校) University of Toronto(多伦多大学) UCSB(加利福尼亚大学圣巴巴拉分校) WashU(华盛顿大学) OSU(俄亥俄州立大学) UCSC(加利福尼亚大学圣克鲁兹分校) Northwestern University(西北大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) KAUST(阿卜杜拉国王科技大学) MIT(麻省理工学院) University of Oxford(牛津大学) Institute for Decentralized AI(去中心化人工智能研究所)

AI总结 本文提出以用户为中心的AISPA框架,审计88款商业AI产品的3249条系统提示指令,发现其设计差异大、保护指令范围浅、长度增长但仍存问题指令,凸显系统提示需更高透明度与监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20690 2026-08-06 cs.CL 版本更新

Learning to Detect UI Principle Violations via Reinforcement Learning

通过强化学习学习检测用户界面原则违规

Nishi Mehta, Swathi Alse, Himani Kumawat, Yue Yu, Pratik Jayarao

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究小型语言模型和编码代理生成的网页前端代码违反界面质量原则的问题,通过统一多来源的界面质量原则,构建数据集并利用强化学习训练轻量级视觉语言模型作为评判器,提升检测效果并发布相关方法支持评估和后续工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08324 2026-08-06 cs.NE cs.AI 版本更新

Multi-Modal Learning meets Genetic Programming: Analyzing Alignment in Latent Space Optimization

多模态学习遇见遗传编程:分析潜在空间优化中的对齐

Benjamin Léger, Kazem Meidani, Christian Gagné

机构 * Mila, Université Laval(Mila,拉瓦尔大学) Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学) Canada-CIFAR AI Chair(加拿大-卡内基梅隆人工智能主席)

AI总结 本文研究SNIP方法在符号回归中多模态潜在空间优化的对齐效果,发现跨模态对齐在优化过程中未改善且过于粗糙,导致有效对齐引导的优化尚未实现。

Comments Accepted at PPSN 2026 (Trento, Italy). To appear in Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04721 2026-08-06 cs.AI 版本更新

AI Assistance Reduces Persistence and Hurts Independent Performance

人工智能辅助降低坚持性并损害独立表现

Grace Liu, Brian Christian, Tsvetomira Dumbalska, Michiel A. Bakker, Rachit Dubey

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学) Massachusetts Institute of Technology(麻省理工学院) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 研究发现人工智能辅助虽短期提升表现,但降低用户坚持性并损害独立完成任务的能力,尤其在数学推理和阅读理解等任务中表现显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04426 2026-08-06 cs.AI 版本更新

XGrammar-2: Dynamic and Efficient Structured Generation Engine for Agentic LLMs

XGrammar-2: 面向智能体LLM的高效动态结构化生成引擎

Linzhang Li, Yixin Dong, Guanjie Wang, Ziyi Xu, Alexander Jiang, Tianqi Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学) Carnegie Mellon University, NVIDIA(卡内基梅隆大学,NVIDIA)

AI总结 针对智能体LLM中动态结构化生成(如工具调用和响应协议)的挑战,提出XGrammar-2引擎,通过标签触发结构切换和跨语法子结构缓存实现高效编译与近零开销。

Comments 9 pages, ACM CAIS 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22014 2026-08-05 cs.CL cs.AI 版本更新

Toward Understanding the Transferability of Adversarial Suffixes in Large Language Models

面向大型语言模型中对抗性后缀的可迁移性理解

Sarah Ball, Niki Hasrati, Alexander Robey, Avi Schwarzschild, Frauke Kreuter, Zico Kolter, Andrej Risteski

机构 * Ludwig-Maximilians-Universität München(慕尼黑莱布尼茨-马克斯大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Carnegie Mellon University(卡内基梅隆大学) University of Maryland(马里兰大学)

AI总结 该研究针对大型语言模型的对抗性后缀可迁移性,分析出三个与迁移成功高度相关的统计属性,其成果可用于提升越狱攻击的实际效果。

Comments Accepted at TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25166 2026-08-04 cs.AI 版本更新

Individual-level interventions against sycophantic AI reduce its appeal but not its persuasiveness

观察到谄媚的人工智能认可他人会降低其吸引力,但不会降低其说服力

Meryl Ye, Robert Kraut, Steve Rathje

机构 * Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学)

AI总结 研究探讨提高用户对谄媚人工智能的认知能否防危害,通过两项预注册实验及合并其他研究发现,警告和视频干预虽改变评价,但未降说服力,个体层面干预或难护用户免受人工智能之害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17508 2026-08-04 cs.LG cs.AI 版本更新

Retrieval-Augmented Interpretable Learning: Towards Task-Specific Zero-Shot Models in Healthcare

检索增强可解释学习:迈向医疗保健领域特定任务的零样本模型

Sazan Mahbub, Caleb Ellington, Zhiyuan Li, Yixin Yang, Souvik Kundu, Ben Lengerich, Eric P. Xing

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) GenBio AI(基因生物人工智能公司) Intel(英特尔公司)

AI总结 研究针对医疗保健领域特定任务零样本模型问题推出检索增强可解释学习(RAIL)框架,通过检索相关任务并传递结构生成新预测器,概率公式提供不确定性支持可靠性感知部署,在临床程序预测任务中性能可靠,还提升模型透明度。

Comments A preliminary, non-archival version of this work, titled RAG-IM, was presented at NeurIPS 2024 workshops and the ML4H 2024 Findings track. The work was subsequently renamed Retrieval-Augmented Interpretable Learning (RAIL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24785 2026-08-04 cs.AR cs.AI cs.DC cs.PF 版本更新

Cloud to Edge: Benchmarking LLM Inference On Hardware-Accelerated Single-Board Computers

云到边缘:在硬件加速的单板计算机上评估大语言模型推理

Harri Renney, Fouad Trad, Michael Mattarock, Jayden Evetts, Zena Wood

机构 * Kaze Technologies(凯兹技术) Kaze Consulting(凯兹咨询) Electrical and Computer Engineering(电气与计算机工程) Lebanese American University(黎巴嫩美国大学) Carnegie Mellon University(卡内基梅隆大学) University of Exeter(埃克塞特大学)

AI总结 本文提出一种多维评估方法,评估四种物联网适用的边缘平台配置,测试最新硬件加速器的单板计算机,揭示硬件加速器在隐私敏感和连接受限环境中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15622 2026-08-04 cs.CV cs.LG 版本更新

AdaDINO: Context-Adaptive DINO-Distilled Vision Foundation Models for Efficient Open-Vocabulary Edge Inference

AdaVFM:通过LLM引导执行实现边缘智能的自适应视觉基础模型

Yiwei Zhao, Yi Zheng, Huapeng Su, Jieyu Lin, Stefano Ambrogio, Cijo Jose, Michael Ramamonjisoa, Patrick Labatut, Barbara De Salvo, Chiao Liu, Phillip B. Gibbons, Ziyun Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta

AI总结 本文提出AdaVFM,一种通过LLM引导执行实现边缘设备上语言对齐视觉基础模型高效推理的自适应框架,通过动态调整计算实现性能与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05220 2026-08-04 cs.CL cs.SD 版本更新

Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions

Bagpiper: 通过丰富描述解决开放式音频任务

Jinchuan Tian, Haoran Wang, Bo-Hao Su, Chien-yu Huang, Qingzheng Wang, Jiatong Shi, William Chen, Xun Gong, Siddhant Arora, Chin-Jou Li, Masao Someki, Takashi Maekaku, Keita Goto, Yusuke Shinohara, Jin Sakuma, Chao-Han Huck Yang, Shinji Watanabe

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) LY Corporation(LY公司) NVIDIA Research(NVIDIA研究)

AI总结 提出Bagpiper,一个8B参数音频基础模型,通过丰富描述(自然语言描述)实现音频理解和生成的统一,在MMAU和AIRBench上超越Qwen-2.5-Omni,生成质量优于CosyVoice3和TangoFlux。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06188 2026-08-04 cs.AI 版本更新

Scalable Dynamic Distributed Constraint Optimization with Metareasoning and Application to Continual Satellite Operations

面向持续大规模卫星运行的动态分布式约束优化与元推理

Itai Zilberstein, Steve Chien

机构 * Carnegie Mellon University(卡内基梅隆大学) California Institute of Technology(加州理工学院) Jet Propulsion Laboratory(喷气推进实验室)

AI总结 针对动态大规模卫星调度问题,提出动态分布式约束优化模型DCOSP,并设计元推理框架控制重计算时机,结合D-NSS算法实现近优解,显著优于基线方法。

Comments An earlier version titled "Large-Scale Continual Scheduling and Execution for Dynamic Distributed Satellite Constellation Observation Allocation" appears as an extended abstract in the Proceedings of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27017 2026-08-03 cs.LG cs.RO 版本更新

What Can Latent World Models Know? Physical Parameter Identifiability in Multimodal Predictive Representations

隐式世界模型能知晓什么?多模态预测表示中的物理参数可识别性

Kaizhen Tan, Xin Xu, Siru Tao, Yixiao Li, Hanzhe Hong, Yang Feng, Heqing Du

机构 * New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学)

AI总结 该研究通过可控实验揭示,隐式世界模型的目标函数结构决定其获取的物理参数,输入与预测目标分别限制和决定可获知的物理量,额外数据仅优化已获取的参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16870 2026-08-03 cs.CV cs.AI 版本更新

Demystifying Video Reasoning

揭秘视频推理

Ruisi Wang, Zhongang Cai, Fanyi Pu, Junxiang Xu, Wanqi Yin, Maijunxian Wang, Ran Ji, Chenyang Gu, Bo Li, Ziqi Huang, Hokin Deng, Dahua Lin, Ziwei Liu, Lei Yang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文通过实验揭示视频扩散模型中的推理主要发生在去噪步骤中,提出链式步骤(CoS)机制,并发现工作记忆、自我修正和感知先行等涌现行为,最后提出一种无需训练的集成策略来提升推理能力。

Comments Homepage: https://www.wruisi.com/demystifying_video_reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19786 2026-07-31 cs.CL 版本更新

HumorRank: A Tournament-Based Leaderboard for Evaluating Humor Generation in Large Language Models

HumorRank: 基于锦标赛的大语言模型幽默生成评估排行榜

Edward Ajayi, Prasenjit Mitra

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

AI总结 提出HumorRank,一种基于锦标赛的框架,通过理论指导的成对偏好判断对文本幽默生成进行排名,并利用Bradley-Terry估计生成全局排行榜。

Comments Leaderboard: https://humorrank-leaderboard.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01557 2026-07-31 cs.CL 版本更新

Language Diversity: Evaluating Language Usage and AI Performance on African Languages in Digital Spaces

语言多样性:评估非洲语言在数字空间中的使用情况和人工智能性能

Edward Ajayi, Eudoxie Umwari, Mawuli Deku, Prosper Singadi, Jules Udahemuka, Bekalu Tadele, Chukuemeka Edeh

机构 * Carnegie Mellon University(卡内基梅隆大学) Africa Kigali Rwanda(非洲基加利卢旺达) Bahir Dar Institute of Technology(巴希尔达尔技术学院) Federal University Otuoke Bayelsa Nigeria(贝莱萨州联邦大学)

AI总结 本研究发现本地新闻数据比对话平台数据更有效用于训练非洲语言的AI模型,强调了处理干净和语言切换文本的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15297 2026-07-31 cs.CL 版本更新

AfriEconQA: A Benchmark for Quantitative and Temporal Reasoning over World Bank Economic Reports

AfriEconQA:基于世界银行报告的非洲经济分析基准数据集

Edward Ajayi, Mustapha Alaba, David Stephen

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

AI总结 AfriEconQA是一个基于世界银行报告的非洲经济分析基准数据集,旨在测试信息检索和RAG系统在处理复杂经济查询时的性能。

Comments Dataset Explorer: https://afrieconqa.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17100 2026-07-30 cs.MA cs.AI cs.SE 版本更新

Auto Research for Materials: Auditable AI-Scientist Workflows with Held-Out Transfer

材料的自动研究:具有留出转移的可审计人工智能科学家工作流程

Jingjie Ning, Xiaochuan Li, Shanshan Zhong, Ji Zeng, Guolin Ke

机构 * School of Computer Science, Carnegie Mellon University(计算机科学系,卡内基梅隆大学) DP Technology(DP科技)

AI总结 研究材料预测中人工智能代理的工作流程,通过多方面搜索产生评估更改,经留出数据测试,发现不同建模机制下的有效变化,证明闭环代理决策及代码可复用组合,还提供了评估设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12035 2026-07-30 cs.CV 版本更新

When Does Visual Token Pruning Improve Calibration? The Role of Evidence Coverage in MLLMs

视觉标记修剪能否提高校准?关于多模态大语言模型中置信度的实证研究

Kaizhen Tan, Yang Feng, Heqing Du, Hanzhe Hong, Siru Tao, Xin Xu

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文研究视觉标记修剪对模型校准的影响,通过POPE和ScienceQA-IMG数据集评估不同修剪策略下的ECE、Brier分数和AURC,发现修剪能提升校准而非仅牺牲效率,且基于显著性的修剪方法效果较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15284 2026-07-30 cs.CV 版本更新

Walk through Paintings: Egocentric World Models from Internet Priors

穿越绘画:来自互联网先验的自我中心世界模型

Anurag Bagchi, Zhipeng Bao, Homanga Bharadhwaj, Yu-Xiong Wang, Pavel Tokmakov, Martial Hebert

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Toyota Research Institute(丰田研究机构)

AI总结 EgoWM通过利用互联网先验和轻量级条件层,将预训练视频扩散模型转换为自我中心世界模型,实现可控的未来预测,提升结构一致性评分并降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10850 2026-07-30 cs.RO 版本更新

Invariant Extended Kalman Filtering with Partial Orientation Measurement Integration: Theoretical Derivations and Application to Autonomous Surface Vessels

结合部分姿态测量的不变扩展卡尔曼滤波:理论推导及在自主水面船舶中的应用

Derek R. Benham, Easton R. Potokar, Joshua G. Mangelson

机构 * Brigham Young University Carnegie Mellon University

AI总结 本文提出融合部分姿态测量的InEKF框架,结合地平线横滚俯仰与双天线GPS航向测量,经对比实验验证其在开阔海域自主水面船舶状态估计中有效且鲁棒。

Comments Originally presented at the 2025 IEEE ICRA Workshop on Field Robotics, extended to cover real world experiments. 13 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10300 2026-07-30 cs.HC cs.AI 版本更新

AI LEGO: Scaffolding Cross-Functional Collaboration in Industrial Responsible AI Practices during Early Design Stages

AI LEGO:在早期设计阶段为工业负责任的AI实践搭建跨职能协作框架

Muzhe Wu, Yanzhi Zhao, Shuyi Han, Michael Xieyang Liu, Hong Shen

机构 * Carnegie Mellon University(卡内基梅隆大学) Northwestern University(西北大学)

AI总结 针对工业跨职能团队早期设计阶段负责任AI实践的协作难题,开发基于边界对象理论的AI LEGO原型,可提升跨角色危害识别的数量与概率,优化协作效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04452 2026-07-29 cs.HC cs.AI 版本更新

Understanding User Experiences of Computer Use Agents: Design Space and Opportunities for Building Agent UX Prototypes

理解计算机使用代理的用户体验:构建代理用户体验原型的设计空间与机会

Jenny T. Liang, Titus Barik, Jeffrey Nichols, Eldon Schoop, Ruijia Cheng

机构 * Carnegie Mellon University(卡内基梅隆大学) Apple(苹果公司)

AI总结 研究计算机使用代理的用户体验,开发其设计考量分类法,经需求引出研究确定原型设计所需活动与能力,创建AgentUXlab,通过用户研究得出代理用户体验原型设计工具的见解与启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16780 2026-07-29 cs.IR cs.AI cs.HC 版本更新

Comparing RAG and GraphRAG for Page-Level Retrieval Question Answering on a Math Textbook

比较RAG和GraphRAG在数学教科书页面级检索问答中的应用

Eason Chen, Chuangji Li, Eric Li, Zimo Xiao, Jionghao Lin, Kenneth R. Koedinger

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究在本科数学教科书页面级问答中比较RAG和GraphRAG,用477个问答对数据集在检索准确率和答案质量两指标上对比五个RAG模型、BM25基线及GraphRAG,发现基于嵌入的RAG更优,还通过开源模型复制实验,为AI辅导系统设计提供参考。

Comments 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09833 2026-07-28 cs.HC cs.AI cs.CY 版本更新

CollabSkill: Evaluating Human-Agent Collaboration On Real-World Tasks

CollabSkill: 评估真实世界任务中的人机协作

Yijia Shao, Zora Zhiruo Wang, Neel Ahuja, Yicheng Wang, Bowen Liu, Diyi Yang

机构 * Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) University of Rochester(罗切斯特大学) Individual Researcher(独立研究者)

AI总结 提出CollabSkill框架,通过配对真实工人与AI代理执行职业任务,利用贝叶斯技能评级系统量化人机贡献,揭示Claude Code排名第一且实践经验是协作技能的主要驱动力。

Comments 10 pages of main paper, COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25629 2026-07-28 cs.CV cs.LG 版本更新

LanteRn: Latent Visual Structured Reasoning

LanteRn:潜在视觉结构推理

André G. Viveiros, Nuno Gonçalves, Matthias Lindemann, André Martins

机构 * Instituto de Telecomunicações(电信研究所) Instituto Superior Técnico, Universidade de Lisboa(里斯本大学高等技术学院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出LanteRn框架,通过将语言与紧凑的潜在视觉表示结合,使大多模态模型能在潜在空间中进行视觉推理,提升视觉理解和细粒度推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏