arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of California, Los Angeles(加州大学洛杉矶分校)

2026-04-10 至 2026-04-10 共收录 6
2604.08509 2026-04-10 cs.CV cs.RO

Visually-grounded Humanoid Agents

基于视觉的人形代理

Hang Ye, Xiaoxuan Ma, Fan Lu, Wayne Wu, Kwan-Yee Lin, Yizhou Wang

机构 * Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Tongji University(同济大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Michigan(密歇根大学)

AI总结 本文提出基于视觉的人形代理,通过两层架构实现自主行为,解决数字人主动行为在新环境中的问题,提升任务成功率和减少碰撞。

Comments Project page: https://alvinyh.github.io/VGHuman/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00084 2026-04-10 cs.CL cs.AI

Vision-Language and Large Language Model Performance in Gastroenterology: GPT, Claude, Llama, Phi, Mistral, Gemma, and Quantized Models

视觉-语言与大语言模型在胃肠病学中的表现:GPT、Claude、Llama、Phi、Mistral、Gemma及量化模型

Seyed Amir Ahmad Safavi-Naini, Shuhaib Ali, Omer Shahab, Zahra Shahhoseini, Thomas Savage, Sara Rafiee, Jamil S Samaan, Reem Al Shabeeb, Farah Ladak, Jamie O Yang, Juan Echavarria, Sumbal Babar, Aasma Shaukat, Samuel Margolis, Nicholas P Tatonetti, Girish Nadkarni, Bara El Kurdi, Ali Soroush

机构 * Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院) University of Texas Health(德克萨斯大学健康科学中心) Virginia Hospital Center(弗吉尼亚医院中心) Shahid Beheshti University of Medical Sciences(沙希德·贝赫什提医科大学) Stanford University(斯坦福大学) Cedars-Sinai Medical Center(西达赛奈医疗中心) Inova Fairfax Medical Campus(伊诺瓦费尔法克斯医疗中心) University of California–Los Angeles(加州大学洛杉矶分校) NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) Columbia University(哥伦比亚大学)

AI总结 本研究评估了大语言模型和视觉-语言模型在胃肠病学中的医学推理性能,比较了不同模型配置、参数及提示工程策略对性能的影响,发现专有模型在准确性上优于开源模型,且图像描述对视觉-语言模型性能有显著影响。

Comments Manuscript Pages: 34, Figures: 7, Tables: 2, Supplementary File Pages: 35, Data Transparency Statement: Code is available at: https://github.com/Sdamirsa/LLM-VLM-in-Gastroenterology . Study data from American College of Gastroenterology (ACG) are restricted and available upon request with ACG permission. Correction: updated abstract considering Llama3.1 results

Journal ref npj Digital Medicine 8, 797 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07775 2026-04-10 cs.AI cs.CL cs.CR

ACIArena: Toward Unified Evaluation for Agent Cascading Injection

ACIArena:迈向多智能体系统统一评估

Hengyu An, Minxi Li, Jinghuai Zhang, Naen Xu, Chunyi Zhou, Changjiang Li, Xiaogang Xu, Tianyu Du, Shouling Ji

机构 * Zhejiang University(浙江大学) State Key Laboratory of Internet Architecture, Tsinghua University(清华大学网络架构国家重点实验室) University of California, Los Angeles(加州大学洛杉矶分校) Palo Alto Networks Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心)

AI总结 本文提出ACIArena框架,用于评估多智能体系统(MAS)的鲁棒性,通过多攻击面和目标的系统化测试,揭示单纯依赖拓扑结构评估不足,强调需通过角色设计和受控交互提升系统安全性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07655 2026-04-10 cs.LG cs.CL

Guardian-as-an-Advisor: Advancing Next-Generation Guardian Models for Trustworthy LLMs

顾问式守护者:推进下一代守护模型以实现可信的大语言模型

Yue Huang, Haomin Zhuang, Jiayi Ye, Han Bao, Yanbo Wang, Hang Hua, Siyuan Wu, Pin-Yu Chen, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) IBM Research(IBM研究院)

AI总结 本文提出Guardian-as-an-Advisor框架,通过预测风险标签和解释并前置建议,提升模型安全性和实用性,同时降低误拒率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07354 2026-04-10 cs.CL cs.AI cs.SD

Contextual Earnings-22: A Speech Recognition Benchmark with Custom Vocabulary in the Wild

上下文收益-22:带有自定义词汇的语音识别基准测试

Berkin Durmus, Chen Cen, Eduardo Pacheco, Arda Okan, Atila Orhon

机构 * Argmax, Inc.(Argmax公司) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 本文提出Contextual Earnings-22基准测试,通过真实自定义词汇场景推动研究,揭示潜在进展。关键词提示和增强方法在扩展到大规模系统时表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22416 2026-04-10 cs.CL cs.IR

Hallucination Detection and Evaluation of Large Language Model

大语言模型的幻觉检测与评估

Chenggong Zhang, Haopeng Wang, Hexi Meng

机构 * Department of Electrical and Computer Engineering, University of California, Los Angeles(加州大学洛杉矶分校电气与计算机工程系)

AI总结 本文提出HHEM模型,通过轻量级分类框架有效检测大语言模型幻觉,提升效率并保持高准确率,通过对比分析不同模型的检测效果,发现HHEM在时间与准确性上表现优异,但总结任务中存在局部幻觉问题,引入分段检索并分析模型规模与幻觉的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏