arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-14 至 2026-04-14 共收录 589 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 129 篇

2511.21998 2026-04-14 cs.CV 75%

Can Multi-Modal LLMs Provide Live Step-by-Step Task Guidance?

多模态大语言模型能否提供实时逐步任务指导?

Apratim Bhattacharyya, Bicheng Xu, Sanjay Haresh, Reza Pourreza, Litian Liu, Sunny Panchal, Pulkit Madan, Leonid Sigal, Roland Memisevic

机构 * Qualcomm AI Research(高通人工智能研究院) University of British Columbia(不列颠哥伦比亚大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Qualcomm Interactive Cooking基准和数据集,用于评估多模态大语言模型在实时任务指导中的能力,引入LiveMamba作为新的基线模型。

Comments Accepted to NeurIPS 2025 (Project page: https://apratimbh.github.io/livecook)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17853 2026-04-14 cs.DL 75%

CiteGuard: Faithful Citation Attribution for LLMs via Retrieval-Augmented Validation

CiteGuard: 通过检索增强验证实现LLM的忠实引文归因

Yee Man Choi, Xuehang Guo, Yi R. Fung, Qingyun Wang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出CiteGuard,通过检索增强验证提升LLM引文准确性,实现比基线模型高10个百分点的性能,达到68.1%的准确率,接近人类水平。

Comments Project Page: https://kathcym.github.io/CiteGuard_Page/. ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14399 2026-04-14 cs.PL cs.SE 75%

NESA: Relational Neuro-Symbolic Static Program Analysis

NESA:关系神经符号静态程序分析

Chengpeng Wang, Yifei Gao, Wuqi Zhang, Xuwei Liu, Jinyao Guo, Mingwei Zheng, Qingkai Shi, Xiangyu Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 NESA通过大规模语言模型实现无编译定制化静态程序分析,通过分解问题和增量提示减少幻觉,提升程序切片和漏洞检测性能。

Comments 24 pages, 8 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09554 2026-04-14 cs.AI cs.CL cs.LG 75%

LABBench2: An Improved Benchmark for AI Systems Performing Biology Research

LABBench2:一种改进的AI系统进行生物研究的基准测试

Jon M Laurent, Albert Bou, Michael Pieler, Conor Igoe, Alex Andonian, Siddharth Narayanan, James Braza, Alexandros Sanchez Vassopoulos, Jacob L Steenwyk, Blake Lash, Andrew D White, Samuel G Rodriques

机构 * Broad Institute, Cambridge, MA, USA(博德研究所,美国马萨诸塞州剑桥市)

专题命中 评测与基准 :foundation model(abstract);language agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LABBench2,一个包含近1900个任务的改进基准,用于评估AI在真实世界中执行科学任务的能力,展示了当前前沿模型在不同子任务上的性能差异,并提供了数据集和评估工具以促进社区使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06165 2026-04-14 cs.CV cs.AI 74%

What Users Leave Unsaid: Under-Specified Queries Limit Vision-Language Models

用户未言明的内容:未指定查询限制视觉语言模型

Dasol Choi, Guijin Son, Hanwool Lee, Minhyuk Kim, Hyunwoo Ko, Teabin Lim, Ahn Eungyeol, Jungwhan Kim, Seunghyeok Hong, Youngsook Song

机构 * AIM Intelligence Yonsei University(延世大学) OneLineAI Korea University(高丽大学) Doodlin Corp.(Doodlin公司) NAVER Cloud(NAVER云) Hankuk University of Foreign Studies(韩国外国语大学) Lablup Inc.(Lablup公司)

专题命中 评测与基准 :language model(title);分类 cs.AI

AI总结 研究探讨了现实用户查询的不明确性对视觉语言模型的影响,通过HAERAE-Vision基准测试发现,即使使用先进模型,未指定查询的准确率仍低于50%,且明确化查询能显著提升性能,揭示了模型能力与实际应用间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11611 2026-04-14 cs.CL cs.LG 73%

Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation

利用和校准通过互信息自我评估的 hindsight 过程奖励

Jiashu Yao, Heyan Huang, Zeming Liu, Yuhang Guo

机构 * Beijing Institute of Technology(北京理工大学) Beihang University(北京航空航天大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出MISE方法,通过生成自我评估提供密集奖励信号并校准环境反馈,使基于大语言模型的智能体能自主学习,理论证明其等价于结合互信息与KL散度的优化目标,实验表明其在无监督条件下优于基线方法。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11322 2026-04-14 cs.CL cs.AI 73%

Do LLMs Know Tool Irrelevance? Demystifying Structural Alignment Bias in Tool Invocations

LLMs是否了解工具无关性?解密工具调用中的结构对齐偏差

Yilong Liu, Xixun Lin, Pengfei Cao, Ge Zhang, Fang Fang, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Computer Science and Technology, Donghua University(东华大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLMs在面对无关工具时的调用偏差,提出SABEval数据集和Contrastive Attention Attribution方法,揭示结构对齐偏差的成因并提出缓解策略。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10520 2026-04-14 cs.CL cs.AI cs.PL 73%

ReFEree: Reference-Free and Fine-Grained Method for Evaluating Factual Consistency in Real-World Code Summarization

ReFEree:一种用于评估现实世界代码总结事实一致性的方法

Suyoung Bae, CheolWon Na, Jaehoon Lee, Yumin Lee, YunSeok Choi, Jee-Hyong Lee

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ReFEree,一种无需参考的细粒度方法,用于评估现实世界代码总结中的事实一致性。通过定义特定于代码总结的事实不一致标准,并在段落层面进行评估,最终获得细粒度评分。

Comments Accepted to ACL 2026 main. 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07413 2026-04-14 cs.CV cs.AI cs.LG 73%

FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios

FORGE:面向制造场景的细粒度多模态评估

Xiangru Jian, Hao Xu, Wei Pang, Xinjian Zhao, Chengyu Tao, Qixin Zhang, Xikun Zhang, Chao Zhang, Guanzhi Deng, Alex Xue, Juan Du, Tianshu Yu, Garth Tarr, Linqi Song, Qiuzhuang Sun, Dacheng Tao

机构 * University of Waterloo(滑铁卢大学) University of Sydney(悉尼大学) Singapore Management University(新加坡管理大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hunan University(湖南大学) Nanyang Technological University(南洋理工大学) Royal Melbourne Institute of Technology(皇家墨尔本理工大学) City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) City University of Hong Kong Shenzhen Research Institute(香港城市大学深圳研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FORGE,构建高质量多模态数据集并评估18种先进MLLM在制造任务中的表现,揭示领域知识不足是主要瓶颈,展示结构化标注可提升模型精度。

Comments Project Page:https://ai4manufacturing.github.io/forge-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07070 2026-04-14 cs.AI cs.LG 73%

EVGeoQA: Benchmarking LLMs on Dynamic, Multi-Objective Geo-Spatial Exploration

EVGeoQA:基于动态多目标地理空间探索的LLM基准测试

Jianfei Wu, Zhichun Wang, Zhensheng Wang, Zhiyu He

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Beijing Key Laboratory of Artificial Intelligence for Education(北京市教育人工智能重点实验室) Engineering Research Center of Intelligent Technology and Educational Application, Ministry of Education(教育部智能技术与教育应用工程研究中心) College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 EVGeoQA针对动态地理空间探索提出多目标基准,通过电动汽车充电场景设计,评估LLM在动态环境中的探索能力,发现其在长距离空间探索上存在不足,但能通过历史轨迹总结提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26202 2026-04-14 cs.CL cs.AI 73%

What's In My Human Feedback? Learning Interpretable Descriptions of Preference Data

我的人类反馈中有什么?通过稀疏自编码器学习可解释的偏好数据描述

Rajiv Movva, Smitha Milli, Sewon Min, Emma Pierson

机构 * UC Berkeley(加州大学伯克利分校) FAIR at Meta(Meta AI研究院)

专题命中 评测与基准 :language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WIMHF方法,通过稀疏自编码器解释人类反馈数据,揭示偏好数据中的人类可解释特征,发现不同数据集中的偏好差异及潜在不安全偏好,为数据筛选和个性化调整提供支持。

Comments ICLR 2026 (oral). v2 adds SAE ablations and robustness checks. Code: https://github.com/rmovva/wimhf; Demo: https://rajivmovva.com/demo-wimhf/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11307 2026-04-14 cs.AI 70%

PaperScope: A Multi-Modal Multi-Document Benchmark for Agentic Deep Research Across Massive Scientific Papers

PaperScope:一种多模态多文档基准,用于跨大规模科学论文的智能深度研究

Lei Xiong, Huaying Yuan, Zheng Liu, Zhao Cao, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PaperScope提出一个多模态多文档基准,用于评估智能深度研究能力,包含2000多个跨领域问题,验证了现有系统在长上下文检索和多源推理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11258 2026-04-14 cs.CL 70%

Dialectic-Med: Mitigating Diagnostic Hallucinations via Counterfactual Adversarial Multi-Agent Debate

辩证-调解:通过反事实对抗多智能体辩论缓解诊断幻觉

Zhixiang Lu, Jionglong Su

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Dialectic-Med框架,通过多智能体对抗辩论机制缓解医疗多模态大语言模型的诊断幻觉问题,提升推理可信度和解释忠实度。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09430 2026-04-14 cs.IR cs.AI quant-ph 70%

On the Representational Limits of Quantum-Inspired 1024-D Document Embeddings: An Experimental Evaluation Framework

关于量子启发式1024维文档嵌入表示的限制:一个实验评估框架

Dario Maio

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一个实验框架,用于构建基于重叠窗口和多尺度聚合的量子启发式1024维文档嵌入,通过诊断工具评估混合检索性能,发现BM25仍为强基线,而量子启发式嵌入在排名信号上表现不稳定。

Comments 44 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02956 2026-04-14 cs.CL 70%

Enhancing Multilingual RAG Systems with Debiased Language Preference-Guided Query Fusion

通过去偏语言偏好引导查询融合增强多语言RAG系统

Jeonghyun Park, Byeongjeong Kim, Seojin Hwang, Hwanhee Lee

机构 * Chung-Ang University(中央大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出DeLP指标以消除评估基准中的结构偏见,发现多语言检索增强生成系统更倾向单语对齐,由此提出DELTA框架优化跨语言检索与生成,实验表明其在多种语言上优于英语枢纽和mRAG基线。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02651 2026-04-14 q-bio.OT cs.LG 70%

Bias Detection in Emergency Psychiatry: Linking Negative Language to Diagnostic Disparities

急诊 psychiatry 中的偏见检测:将负面语言与诊断差异联系起来

Alissa A. Valentine, Lauren A. Lepow, Donald Apakama, Lili Chan, Alexander W. Charney, Isotta Landi

机构 * Copenhagen University Denmark(丹麦哥本哈根大学) Mount Sinai School of Medicine USA(美国西奈山医学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究通过分析急诊医生偏见暴露与心理诊断之间的关联,发现负面语言比例升高与精神分裂症诊断增加有关,并揭示了种族差异的潜在影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17012 2026-04-14 cs.CV cs.AI 70%

SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence

SpatialScore:迈向空间智能的综合评估

Haoning Wu, Xiao Huang, Yaohui Chen, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SpatialScore,首个全面评估多模态空间智能的基准,评估49个模型发现其在空间理解上存在显著差距,并构建了SpatialCorpus和SpatialAgent提升模型性能。

Comments Accepted by CVPR 2026 (Highlight); Project Page: https://haoningwu3639.github.io/SpatialScore

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10865 2026-04-14 cs.AI 70%

Beyond Statistical Co-occurrence: Unlocking Intrinsic Semantics for Tabular Data Clustering

超越统计共现:为表格数据聚类解锁内在语义

Mingjie Zhao, Yunfan Zhang, Yiqun Zhang, Yiu-ming Cheung

机构 * Department of Computer Science, Hong Kong Baptist University(香港浸会大学计算机科学系) Department of Computer Science, Guangdong University of Technology(广东工业大学计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Tabular-Augmented Contrastive Clustering框架,通过LLMs将数据语义转化为文本锚点,结合对比学习和聚类目标提升表格数据聚类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10787 2026-04-14 cs.CL 70%

When Meaning Isn't Literal: Exploring Idiomatic Meaning Across Languages and Modalities

当意义不再字面化:探索跨语言和模态的隐喻意义

Sarmistha Das, Shreyas Guha, Suvrayan Bandyopadhyay, Salisa Phosit, Kitsuchart Pasupa, Sriparna Saha

机构 * Indian Institute of Technology Patna(印度理工学院巴特那分校) King Mongkut's Institute of Technology Ladkrabang(国王科技大学拉卡邦分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Mediom多语言多模态隐喻语料库及HIDE框架,通过系统性测试揭示语言模型在隐喻理解上的缺陷,并为下一代AI系统提供文化根基的隐喻理解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10740 2026-04-14 cs.CL 70%

RCBSF: A Multi-Agent Framework for Automated Contract Revision via Stackelberg Game

RCBSF: 一种基于Stackelberg游戏的多智能体框架用于通过Stackelberg游戏实现自动合同修订

Shijia Xu, Yu Wang, Xiaolong Jia, Zhou Wu, Kai Liu, April Xiaowen Dong

机构 * Chongqing University(重庆大学) Queen Mary University of London(伦敦玛丽女王大学) Chongqing Key Laboratory of Big Data Intelligence and Privacy Computing(重庆市大数据智能与隐私计算重点实验室) Fangda Partners(方达律师事务所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出RCBSF框架,通过Stackelberg游戏解决大语言模型在法律AI中合同修订的可靠性问题,通过风险约束双层结构提升输出效用,实验证明其在风险解决率和token效率方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09937 2026-04-14 cs.AI 70%

HealthAdminBench: Evaluating Computer-Use Agents on Healthcare Administration Tasks

HealthAdminBench: 评估基于计算机使用的代理在医疗管理任务上的性能

Suhana Bedi, Ryan Welch, Ethan Steinberg, Michael Wornow, Taeil Matthew Kim, Haroun Ahmed, Peter Sterling, Bravim Purohit, Qurat Akram, Angelic Acosta, Esther Nubla, Pritika Sharma, Michael A. Pfeffer, Sanmi Koyejo, Nigam H. Shah

机构 * Stanford University(斯坦福大学) Kinetic Systems Stanford Health Care(斯坦福医疗保健)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出HealthAdminBench,通过四个真实GUI环境和135个专家定义任务,评估CUA在医疗行政流程中的性能,发现端到端可靠性较低,最佳代理仅达成36.3%的任务成功率。

Comments 24 pages, 5 figures, 5 tables. Benchmark paper introducing 4 simulated environments, 135 tasks, and 1,698 evaluation points for healthcare administrative computer-use agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09626 2026-04-14 cs.CY cs.LG cs.SI 70%

Investigating Vaccine Buyer's Remorse: Post-Vaccination Decision Regret in COVID-19 Social Media Using Politically Diverse Human Annotation

研究疫苗购买后悔现象:利用政治多样性的人类注释分析新冠社交媒体中的接种决策后悔

Miles Stanley, Soumyajit Datta, Ashutosh Kumar, Ashiqur R. KhudaBukhsh

机构 * University of Washington, Seattle(华盛顿大学西雅图分校) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过构建新冠接种经历数据集,分析疫苗后悔现象的普遍性、原因及第一人称与 vicarious 经历差异,评估 LLMs 引入的潜在偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11589 2026-04-14 cs.CV 67%

MLLM-as-a-Judge Exhibits Model Preference Bias

基于大语言模型的自动评估存在模型偏好偏差

Shuitsu Koyama, Yuiga Wada, Daichi Yashima, Komei Sugiura

机构 * Keio University(庆应义塾大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文研究了基于多模态大语言模型(MLLM)的自动评估方法中存在模型特定偏好偏差的问题,提出Philautia-Eval工具量化这种偏差,并通过实验发现模型间存在相互偏好偏差,最后引入Pomms模型组合方法有效缓解了偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11506 2026-04-14 cs.CR 67%

RedShell: A Generative AI-Based Approach to Ethical Hacking

RedShell:基于生成AI的伦理黑客方法

Ricardo Bessa, Rui Claro, João Trindade, João Lourenço

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出RedShell工具,通过生成恶意PowerShell代码提升渗透测试效率,并构建了用于训练恶意代码生成模型的真实数据集,实验显示其生成的代码语法正确率高,语义一致性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11156 2026-04-14 cs.CV 67%

rPPG-VQA: A Video Quality Assessment Framework for Unsupervised rPPG Training

rPPG-VQA:一种用于无监督rPPG训练的视频质量评估框架

Tianyang Dai, Ming Chang, Yan Chen, Yang Hu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出rPPG-VQA框架,通过信号级和场景级分析评估视频对rPPG模型训练的适用性,结合双分支架构和两阶段自适应采样策略提升模型性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03765 2026-04-14 cs.CV 67%

ITIScore: An Image-to-Text-to-Image Rating Framework for the Image Captioning Ability of MLLMs

ITIScore: 一种图像到文本到图像评分框架,用于评估多模态大语言模型的图像描述能力

Zitong Xu, Huiyu Duan, Shengyao Qin, Guangyu Yang, Guangji Ma, Xiongkuo Min, Ke Gu, Guangtao Zhai, Patrick Le Callet

机构 * Shanghai Jiao Tong University(上海交通大学) University of Electronic and Science Technology of China(电子科技大学) Beijing University of Technology(北京工业大学) Institut Universitaire de France (IUF), University of Nantes(法国大学研究院(IUF),南特大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出ICBenchmark图像描述基准,包含12类内容和2K图像生成的40K短长描述,提出ITIScore自动评估指标,通过图像到文本到图像框架衡量描述质量,实验显示其与人类判断一致且具有强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10789 2026-04-14 cs.CV 67%

ReplicateAnyScene: Zero-Shot Video-to-3D Composition via Textual-Visual-Spatial Alignment

ReplicateAnyScene:通过文本-视觉-空间对齐实现零样本视频到3D场景的合成

Mingyu Dong, Chong Xia, Mingyuan Jia, Weichen Lyu, Long Xu, Zheng Zhu, Yueqi Duan

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :foundation model(abstract);prompting(abstract)

AI总结 本文提出ReplicateAnyScene框架,通过五阶段流水线实现视频到结构化3D场景的零样本合成,引入C3DR基准评估重建质量,实验表明其在生成高质量3D场景方面优于现有方法。

Comments Project Page: https://xiac20.github.io/ReplicateAnyScene/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10643 2026-04-14 cs.CV 67%

LogitDynamics: Reliable ViT Error Detection from Layerwise Logit Trajectories

LogitDynamics:从层间Logit轨迹可靠检测ViT错误

Ido Beigelman, Moti Freiman

机构 * Technion - Israel Institute of Technology(以色列理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出通过层间Logit轨迹分析可靠检测ViT模型错误,利用轻量线性头提取特征预测错误指示器,提升AUCPR并增强跨数据集泛化能力。

Comments Accepted to the HOW 2026 workshop at CVPR 2026; 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17270 2026-04-14 cs.LG cs.AI cs.CL 67%

Understanding Generalization in Role-Playing Models via Information Theory

通过信息论理解角色扮演模型的泛化能力

Yongqi Li, Hao Lang, Fei Huang, Tieyun Qian, Yongbin Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Tongyi Lab(通义实验室) Zhongguancun Academy(中关村学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过信息理论提出R-EMID指标,分析角色扮演模型在分布偏移下的泛化问题,提出协同强化学习框架提升对话生成概率,发现用户偏移对泛化影响最大。

Comments Accepted to ACL 2026 (Findings), camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10039 2026-04-14 cs.CV 67%

Counting to Four is still a Chore for VLMs

为VLMs计数仍是一项苦差事

Duy Le Dinh Anh, Patrick Amadeus Irawan, Tuan Van Vo

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 本文通过行为和机制分析研究VLMs的计数行为,提出COUNTINGTRICKS评估套件,揭示模型在不同布局和对抗提示下的漏洞,并验证Modality Attention Share方法能缓解计数失败问题。

详情

展开后加载摘要…

URL PDF HTML 收藏