arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-10 至 2026-03-10 共收录 443 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 96 篇

2603.07019 2026-03-10 cs.CL 79%

AutoChecklist: Composable Pipelines for Checklist Generation and Scoring with LLM-as-a-Judge

AutoChecklist: 用于检查表生成和评分的可组合流水线

Karen Zhou, Chenhao Tan

机构 * University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 AutoChecklist通过可组合的流水线实现检查表生成与评分,支持多种LLM提供者,并展示了在领域适应中的灵活性。

Comments Website: https://autochecklist.github.io/, Code: https://github.com/ChicagoHAI/AutoChecklist

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01865 2026-03-10 cs.CL 79%

CyclicJudge: Mitigating Judge Bias Efficiently in LLM-based Evaluation

CyclicJudge: 有效缓解基于大语言模型的评估中的判断偏差

Ziyi Zhu, Olivier Tieleman, Alexey Bukhtiyarov, Jinghong Chen

机构 * Slingshot AI Department of Engineering, University of Cambridge(工程系,剑桥大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 CyclicJudge通过轮换判断者分配策略,有效消除大语言模型评估中的判断偏差,提升评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20102 2026-03-10 cs.AI 79%

Human-Centered LLM-Agent System for Detecting Anomalous Digital Asset Transactions

面向人类的LLM-智能体系统用于检测异常数字资产交易

Gyuyeon Na, Minjung Park, Hyeonjeong Cha, Sangmi Chai

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 HCLA是一种面向人类的多智能体系统,用于通过自然语言交互提高数字资产交易异常检测的可解释性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07886 2026-03-10 cs.CL cs.AI 79%

CCR-Bench: A Comprehensive Benchmark for Evaluating LLMs on Complex Constraints, Control Flows, and Real-World Cases

CCR-Bench:一个全面的评估基准,用于评估大语言模型在复杂约束、控制流和现实世界案例中的能力

Xiaona Xue, Yiqiao Huang, Jiacheng Li, Yuanhang Zheng, Huiqi Miao, Yunfei Ma, Rui Liu, Xinbao Sun, Minglu Liu, Fanyu Meng, Chao Deng, Junlan Feng

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CCR-Bench是一个用于评估大语言模型在复杂约束、控制流和现实世界案例中表现的全面基准,通过现实工业场景的样本揭示了当前模型在复杂指令理解上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02872 2026-03-10 cs.LG cs.AI cs.FL cs.LO 79%

FATE: A Formal Benchmark Series for Frontier Algebra of Multiple Difficulty Levels

FATE:面向多难度层级的前沿代数形式化基准系列

Jiedong Jiang, Wanyi He, Yuefeng Wang, Guoxiong Gao, Yongle Hu, Jingting Wang, Nailin Guan, Peihao Wu, Chunbo Dai, Liang Xiao, Bin Dong

机构 * Westlake Institute for Advanced Study, Westlake University(西拉丘学院先进研究院,西拉丘大学) Peking University(北京大学) New Cornerstone Science Laboratory, School of Mathematical Sciences, Peking University(新基石科学实验室,北京大学数学科学学院) Center for Machine Learning Research, Peking University(机器学习研究中心,北京大学) Center for Intelligent Computing, Great Bay Institute for Advanced Study, Great Bay University(智能计算中心,大湾先进研究院,大湾大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 FATE是一个面向多难度层级的前沿代数形式化基准系列,旨在评估和推动高级数学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06636 2026-03-10 cs.LG cs.AI 79%

SmartBench: Evaluating LLMs in Smart Homes with Anomalous Device States and Behavioral Contexts

SmartBench: 评估具有异常设备状态和行为上下文的LLM在智能家居中的表现

Qingsong Zou, Zhi Yan, Zhiyao Xu, Kuofeng Gao, Jingyu Xiao, Yong Jiang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Jilin University(吉林大学) The Chinese University of Hong Kong(香港中文大学) Pengcheng Laboratory(鹏城实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SmartBench是首个为LLM设计的智能家居数据集,用于评估LLM在检测异常设备状态和行为上下文中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08397 2026-03-10 eess.AS 78%

NLE: Non-autoregressive LLM-based ASR by Transcript Editing

NLE:基于大语言模型的语音识别的非自回归方法通过转录编辑

Avihu Dekel, Samuel Thomas, Takashi Fukada, George Saon

专题命中 评测与基准 :LLM(title,abstract)

AI总结 NLE通过非自回归方法实现高效语音识别,利用转录编辑技术在保持准确性的同时显著提升处理速度,适用于实时应用场景。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07786 2026-03-10 cs.CV 78%

OrdinalBench: A Benchmark Dataset for Diagnosing Generalization Limits in Ordinal Number Understanding of Vision-Language Models

OrdinalBench: 一种用于诊断视觉-语言模型在序数理解通用性限制的基准数据集

Yusuke Tozaki, Hisashi Miyamori

机构 * Division of Frontier Informatics, Kyoto Sangyo University, Kyoto, Japan(前沿信息学系,京都精华大学,京都,日本)

专题命中 评测与基准 :language model(title,abstract)

AI总结 OrdinalBench通过评估视觉-语言模型在序数理解上的表现,揭示其在大序数和复杂路径条件下的泛化能力不足问题。

Comments Accepted as a Short Paper at VISAPP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07403 2026-03-10 cs.CV 78%

Prompt-Based Caption Generation for Single-Tooth Dental Images Using Vision-Language Models

基于提示的单牙牙科图像标题生成使用视觉-语言模型

Anastasiia Sukhanova, Aiden Taylor, Julian Myers, Zichun Wang, Kartha Veerya Jammuladinne, Satya Sri Rajiteswari Nimmagadda, Aniruddha Maiti, Ananya Jana

机构 * Marshall University(马歇尔大学) West Virginia State University(西弗吉尼亚州立大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出使用视觉-语言模型生成单牙牙科图像标题,解决现有数据集缺乏和标题描述不全面的问题。

Comments Accepted to IEEE International Conference on Semantic Computing (IEEE ICSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02732 2026-03-10 cs.CV 78%

Prithvi-EO-2.0: A Versatile Multi-Temporal Foundation Model for Earth Observation Applications

Prithvi-EO-2.0:一种用于地球观测应用的多功能多时间基础模型

Daniela Szwarcman, Sujit Roy, Paolo Fraccaro, Þorsteinn Elí Gíslason, Benedikt Blumenstiel, Rinki Ghosal, Pedro Henrique de Oliveira, Joao Lucas de Sousa Almeida, Rocco Sedona, Yanghui Kang, Srija Chakraborty, Sizhe Wang, Carlos Gomes, Ankur Kumar, Myscon Truong, Denys Godwin, Hyunho Lee, Chia-Yu Hsu, Rohit Lal, Ata Akbari Asanjan, Besart Mujeci, Disha Shidham, Trevor Keenan, Paulo Arevalo, Wenwen Li, Hamed Alemohammad, Pontus Olofsson, Christopher Hain, Robert Kennedy, Bianca Zadrozny, David Bell, Gabriele Cavallaro, Campbell Watson, Manil Maskey, Rahul Ramachandran, Juan Bernabe Moreno

机构 * IBM Research(IBM研究院) NASA Marshall Space Flight Center(NASA马歇尔航天飞行中心) Earth System Science Center(地球系统科学中心) School of Engineering and Natural Sciences(工程与自然科学学院) Jülich Supercomputing Centre(julich超级计算中心) Department of Biological Systems Engineering(生物系统工程系) School of Geographical Sciences and Urban Planning(地理科学与城市规划学院) College of Earth, Ocean, and Atmospheric Sciences(地球、海洋与大气科学学院)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 Prithvi-EO-2.0通过多时间序列训练和用户反馈优化,提升了地球观测任务的性能和应用灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07927 2026-03-10 cs.SE cs.AI 77%

SWE-Fuse: Empowering Software Agents via Issue-free Trajectory Learning and Entropy-aware RLVR Training

SWE-Fuse: 通过无问题轨迹学习和熵感知RLVR训练增强软件代理

Xin-Cheng Wen, Binbin Chen, Haoxuan Lan, Hang Yu, Peng Di, Cuiyun Gao

机构 * Ant Group(蚂蚁集团) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SWE-Fuse通过融合问题描述引导和无问题样本,提升软件代理在解决现实问题中的性能,其熵感知训练模块有效平衡探索与稳定性。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03155 2026-03-10 cs.LG cs.AI physics.chem-ph 76%

Information Routing in Atomistic Foundation Models: How Task Alignment and Equivariance Shape Linear Disentanglement

原子基础模型中的信息路由:任务对齐与等变性如何塑造线性解缠

Joshua Steier

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :foundation model(title);分类 cs.AI、cs.LG

AI总结 研究通过CPD方法揭示原子基础模型中任务对齐与等变性如何影响线性解缠,发现任务对齐主导几何信息可访问性,且对称类型影响信息路由。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23324 2026-03-10 cs.HC 75%

Partnering with Generative AI: Experimental Evaluation of Human-Led and Model-Led Interaction in Human-AI Co-Creation

与生成式AI合作:人类主导与模型主导交互在人类-人工智能协同创作中的实验评估

Sebastian Maier, Manuel Schneider, Stefan Feuerriegel

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究通过实验评估人类主导与模型主导的交互模式,发现模型主导模式提升想法质量但降低多样性与所有权,而人类主导模式在保持多样性与所有权的同时也提升想法质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08650 2026-03-10 cs.CY 75%

Who is Responsible? The Data, Models, Users or Regulations? A Comprehensive Survey on Responsible Generative AI for a Sustainable Future

谁该负责?数据、模型、用户还是法规?为可持续未来全面调查负责任的生成式人工智能

Shaina Raza, Rizwan Qureshi, Anam Zahid, Amgad Muneer, Anas Zafar, Safiullah Kamawal, Ferhat Sadak, Joseph Fioresi, Muhammaed Saeed, Ranjan Sapkota, Aditya Jain, Muneeb Ul Hassan, Aizan Zafar, Hasan Maqbool, Ashmal Vayani, Jia Wu, Maged Shoman

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文全面调查了生成式人工智能的负责任发展,提出评估标准、生命周期指标及领域分析,旨在推动安全和可持续的AI部署。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05216 2026-03-10 cs.IR cs.AI math.HO 74%

Semantic Search over 9 Million Mathematical Theorems

对900万条数学定理进行语义检索

Luke Alexander, Eric Leonen, Sophie Szeto, Artemii Remizov, Ignacio Tejeda, Jarod Alper, Giovanni Inchiostro, Vasily Ilin

机构 * Math AI Lab, University of Washington, Seattle, United States(数学AI实验室,华盛顿大学,西雅图,美国) Department of Mathematics, University of Washington, Seattle, United States(数学系,华盛顿大学,西雅图,美国) Paul G. Allen School of Computer Science and Engineering, University of Washington, Seattle, United States(保罗·G·艾伦计算机科学与工程学院,华盛顿大学,西雅图,美国) Lake Washington High School, Kirkland, United States(拉克华盛顿高中, Kirkland,美国) Department of Applied and Computational Mathematical Sciences, University of Washington, Seattle, United States(应用与计算数学科学系,华盛顿大学,西雅图,美国)

专题命中 评测与基准 :language model(abstract,journal_ref);prompting(abstract);分类 cs.AI;large language model(journal_ref)

AI总结 本文提出了一种大规模语义检索方法,针对920万条数学定理进行高效检索,显著提升了定理和论文的检索效果。

Comments theoremsearch.com

Journal ref ICLR 2026 Workshop: Logical Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08329 2026-03-10 cs.CL cs.AI cs.IR 73%

SPD-RAG: Sub-Agent Per Document Retrieval-Augmented Generation

SPD-RAG:基于文档的子代理检索增强生成

Yagiz Can Akay, Muhammed Yusuf Kartal, Esra Alparslan, Faruk Ortakoyluoglu, Arda Akpinar

机构 * TOBB University of Economics and Technology(托布大学经济与技术学院) OSTIM Technical University(OSTIM技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SPD-RAG通过文档级子代理和集中融合提升多文档问答性能,实现高效检索与生成。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07379 2026-03-10 cs.AI cs.CL cs.CR cs.IR 73%

SoK: Agentic Retrieval-Augmented Generation (RAG): Taxonomy, Architectures, Evaluation, and Research Directions

SoK:基于代理的检索增强生成(RAG):分类、架构、评估及研究方向

Saroj Mishra, Suman Niroula, Umesh Yadav, Dilip Thakur, Srijan Gyawali, Shiva Gaire

机构 * University of North Dakota(北达科他大学) Youngstown State University(青年州大学) University of Toledo(托莱多大学) University of Missouri(密苏里大学) Tribhuvan University(特里布文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文系统化地分析了基于代理的RAG系统,提出统一框架,识别关键风险并提出研究方向,以构建可靠可扩展的自主检索生成系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00312 2026-03-10 cs.AI cs.LG 73%

How Well Do Multimodal Models Reason on ECG Signals?

多模态模型在心电图信号上的推理能力如何?

Maxwell A. Xu, Harish Haresamudram, Catherine W. Liu, Patrick Langer, Jathurshan Pradeepkumar, Wanting Mao, Sunita J. Ferns, Aradhana Verma, Jimeng Sun, Paul Schmiedmayer, Xin Liu, Daniel McDuff, Emily B. Fox, James M. Rehg

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Rush University(拉什大学) ETH Zurich(苏黎世联邦理工学院) St. Christopher's Hospital for Children(圣克里斯opher儿童医院) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Google Inc(谷歌公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种评估多模态模型在ECG信号上推理能力的框架,通过感知和演绎两个方面验证模型的逻辑和模式识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08942 2026-03-10 cs.LG cs.AI 73%

Language in the Flow of Time: Time-Series-Paired Texts Weaved into a Unified Temporal Narrative

时间之流中的语言:将时间序列配对文本编织成统一的时间叙事

Zihao Li, Xiao Lin, Zhining Liu, Jiaru Zou, Ziwei Wu, Lecheng Zheng, Dongqi Fu, Yada Zhu, Hendrik Hamann, Hanghang Tong, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta IBM Research(IBM研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TaTS框架,将时间序列配对文本作为辅助变量,提升多模态时间序列预测性能。

Comments ICLR 2026, 47 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08153 2026-03-10 cs.CL 70%

Gender Bias in MT for a Genderless Language: New Benchmarks for Basque

机器翻译中性别偏见的研究:巴斯克语的新基准测试

Amaia Murillo, Olatz-Perez-de-Viñaspre, Naiara Perez

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过引入两个新数据集,研究巴斯克语翻译中的性别偏见问题,发现模型存在系统性偏好阳性形式的现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08024 2026-03-10 cs.CL 70%

ConflictBench: Evaluating Human-AI Conflict via Interactive and Visually Grounded Environments

ConflictBench: 通过交互式和视觉 grounded 环境评估人类-人工智能冲突

Weixiang Zhao, Haozhen Li, Yanyan Zhao, xuda zhi, Yongbo Huang, Hao He, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) SERES

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ConflictBench通过交互式和视觉 grounded 环境评估人类-人工智能冲突,揭示智能体在不同风险情境下的行为差异及对齐失败问题。

Comments 29 pages, 20 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07931 2026-03-10 cs.CL 70%

BRIDGE: Benchmark for multi-hop Reasoning In long multimodal Documents with Grounded Evidence

BRIDGE: 多跳推理长多模态文档基准测试与证据 grounded

Biao Xiang, Soyeon Caren Han, Yihao Ding

机构 * The University of Melbourne(墨尔本大学) The University of Western Australia(西澳大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 BRIDGE是一个针对长多模态文档的多跳推理基准测试,通过显式的多跳推理注释揭示证据聚合和 grounding 的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07452 2026-03-10 cs.CR cs.AI 70%

Backdoor4Good: Benchmarking Beneficial Uses of Backdoors in LLMs

Backdoor4Good: 对LLMs中有益后门应用的基准测试

Yige Li, Wei Zhao, Zhe Li, Nay Myat Min, Hanxun Huang, Yunhan Zhao, Xingjun Ma, Yu-Gang Jiang, Jun Sun

机构 * Singapore Management University(新加坡国立管理学院) The University of Melbourne(墨尔本大学) Fudan University(复旦大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Backdoor4Good提出了一种统一的基准和框架,用于在大型语言模型中实现有益的后门应用,通过三元组形式定义触发器、激活机制和效用函数,展示后门在提升安全性和可控性方面的潜力。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07444 2026-03-10 cs.AI econ.GN q-fin.EC 70%

HLER: Human-in-the-Loop Economic Research via Multi-Agent Pipelines for Empirical Discovery

HLER: 通过多智能体流水线进行人机协同的经济研究

Chen Zhu, Xiaolu Wang

机构 * China Agricultural University(中国农业大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HLER通过多智能体流水线实现人机协同的经济研究,利用数据集感知的假设生成提升实证研究效率和可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07391 2026-03-10 cs.AI cs.MA 70%

NAAMSE: Framework for Evolutionary Security Evaluation of Agents

NAAMSE:用于智能体进化安全评估的框架

Kunal Pai, Parth Shah, Harshil Patel

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 NAAMSE通过进化框架提升智能体的安全评估,利用遗传突变和探索发现隐藏漏洞,提供更真实鲁棒性评估。

Comments Published at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07039 2026-03-10 cs.AI 70%

Self-Supervised Multi-Modal World Model with 4D Space-Time Embedding

具有4D空间-时间嵌入的自监督多模态世界模型

Lance Legel, Qin Huang, Brandon Voelker, Daniel Neamati, Patrick Alan Johnson, Favyen Bastani, Jeff Rose, James Ryan Hennessy, Robert Guralnick, Douglas Soltis, Pamela Soltis, Shaowen Wang

机构 * Ecological Intelligence Lab(生态智能实验室) School of Complex Adaptive Systems(复杂适应系统学院) University of Houston(休斯顿大学) Geosensing Systems Engineering & Sciences Lab(传感系统工程与科学实验室) Stanford University(斯坦福大学) Allen Institute for Artificial Intelligence(人工智能研究院) Spatial Intelligence Lab(空间智能实验室) Department of Computer Science(计算机科学系) Georgia Institute of Technology(佐治亚理工学院) Florida Museum of Natural History(佛罗里达自然历史博物馆) University of Florida(佛罗里达大学) NSF Institute for Geospatial Understanding(国家科学基金会地理理解研究所) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 DeepEarth通过4D空间-时间嵌入实现自监督多模态世界模型,在生态预测中取得最佳性能。

Comments 8 pages, 5 figures, 1 table. Presented at 2026 World Modeling Workshop, Mila Quebec

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06599 2026-03-10 cs.CY cs.AI 70%

Building the ethical AI framework of the future: from philosophy to practice

构建未来的伦理AI框架:从哲学到实践

Jasper Kyle Catapang

机构 * Graduate School of Global Studies(全球研究研究生院) Tokyo University of Foreign Studies(东京外国语大学) AI Product Development Division(人工智能产品开发部门) Money Forward, Inc.(Money Forward公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种伦理设计控制架构,通过三重闸门机制整合后果论、义务论和美德伦理,为AI生命周期提供可执行的治理方案。

Journal ref AI Ethics 6, 150 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08060 2026-03-10 cs.HC 67%

CinemaWorld: Generative Augmented Reality with LLMs and 3D Scene Generation for Movie Augmentation

CinemaWorld: 基于 LLM 和 3D 场景生成的生成增强现实用于电影增强

Keiichi Ihara, DaeHo Lee, Manato Abe, Hye-Young Jo, Ryo Suzuki

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 CinemaWorld 利用 LLM 和 3D 场景生成技术,通过增强现实将电影内容与现实环境结合,提升观影沉浸感和娱乐性。

Comments 13 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07769 2026-03-10 cs.CV 67%

MedQ-Deg: A Multidimensional Benchmark for Evaluating MLLMs Across Medical Image Quality Degradations

MedQ-Deg:一个多维基准,用于评估医疗图像质量退化下的多模态大语言模型

Jiyao Liu, Junzhi Ning, Chenglong Ma, Wanying Qu, Jianghan Shen, Siqi Luo, Jinjie Wei, Jin Ye, Pengze Li, Tianbin Li, Jiashi Lin, Hongming Shan, Xinzhe Luo, Xiaohong Liu, Lihao Liu, Junjun He, Ningsheng Xu

机构 * Fudan University(复旦大学) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Imperial College London(伦敦帝国理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 MedQ-Deg是一个多维基准,用于评估医疗图像质量退化下多模态大语言模型的性能,揭示模型在不同退化类型下的表现差异及置信度校准问题。

Comments 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07605 2026-03-10 cs.IR 67%

Deep Research for Recommender Systems

深度研究推荐系统

Kesha Ou, Chenghao Wu, Xiaolei Wang, Bowen Zheng, Wayne Xin Zhao, Weitao Li, Long Zhang, Sheng Chen, Ji-Rong Wen

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出RecPilot多代理框架,通过生成用户为中心的报告替代传统物品列表,主动提升用户体验并减少用户决策负担。

Comments 24 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏