arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-26 至 2026-03-26 共收录 232 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 22 篇

2512.16371 2026-03-26 cs.CV 75%

Anchored Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models

锚定视频生成:解耦场景构建与时间合成在文本到视频扩散模型中

Mariam Hassan, Bastien Van Delft, Wuyang Li, Alexandre Alahi

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出锚定视频生成方法,通过解耦场景构建与时间合成任务,提升文本到视频扩散模型在复杂场景生成和时间逻辑遵循上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23577 2026-03-26 cs.LG cs.CL cs.CY 73%

The Geometric Price of Discrete Logic: Context-driven Manifold Dynamics of Number Representations

离散逻辑的几何价格:数表示的上下文驱动流形动力学

Long Zhang, Dai-jun Lin, Wei-neng Chen

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过分析语言模型中的流形动力学,揭示了离散逻辑形成所需的拓扑变形成本,提出了一种双调控机制以解释语义分类和逻辑边界生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24558 2026-03-26 cs.CV cs.AI 70%

LensWalk: Agentic Video Understanding by Planning How You See in Videos

LensWalk: 通过规划如何在视频中观看实现代理视频理解

Keliang Li, Yansong Li, Hongze Shen, Mengdi Liu, Hong Chang, Shiguang Shan

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Peng Cheng Laboratory(鹏城实验室) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LensWalk通过建立紧密的推理-计划-观察循环,使大语言模型能够主动控制视觉观察,提升视频理解的准确性和鲁棒性。

Comments To be published in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24004 2026-03-26 cs.CL 70%

Thinking with Tables: Enhancing Multi-Modal Tabular Understanding via Neuro-Symbolic Reasoning

基于表格的思考:通过神经符号推理增强多模态表格理解

Kun-Yang Yu, Zhi Zhou, Shi-Yu Tian, Xiao-Wen Yang, Zi-Yi Jia, Ming Yang, Zi-Jian Cheng, Lan-Zhe Guo, Yu-Feng Li

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国) School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学,中国)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出TWT框架,通过神经符号推理解决表格数据结构多样性、特征依赖复杂性及任务异质性问题,在八个数据集上验证了其在多模态表格理解任务中的优越性能。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23554 2026-03-26 cs.IR cs.AI 70%

Mixture of Demonstrations for Textual Graph Understanding and Question Answering

演示混合用于文本图理解与问答

Yukun Wu, Lihui Liu

机构 * Independent Researcher, Wayne State University(韦恩州立大学独立研究者) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗克琴court研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MixDemo框架,通过MoE机制选择信息丰富的演示,结合查询特定图编码器减少噪声,提升文本图问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22460 2026-03-26 cs.AI 70%

GeoSketch: A Neural-Symbolic Approach to Geometric Multimodal Reasoning with Auxiliary Line Construction and Affine Transformation

GeoSketch: 一种基于神经符号的方法,用于几何多模态推理中的辅助线构造与仿射变换

Shichao Weng, Zhiqiang Wang, Yuhua Zhou, Rui Lu, Ting Liu, Zhiyang Teng, Xiaozhang Liu, Hanmeng Liu

机构 * Fudan University(复旦大学) IFLYTEK CO.LTD(若lytek有限公司) Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Defense Technology(国防科技大学) Hainan University(海南大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GeoSketch通过整合感知、符号推理和绘图动作模块,实现动态几何推理,提升多模态推理的准确性和解决问题的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23802 2026-03-26 cs.CY 67%

How are AI agents used? Evidence from 177,000 MCP tools

AI代理是如何被使用的?来自177,436个MCP工具的证据

Merlin Stein

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 研究通过分析177,436个MCP工具,发现AI代理主要用于软件开发,其中67%为软件开发工具,90%的MCP服务器下载量来自此领域。行动工具占比从27%上升至65%,涵盖中等和高风险任务,如金融交易。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24014 2026-03-26 cs.AI 57%

Language-Grounded Multi-Agent Planning for Personalized and Fair Participatory Urban Sensing

基于语言的多智能体规划用于个性化和公平的参与式城市传感

Xusen Guo, Mingxing Peng, Hongliang Lu, Hai Yang, Jun Ma, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 本文提出MAPUS框架,通过语言协商实现个性化和公平的参与式城市传感,提升参与度和可持续性。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23676 2026-03-26 cs.AI cs.RO 57%

Grounding Vision and Language to 3D Masks for Long-Horizon Box Rearrangement

将视觉与语言接地于3D遮罩以实现长周期箱子整理

Ashish Malik, Caleb Lowe, Aayam Shrestha, Stefan Lee, Fuxin Li, Alan Fern

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出RAMP-3D模型,通过3D遮罩的序列预测实现长周期3D箱子整理任务,优于2D VLM基线,证明基于遮罩的反应策略在长周期规划中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24376 2026-03-26 cs.CV 50%

GeoRouter: Dynamic Paradigm Routing for Worldwide Image Geolocalization

GeoRouter:面向全球图像地理定位的动态路由范式

Pengyue Jia, Derong Xu, Yingyi Zhang, Xiaopeng Li, Wenlin Zhang, Yi Wen, Yuanshao Zhu, Xiangyu Zhao

机构 * Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出GeoRouter动态路由框架,通过分析视觉内容并结合距离感知偏好目标,优化图像地理定位任务,实验表明其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24181 2026-03-26 cs.CV 50%

Unlocking Few-Shot Capabilities in LVLMs via Prompt Conditioning and Head Selection

通过提示条件和头部选择解锁LVLMs的少样本能力

Adhemar de Senneville, Xavier Bou, Jérémy Anger, Rafael Grompone, Gabriele Facciolo

机构 * Université Paris-Saclay, CNRS, ENS Paris-Saclay, Centre Borelli(巴黎萨克雷大学、国家科学研究中心、巴黎萨克雷高等师范学院、Borelli中心) École Polytechnique, AMIAD(巴黎高等理工学院、AMIAD) Institut Universitaire de France(法国高等科学研究院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出Head Ensemble Classifiers (HEC)通过提示条件和头部选择提升LVLMs在少样本和零样本分类中的性能,实现与CLIP基方法的性能平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08462 2026-03-26 cs.CR cs.PL cs.SE 50%

QLCoder: A Query Synthesizer For Static Analysis of Security Vulnerabilities

QLCoder:一种用于静态分析安全漏洞的查询生成器

Claire Wang, Ziyang Li, Saikat Dutta, Mayur Naik

专题命中 推理与问题求解 :LLM(abstract)

AI总结 QLCoder通过结合LLM与执行反馈,利用MCP接口生成有效的安全查询,有效检测漏洞。在111个Java项目中,53.4%的CVE被正确识别,优于仅使用Claude Code的10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24057 2026-03-26 cs.CV 50%

Beyond Semantic Priors: Mitigating Optimization Collapse for Generalizable Visual Forensics

超越语义先验:缓解可泛化视觉取证中的优化崩溃

Jipeng Liu, Haichao Shi, Siyu Xing, Rong Yin, Xiao-Yu Zhang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) School of Cyber Science and Technology, Beihang University(北京航空航天大学信息与科学学院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出CoRIT模型,通过对比梯度代理和三种无训练策略缓解优化崩溃,提升跨领域和通用伪造检测的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23855 2026-03-26 cs.HC 50%

General Intellectual Humility Is Malleable Through AI-Mediated Reflective Dialogue

一般智力谦虚性可通过AI介导的反思对话进行改变

Mohammad Ratul Mahjabin, Raiyan Abdul Baten

专题命中 推理与问题求解 :LLM(abstract)

AI总结 研究通过AI介导的反思对话提升一般智力谦虚性,发现其可产生持久变化,且不受政治立场和初始人格特征影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 60 篇

2603.23611 2026-03-26 cs.SE cs.AI cs.CL cs.LG 90%

LLMORPH: Automated Metamorphic Testing of Large Language Models

LLMORPH:大型语言模型的自动化形变测试

Steven Cho, Stefano Ruberto, Valerio Terragni

机构 * University of Auckland(奥克兰大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LLMORPH通过形变测试技术自动检测大型语言模型输出不一致问题,无需人工标注数据,适用于多种NLP任务和模型评估。

Comments Accepted for publication in the 40th IEEE/ACM International Conference on Automated Software Engineering (ASE 2025). This arXiv version is the authors' accepted manuscript. DOI: 10.1109/ASE63991.2025.00385 Code: github.com/steven-b-cho/llmorph

Journal ref 40th IEEE/ACM International Conference on Automated Software Engineering (ASE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23529 2026-03-26 cs.CL cs.AI 90%

Konkani LLM: Multi-Script Instruction Tuning and Evaluation for a Low-Resource Indian Language

科尼语LLM:为低资源印度语言的多脚本指令微调与评估

Reuben Chagas Fernandes, Gaurang S. Patkar

机构 * Don Bosco College Of Engineering(东邦工程学院)

专题命中 评测与基准 :LLM(title,abstract);instruction tuning(title);large language model(abstract);language model(abstract)

AI总结 本文提出Konkani-Instruct-100k数据集,通过Gemini 3生成,开发了优化区域特色的科尼语LLM,并构建多脚本评估基准,提升低资源语言在机器翻译中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21910 2026-03-26 cs.CL cs.AI 90%

AutoSCORE: Enhancing Automated Scoring with Multi-Agent Large Language Models via Structured Component Recognition

AutoSCORE: 通过结构化组件识别提升多智能体大语言模型的自动评分

Yun Wang, Zhaojun Ding, Xuansheng Wu, Siyue Sun, Ninghao Liu, Xiaoming Zhai

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 AutoSCORE通过多智能体大语言模型和结构化组件识别提升自动评分的准确性与可解释性,在多个基准数据集上表现出色,尤其在复杂评分标准下效果显著。

Comments 9 pages, 2 figures

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(48), 40898-40906, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24484 2026-03-26 cs.CV 89%

Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models

视频-only ToM:增强多模态大语言模型的理论思维

Siqi Liu, Xinyang Li, Bochao Zou, Junbao Zhuo, Huimin Ma, Jiansheng Chen

机构 * University of Science and Technology Beijing(北京科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出VisionToM框架,通过视觉干预增强多模态大语言模型的理论思维能力,改进模型在多模态任务中的推理和问答性能。

Comments 20 pages, 7 figures, accepted at CVPR 2026, project page: see https://founce.github.io/VisionToM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01754 2026-03-26 cs.CL cs.AI cs.LG 89%

Evaluation of Large Language Models via Coupled Token Generation

通过耦合标记生成评估大语言模型

Nina Corvelo Benz, Stratis Tsirtsis, Eleni Straitouri, Ivi Chatzi, Ander Artola Velasco, Suhas Thejaswi, Manuel Gomez-Rodriguez

机构 * Max Planck Institute of Biochemistry(马克斯·普朗克生物化学研究所) Hasso Plattner Institute(哈索·platzer研究所) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Aalto University(阿尔托大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过耦合自回归生成评估大语言模型,发现其在基准数据集和人机对比中产生不同排名,表明生成过程中的随机性可能影响评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23506 2026-03-26 cs.CL cs.AI 88%

Leveraging Computerized Adaptive Testing for Cost-effective Evaluation of Large Language Models in Medical Benchmarking

利用计算自适应测试对大型语言模型进行成本效益的医学基准评估

Tianpeng Zheng, Zhehan Jiang, Jiayi Liu, Shicong Feng

机构 * Institute of Medical Education, Health Science Center, Peking University(北京大学医学教育研究院、健康科学中心) School of Public Health, Peking University(北京大学公共卫生学院) Peking University Health Science Center-Chaoxing Joint Laboratory for Digital and Smart Medical(北京大学健康科学中心-超星数字与智能医疗联合实验室) Graduate School of Education, Peking University(北京大学教育学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于项目反应理论的计算自适应测试框架,用于高效评估大型语言模型在标准化医学知识中的表现,通过模拟和实证研究验证了其在成本效益和评估效率上的优势。

Comments 37 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12764 2026-03-26 cs.LG cs.DM 88%

GraphOmni: A Comprehensive and Extensible Benchmark Framework for Large Language Models on Graph-theoretic Tasks

GraphOmni: 一种全面且可扩展的大型语言模型在图论任务上的基准框架

Hao Xu, Xiangru Jian, Xinjian Zhao, Wei Pang, Chao Zhang, Suyuchen Wang, Qixin Zhang, Zhengyuan Dong, Joao Monteiro, Bang Liu, Qiuzhuang Sun, Tianshu Yu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Waterloo(滑铁卢大学) Université de Montréal / Mila - Quebec AI Institute(蒙特利尔大学 / 加拿大魁北克人工智能研究所) City University of Hong Kong(香港城市大学) Autodesk(Autodesk公司) Singapore Management University(新加坡国立大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

AI总结 本文提出GraphOmni基准框架,用于评估大型语言模型在图论任务上的推理能力,通过系统评估发现不同维度对模型性能有显著影响,且先进模型仍有提升空间。

Comments Published at ICLR 2026. Project Page: https://gai-community.github.io/Graph-Omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24359 2026-03-26 cs.SE cs.HC 88%

Gendered Prompting and LLM Code Review: How Gender Cues in the Prompt Shape Code Quality and Evaluation

性别化提示与大语言模型代码审查:提示中的性别线索如何影响代码质量和评估

Lynn Janzen, Üveys Eroglu, Dorothea Kolossa, Pia Knöferle, Sebastian Möller, Vera Schmitt, Veronika Solopova

专题命中 评测与基准 :LLM(title,abstract);prompting(title,abstract)

AI总结 研究探讨性别化提示对代码生成和审查的影响,发现性别线索在代码质量上影响有限,但对代码审查存在系统性偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24389 2026-03-26 cs.CL cs.AI cs.CY 87%

When AI Meets Early Childhood Education: Large Language Models as Assessment Teammates in Chinese Preschools

当人工智能遇见早期教育:大型语言模型作为中国幼儿园的评估伙伴

Xingming Li, Runke Huang, Yanan Bao, Yuye Jin, Yuru Jiao, Qingyong Hu

机构 * National University of Defense Technology(国防科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Oxford(牛津大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨AI如何通过提取结构化质量指标,提升中国幼儿园教师与儿童互动评估的可扩展性,提出TEPE-TCI-370h数据集和Interaction2Eval框架,实现88%的评估一致性,并验证AI在提升评估效率和促进教育公平中的潜力。

Comments Accepted to AIED 2026, Project page: https://qingyonghu.github.io/Interaction2Eval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23523 2026-03-26 cs.CL cs.RO 86%

Do 3D Large Language Models Really Understand 3D Spatial Relationships?

三维大语言模型真的能理解三维空间关系吗?

Xianzheng Ma, Tao Sun, Shuai Chen, Yash Bhalgat, Jindong Gu, Angel X Chang, Iro Armeni, Iro Laina, Songyou Peng, Victor Adrian Prisacariu

机构 * VGG(视觉信息组) University of Oxford(牛津大学) Stanford University(斯坦福大学) Simon Fraser University(西蒙弗雷泽大学) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 本文挑战了3D-LLM对三维空间关系的理解能力,提出Real-3DQA基准测试,发现现有模型在去除简单线索后表现不佳,并提出3D重加权训练目标以提升空间推理能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23613 2026-03-26 cs.SE cs.AI 85%

LLMLOOP: Improving LLM-Generated Code and Tests through Automated Iterative Feedback Loops

LLMLOOP: 通过自动化迭代反馈循环改进大语言模型生成的代码和测试

Ravin Ravi, Dylan Bradshaw, Stefano Ruberto, Gunel Jahangirova, Valerio Terragni

机构 * King's College London(伦敦国王学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LLMLOOP通过自动化迭代反馈循环提升大语言模型生成的代码和测试质量,通过五种循环解决编译错误、静态分析问题、测试失败和测试质量改进,验证了其在HUMANEVAL-X基准上的有效性。

Comments Accepted for publication in IEEE International Conference on Software Maintenance and Evolution (ICSME 2025). This arXiv version is the authors' accepted manuscript. DOI: 10.1109/ICSME64153.2025.00109 Code: github.com/ravinravi03/LLMLOOP

Journal ref IEEE International Conference on Software Maintenance and Evolution (ICSME 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23633 2026-03-26 cs.SE 85%

Detect--Repair--Verify for LLM-Generated Code: A Multi-Language, Multi-Granularity Empirical Study

检测-修复-验证LLM生成的代码:多语言、多粒度实证研究

Cheng Cheng

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过检测-修复-验证工作流评估LLM生成代码的安全性,发现多阶段修复能提升安全性和正确性,但修复可靠性依赖于修复范围和测试基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23580 2026-03-26 cs.LG 83%

MetaKube: An Experience-Aware LLM Framework for Kubernetes Failure Diagnosis

MetaKube:一种面向Kubernetes故障诊断的经验感知大语言模型框架

Wei Sun, Ting Wang, Xinran Tian, Wanshun Lan, Xuhan Feng, Haoyue Li, Fangxin Wang

机构 * School of Science(科学学院) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Future Network of Intelligence Institute(深圳未来网络智能研究院) China Mobile Communications Group Guangdong Co., Ltd.(中国移动通信集团广东有限公司)

专题命中 评测与基准 :LLM(title,abstract);post-training(abstract);分类 cs.LG

AI总结 MetaKube通过三个创新提出经验感知的大语言模型框架,提升Kubernetes故障诊断效率与准确性,实现从Qwen3-8B到接近GPT-4.1的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23701 2026-03-26 cs.CL cs.AI 82%

The Diminishing Returns of Early-Exit Decoding in Modern LLMs

现代大语言模型中早期退出解码的边际效益

Rui Wei, Rui Du, Hanfei Yu, Devesh Tiwari, Jian Li, Zhaozhuo Xu, Hao Wang

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Northeastern University(东北大学) Stony Brook University(石溪大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究现代大语言模型中早期退出解码的有效性,分析中间表示演变,并提出衡量模型内在适合性的指标,发现新模型代际中早期退出效果递减,密集变换器比专家混合和状态空间模型更适合早期退出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23576 2026-03-26 stat.AP cs.AI cs.LG 81%

Wafer-Level Etch Spatial Profiling for Process Monitoring from Time-Series with Time-LLM

晶圆级蚀刻空间成像用于时间序列的工艺监控

Hyunwoo Kim, Munyoung Lee, Seung Hyub Jeon, Kyu Sung Lee

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于时间-大语言模型的空间回归模型,直接从多通道在线工艺时间序列预测晶圆级蚀刻深度分布,验证了LLM重编程在晶圆空间监控中的可行性。

Comments Submitted to AVSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23510 2026-03-26 cs.CL cs.AI 81%

Visuospatial Perspective Taking in Multimodal Language Models

多模态语言模型中的视觉空间视角转换

Jonathan Prunty, Seraphina Zhang, Patrick Quinn, Jianxun Lian, Xing Xie, Lucy Cheke

机构 * University of Cambridge(剑桥大学) Department of Psychology(心理学系) Microsoft Research Asia(微软亚洲研究院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究评估多模态语言模型在视觉空间视角转换任务中的表现,发现其在需抑制自身视角以采用他人视角的层面2视角转换中存在显著缺陷,揭示了当前模型在协作场景中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏