arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-20 至 2026-07-20 共收录 204 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 35 篇

2607.15544 2026-07-20 cs.CL 新提交 70%

EpiNarrate: Agentic Generation of Grounded Narratives from Epidemiological Scenario Projections

EpiNarrate:基于流行病学情景预测的有智能体的叙事生成

Rituparna Datta, Srini Venkatramanan, Bryan L. Lewis, Yiqi Su, Harry Hochheiser, Lucie Contamin, Parantapa Bhattacharya, Naren Ramakrishnan, Anil Vullikanti

机构 * University of Virginia(弗吉尼亚大学) Biocomplexity Institute(生物复杂性研究所) Virginia Tech(弗吉尼亚理工大学) University of Pittsburgh(匹兹堡大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究旨在生成公共卫生叙事,提出EpiNarrate框架,将数值推理与自然语言生成分离,通过提取情景轴、构建数据集等步骤,经实验验证该模型能生成事实依据更充分、覆盖范围更广且风格类似专家报告的叙事。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15418 2026-07-20 cs.AI cs.CV 新提交 70%

DrawingVQA: A Real-World Benchmark for Multi-Depth Visual-Textual Reasoning on Construction Drawings

DrawingVQA:建筑图纸上多深度视觉文本推理的真实世界基准测试

Yoonhwa Jung, Junryu Fu, Mani Golparvar-Fard

机构 * Louisiana State University(路易斯安那州立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DrawingVQA针对建筑图纸多深度视觉文本推理设计基准测试,利用图纸与问答对,提出双分类框架评估模型,揭示模型与专家表现差距,为领域特定多模态推理及AI与工程工作流程整合奠定基础。

Comments CVPR 2026 Findings accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06006 2026-07-20 cs.CL 版本更新 70%

From Articles to Premises: Building PrimeFacts, an Extraction Methodology and Resource for Fact-Checking Evidence

从文章到前提:构建PrimeFacts,一种提取事实核查证据的方法和资源

Premtim Sahitaj, Jawan Kolanowski, Ariana Sahitaj, Veronika Solopova, Max Upravitelev, Daniel Röder, Iffat Maab, Junichi Yamagishi, Sebastian Möller, Vera Schmitt

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PrimeFacts方法,通过提取事实核查文章中的细粒度证据,提升自动化验证系统的性能,其在证据检索和声明验证中表现出显著优势。

Comments Accepted at LREC 2026. To appear in the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22204 2026-07-20 cs.RO cs.AI 版本更新 70%

Human-Inspired Neuro-Symbolic World Modeling and Logic Reasoning for Interpretable Safe UAV Landing Site Assessment

受人类启发的神经符号世界建模与逻辑推理用于可解释的安全无人机着陆点评估

Weixian Qian, Tianyi Yang, Sebastian Schroder, Yao Deng, Jiaohong Yao, Xiao Cheng, Richard Han, Xi Zheng

机构 * Macquarie University(麦考瑞大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 NeuroSymLand通过结合神经符号方法,实现了可解释的安全无人机着陆点评估,优于现有基线方法。

Comments The paper has a major update, which is uploaded to https://arxiv.org/abs/2607.02277

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16181 2026-07-20 cs.CV 新提交 67%

Vision-Language Assistant for Emotional Reactions to Risky Driving

用于对危险驾驶产生情感反应的视觉语言助手

Harine Choi, Eun Hak Lee, Zhengzhong Tu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 研究针对现有自动驾驶视觉语言模型忽视情感维度与用户体验的问题,提出KYA系统。它由视觉模块(用YOLOv8变体检测危险行为并提取指标生成日志)和语言模块(依情感基调设置生成回应)组成,经实验评估表现良好,为车载人工智能带来新范式。

Comments Transportation Research Record. Advance online publication (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15674 2026-07-20 cs.RO 新提交 67%

A Generative Partially Specified Finite State Machine Approach to Complex Behaviour Planning

一种用于复杂行为规划的生成式部分指定有限状态机方法

Kalana Ratnayake, Michael Pritchard, David Hinwood, Maleen Jayasuriya, Damith Herath

机构 * University of Canberra(堪培拉大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 研究为自主机器人在动态环境中的行为规划,提出生成式部分指定有限状态机(GPSFSM)神经符号架构,利用Fabric等组件实现标准化语义能力描述,实验表明该方法计划生成成功率高、延迟低,还能生成复杂行为,且开源堆栈使其实用可重复。

Comments Accepted for publication in the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). 9 pages, 10 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15283 2026-07-20 cs.IR 新提交 67%

Adaptive Retrieval Strategies for Biomedical Question Answering

生物医学问答的自适应检索策略

Han Yue, Eric Zhou, Alex Hu, Xueshen Li, Yuan Zhang, Jinfeng Zhang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 研究生物医学问答中不同问题类型的有效检索策略,提出自适应检索框架,依问题类型选检索和证据聚合策略,结合多种技术,经实验验证该策略能提升证据相关性和答案质量,为增强相关问答系统提供有效方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19235 2026-07-20 cs.CV cs.RO 版本更新 67%

Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding

生成模型了解空间:解锁隐式3D先验用于场景理解

Xianjin Wu, Dingkang Liang, Tianrui Feng, Kui Xia, Yumeng Zhang, Xiaofan Li, Xiao Tan, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Baidu Inc.(百度公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出通过大规模视频生成模型的隐式空间先验提升场景理解,引入VEGA-3D框架,利用预训练视频扩散模型作为潜在世界模拟器,通过时空特征提取与语义融合增强大语言模型的几何信息,实验验证其在3D场景理解、空间推理和具身操控中的优越性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15286 2026-07-20 cs.CR cs.CL cs.LG 新提交 62%

Hidden in Thought: Transferable Chain-of-Thought Artifacts Induce Harmful Behavior

隐藏在思维中:可转移的思维链工件引发有害行为

Ali khalil, Aly M. Kassem, Mohamed Abdelrazek, Santu Rana, Negar Rostamzadeh, Golnoosh Farnadi

机构 * Applied Artificial Intelligence Initiative, Deakin University, Australia(德克萨斯大学应用人工智能计划,澳大利亚) Mila, Quebec AI Institute, Quebec, Canada(魁北克AI研究所)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究受损语言模型中有害思维链痕迹能否引发不安全行为及被提炼成越狱攻击,通过实验发现其能转移有害行为,挖掘出有害推理组件,提炼模式可产生有效黑盒越狱,表明有害推理在多层面转移,需评估推理上下文的防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15178 2026-07-20 cs.CL cs.AI 版本更新 62%

T^2MLR: Transformer with Temporal Middle-Layer Recurrence

T^2MLR:具有时间中层循环的Transformer

Ziyang Cai, Xingyu Zhu, Yihe Dong, Yinghui He, Sanjeev Arora

机构 * Princeton University(普林斯顿大学)

专题命中 推理与问题求解 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 研究针对Transformer推理受自回归解码限制问题,提出T2MLR架构,将前token缓存中间层表示融合到当前token较早层,在自然语言预训练和多跳推理微调中表现优,且局部中层块应用循环效果好,还无需从头预训练,降低实际应用门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26772 2026-07-20 cs.AI cs.LG 交叉投稿 62%

Beyond a Single Direction: Chain-of-Thought Disrupts Simple Steering of Refusal

超越单一方向:思维链破坏简单的拒绝引导

Kia-Jüng Yang, Dominik Meier, Jiachen Zhao, Terry Ruas, Bela Gipp

机构 * University of Göttingen, Germany(哥廷根大学,德国) Northeastern University, Boston, MA, USA(东北大学,波士顿,马萨诸塞州,美国)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本文研究大型推理模型(LRM)中拒绝行为的机制,发现思维链(CoT)与激活共同编码拒绝信号,使得仅通过激活引导难以逆转拒绝,但通过两阶段干预(激活引导下重新生成CoT)可显著提高逆转率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15647 2026-07-20 cs.AI 新提交 57%

Neuro-Symbolic AI for LEED compliance: Document-Centric Benchmarking, Deterministic Numeric Checking, and When Multimodal Hurts

用于LEED合规的神经符号人工智能:以文档为中心的基准测试、确定性数值检查以及多模态何时有害

Aritro De, Juliana Felkner

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究小型本地部署语言模型对LEED文档筛选及符号组件作用,引入神经符号管道,通过对齐PDF、检索证据、语言模型验证和数值检查器检查来验证合规性,实验表明特定模型在任务中表现较好,管道及基线提供了参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15442 2026-07-20 cs.AI 新提交 57%

Beyond a Joke: Multi-Angle Reasoning for Detecting and Explaining Harmful Humor in Memes

超越玩笑:用于检测和解释表情包中有害幽默的多角度推理

Shanhong Liu, Pai Chet Ng, De Wen Soh, Malika Meghjani, Konstantinos N. Plataniotis

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究如何检测和解释表情包中有害幽默,提出MAR-12框架,利用视觉语言模型,从十二个角度解读表情包,经注意力机制和原型分类器预测,在多数据集上准确率超现有方法,且能给出有说服力的解释。

Comments Accepted for Publication at AAAI-ICWSM 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11436 2026-07-20 cs.AI 版本更新 57%

The Ebb and Flow of Multimodal Focus: Scheduling Visual Relay Windows for Grounded VLM Reasoning

多模态焦点的潮起潮落:为基于视觉的语言模型推理调度视觉中继窗口

Wencheng Ye, Yi Bin, Yujuan Ding, Hongye Fang, Zheng Wang, Xing Xu, Jingkuan Song, Yun Zhang, Sirui Da, Heng Tao Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) School of Fashion and Textiles, The Hong Kong Polytechnic University(香港理工大学纺织及制衣学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究视觉语言模型视觉证据不稳定问题,通过剖析其内部多模态注意力焦点的三阶段分布,提出TRACE框架,该框架能自适应控制推理,在多模型和多基准测试中显著提升基于证据的多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08423 2026-07-20 cs.AI 版本更新 57%

OmniFood-Bench: Evaluating VLMs for Nutrient Reasoning and Personalized Health Advice

OmniFood-Bench:评估用于营养推理和个性化健康建议的视觉语言模型

Qian Jiang, Zhecheng Shi, Jingpu Yang, Zirui Song, Miao Fang

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 介绍OmniFood-Bench基准评估用于营养推理和个性化健康建议的VLMs,基于MM-Food-100K数据集,评估其三种能力,实验发现模型在菜品命名与质量估计等方面存在“语义-物理差距”,为公共卫生自主智能体建立可信度标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16094 2026-07-20 cs.CV 新提交 50%

How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA

视觉语言模型如何失败?组合式视觉问答中的视觉-操作不对齐

Navya Gupta, Bingjie Xu, Avinash Anand, Timothy Liu, Zhengchen Zhang

机构 * Singapore Institute of Technology(新加坡科技学院) NVIDIA(英伟达)

专题命中 推理与问题求解 :language model(abstract)

AI总结 研究组合式视觉问答中视觉语言模型失败的机制,引入以操作为中心的框架分解失败模式,揭示四种失败模式及传播路径,表明不同失败类型需不同纠正策略,为提升模型可靠性提供基础。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23213 2026-07-20 cs.SE 版本更新 50%

GAPS: Targeted Execution of Android Apps via Static Path Reconstruction

GAPS:通过静态路径重构实现安卓应用的定向执行

Samuele Doria, Alexander Pilgun, Jordan Samhi, Jacques Klein, Eleonora Losiouk

专题命中 推理与问题求解 :LLM(abstract)

AI总结 研究安卓应用定向执行难题,提出GAPS方法,结合静态程序分析与动态GUI探索,通过反向遍历调用图和数据流推理识别路径并转化为策略,在基准测试和热门应用评估中表现出色,有效且可扩展地解决了定向方法执行问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 44 篇

2606.16127 2026-07-20 cs.CL cs.AI cs.LG 版本更新 92%

AuAu: A Benchmark for Auditing Authoritarian Alignment in Large Language Models

AuAu: 大型语言模型中威权对齐审计基准

Andreas Einwiller, Max Klabunde, Florian Lemmerich

机构 * University of Zurich(苏黎世大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AuAu基准,结合心理测量、情境行为测试和用户提示评估LLM的威权倾向,发现17个模型均存在显著威权响应,且系统提示可操纵多数模型。

Comments v2, 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15899 2026-07-20 cs.LG 新提交 90%

ContinuityBench: A Benchmark and Systems Study of Stateful Failover in Multi-Provider LLM Routing

ContinuityBench:多提供商大语言模型路由中有状态故障转移的基准测试与系统研究

Vishal Pandey, Gopal Singh

机构 * Metriqual(梅特里夸尔)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究多提供商LLM路由中状态故障转移问题,提出有状态代理架构及历史转发策略,引入新指标,通过continuity - bench评估,实证表明该架构CPR达99.20%,刻画延迟分布,为构建多模型推理系统提供基础。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15517 2026-07-20 cs.CV cs.AI 新提交 89%

SLAPBench: Benchmarking Multimodal Large Language Models for Four-Finger SLAP Fingerprint Verification

SLAPBench:用于四指SLAP指纹验证的多模态大语言模型基准测试

Bibesh Pyakurel, M. G. Sarwar Murshed

机构 * University of Wisconsin–Green Bay(威斯康星大学格林湾分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究四指SLAP指纹验证,介绍SLAPBench基准,评估多个MLLM在不同提示下的表现,发现提示控制崩溃,模型能力控制歧视,建立了特定于SLAP的MLLM基线,揭示了模型在指纹验证中的能力差距和公平性问题。

Comments 19 pages, 6 figures, 2 tables. Includes appendix with supporting figures and per-subgroup fairness detail. Code and data: https://github.com/bibeshpyakurel/SLAPBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06742 2026-07-20 cs.SE cs.AI 版本更新 89%

Evaluating LLM-Based 0-to-1 Software Generation in End-to-End CLI Tool Scenarios

评估基于LLM的从零开始软件生成在端到端CLI工具场景中的表现

Ruida Hu, Xinchen Wang, Chao Peng, Cuiyun Gao, David Lo

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Independent Researcher, China(独立研究者,中国) Singapore Management University, Singapore(新加坡管理大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CLI-Tool-Bench基准,用于评估从零生成CLI工具的能力,发现顶级模型成功率低于43%,指出生成代码倾向单体化。

Comments Data link: https://github.com/kinesiatricssxilm14/CLI-Tool-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15414 2026-07-20 cs.LG cs.AI q-fin.CP 新提交 88%

AI Trading: Evaluating Large Language Models for Technical Market Analysis

人工智能交易:评估用于技术市场分析的大语言模型

Geofrey Ntale

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文系统比较评估五个大语言模型用于技术市场分析的能力,涵盖四项任务,采用多种定量指标。实验发现GPT-4 Turbo在通用模型中年化回报和夏普比率最高,FinGPT经领域微调表现出色,二者均超标准普尔500指数基准,还识别出模型存在的问题及得出相关结论。

Comments Master's research paper, Georgia Institute of Technology. 31 pages, 4 figures

Journal ref Georgia Institute of Technology, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15396 2026-07-20 cs.CL 88%

Attribution, Citation, and Quotation: A Survey of Evidence-based Text Generation with Large Language Models

归因、引用与引述:基于大语言模型的证据导向文本生成综述

Tobias Schreieder, Tim Schopf, Michael Färber

机构 * TU Dresden & ScaDS.AI Dresden/Leipzig(德累斯顿技术大学及ScaDS.AI德累斯顿/莱比锡)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文综述了基于大语言模型的证据导向文本生成,分析了134篇论文,提出统一的分类体系,探讨了引用、归因和引述三种方法,并指出未来研究方向和挑战。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13347 2026-07-20 cs.CL cs.AI cs.LG 版本更新 87%

LLM-as-a-Judge Scores Are Unreliable Optimization Signals in Closed-Loop Table Recognition

评估能力并不意味着优化效用:闭环表格识别中的大语言模型作为评判信号

Donghwan Kim

机构 * Aidentyx Inc.(艾登蒂克斯公司)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究闭环表格识别中LLM-as-a-judge的效用,发现其评判信号弱,无特定反馈也有严重损失,结构保留约束效果不佳,表明评估能力不意味着优化效用,迭代细化需确定性检测结构变化的验证信号。

Comments 32 pages, 9 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15555 2026-07-20 cs.IR 新提交 86%

LLMs Encode Relevance as a Layer-Wise Cross-Lingual Signal

语言模型将相关性编码为分层跨语言信号

Pietro Bernardelle, Samaneh Mohtadi, Stefano Civelli, Joel Mackenzie, Gianluca Demartini

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型中查询与文档相关性是否可线性解码,通过引导中等规模模型、提取激活并训练线性探针,发现相关性是深度依赖信号,多语言实验有部分跨语言可移植性,为基于LLM的相关性评估提供表征视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14835 2026-07-20 cs.IR 版本更新 85%

LLM-Based Re-Ranking for Real Estate Search

基于大语言模型的房地产搜索重排

Nkateko Ntimane, Rafael Guedes, Tiago Cunha, Pedro Nogueira

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对拉丁美洲住房市场搜索难题及用户期望变化,提出基于大语言模型的重排器,依用户对话意图重排候选房源,构建评估数据集并验证,提升了搜索重排质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23786 2026-07-20 cs.AI cs.LG 版本更新 84%

FAIR_XAI: Improving Multimodal Foundation Model Fairness via Explainability for Wellbeing Assessment

FAIR_XAI: 通过可解释性提升多模态基础模型公平性以用于幸福感评估

Sophie Chiang, Tom Brennan, Fethiye Irmak Dogan, Jiaee Cheong, Hatice Gunes

机构 * Department of Computer Science & Technology, University of Cambridge(计算机科学与技术系,剑桥大学) Harvard University(哈佛大学)

专题命中 评测与基准 :foundation model(title);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了多模态基础模型在幸福感评估中的公平性问题,通过可解释性干预框架改善诊断可靠性与公平性,发现不同模型在不同数据集上表现差异显著,且存在性别和种族偏见。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10029 2026-07-20 cs.CL cs.AI cs.CR 版本更新 84%

Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs

潜在融合越狱:融合有害与无害表征以引出不安全的大语言模型输出

Wenpeng Xing, Bohan Yang, Mohan Li, Chunqiang Hu, Haitao Xu, Ningyu Zhang, Bo Lin, Meng Han

机构 * Bingjiang Institute of Zhejiang University(浙江大学滨江学院) Zhejiang University(浙江大学) Guangzhou University(广州大学) Chongqing University(重庆大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究如何通过白盒干预操纵安全对齐的大语言模型,核心方法是潜在融合越狱(LFJ),通过配对有害与良性表征、优化混合系数等实现,在多个模型和基准上取得高攻击成功率,还设计了对抗训练程序降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16066 2026-07-20 cs.NI cs.AI 新提交 83%

LLM-Powered Agentic AI for 5G/6G Networks: A Tutorial and Survey on Architectures, Protocols, and Standardization

用于5G/6G网络的基于大语言模型的智能体人工智能:架构、协议和标准化教程与综述

Mazene Ameur, Abdelkader Mekrache, Bouziane Brik, Adlen Ksentini

机构 * EURECOM University of Sharjah(谢贾学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究5G/6G网络中基于大语言模型的智能体人工智能,通过分为两部分的教程与综述,形式化5G和6G相关平面,涵盖智能体系统基础,映射其能力到控制面等,识别自主电信面临的开放挑战。

Comments 35 pages, 4 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10024 2026-07-20 cs.CV cs.AI cs.LG 版本更新 82%

LVSum: A Benchmark for Timestamp-Aware Long Video Summarization

LVSum:一个用于时间感知长视频摘要的基准测试

Alkesh Patel, Melis Ozyildirim, Ying-Chang Cheng, Ganesh Nagarajan

机构 * Apple(苹果公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LVSum基准测试,用于评估长视频摘要中时间对齐的性能,通过引入新的评估指标揭示现有MLLM在时间理解上的系统性差距。

Comments 25 pages, 5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏