arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-16 至 2026-04-16 共收录 71 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 71 篇

2604.14034 2026-04-16 cs.SE cs.AI cs.IR 92%

Large Language Models to Enhance Business Process Modeling: Past, Present, and Future Trends

大语言模型增强业务流程建模:过去、现在与未来趋势

João Bettencourt, Sérgio Guerreiro

机构 * INESC-ID

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文综述了利用大语言模型进行自然语言到BPMN流程模型转换的AI方法,分析了从规则基础到LLM架构的转变,指出语义正确性、评估碎片化等挑战,并提出未来研究方向。

Comments 27 pages, 2 images, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11334 2026-04-16 cs.CL 92%

LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models

LaoBench:一种大规模多维老挝语基准测试用于大语言模型

Jian Gao, Richeng Xuan, Zhaolu Kang, Dingshi Liao, Wenxin Huang, Zongmou Huang, Yangdi Xu, Bowen Qin, Zheqi He, Xi Yang, Changjin Li, Yonghua Lin

机构 * China-ASEAN Information Harbor Co., Ltd.(中国-东盟信息港有限公司) Beijing Academy of Artificial Intelligence(北京人工智能研究院) School of Software & Microelectronics, Peking University(北京大学软件与微电子学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出LaoBench,首个大规模多维老挝语基准测试,包含17000+样本,涵盖文化知识应用、K12教育和双语翻译,评估LLM在老挝语的理解与推理能力,发现多语言模型在文化推理和翻译准确性上仍落后于人类专家。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13041 2026-04-16 cs.DB cs.AI 92%

TableNet A Large-Scale Table Dataset with LLM-Powered Autonomous

TableNet:一个大规模表格数据集与LLM驱动的自主系统

Ruilin Zhang, Kai Yang

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TableNet通过LLM驱动的自主系统生成和识别表格,解决大规模高质量表格数据集的不足,提升表格结构识别的效率与精度。

Comments The 40th Annual AAAI Conference on Artificial Intelligence Bridge Program on Logic & AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03610 2026-04-16 cs.AI 92%

Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games

Orak:面向多样化视频游戏的LLM代理训练与评估基础基准

Dongmin Park, Minkyu Kim, Beongjun Choi, Junhyuck Kim, Keon Lee, Jonghyun Lee, Inkyu Park, Byeong-Uk Lee, Jaeyoung Hwang, Jaewoo Ahn, Ameya S. Mahabaleshwarkar, Bilal Kartal, Pritam Biswas, Yoshi Suhara, Kangwook Lee, Jaewoong Cho

机构 * KRAFTON Seoul National University(首尔国立大学) NVIDIA University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Ludo Robotics

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Orak通过12种主流视频游戏构建基础基准,系统评估LLM代理在不同游戏场景中的能力,提供统一评估框架和细调数据集,推动多样化游戏代理发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05096 2026-04-16 cs.CL 91%

RAG or Learning? Understanding the Limits of LLM Adaptation under Continuous Knowledge Drift in the Real World

RAG还是学习?在现实世界中连续知识漂移下理解LLM适应的极限

Hanbing Liu, Lang Cao, Yang Li

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) School of Artificial Intelligence, Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)人工智能学院) Shenzhen Key Laboratory of Ubiquitous Data Enabling, Tsinghua Shenzhen International Graduate School, Tsinghua University(深圳 ubiquitous 数据赋能重点实验室,清华大学深圳国际研究生院,清华大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出一个现实世界动态事件基准,评估模型在连续知识漂移下的适应能力,揭示现有方法如RAG和学习方法的局限性,并提出时间感知检索基线Chronos以提升时序一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13804 2026-04-16 cs.LG 90%

Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning

角色超越言语:通过强化学习利用角色扮演评估音频大语言模型

Dongjie Fu, Fangming Feng, Xize Cheng, Linjun Li, Zhou Zhao, Tao Jin

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出RoleJudge框架,通过多模态评估系统评估语音与角色的一致性,引入RoleChat数据集并采用多阶段训练和标准对齐强化学习,验证了多维评估框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05452 2026-04-16 cs.CL 90%

LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models

LLMEval-Fair: 一个大规模纵向研究,探讨大型语言模型的稳健与公平评估

Ming Zhang, Yujiong Shen, Jingyi Deng, Yuhui Wang, Huayu Sha, Kexin Tan, Qiyuan Peng, Yue Zhang, Junzhe Wang, Shichun Liu, Yueyuan Huang, Jingqi Tong, Changhao Jiang, Yilong Wu, Zhihao Zhang, Mingqi Wu, Mingxu Chai, Zhiheng Xi, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan NLP Group(复旦大学自然语言处理组)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 LLMEval-Fair通过动态评估框架和抗污染数据整理,揭示了静态基准无法检测的模型性能上限和数据污染问题,提供了更可靠的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23636 2026-04-16 cs.LG cs.AI 90%

FlexGuard: Continuous Risk Scoring for Strictness-Adaptive LLM Content Moderation

FlexGuard: 严格度自适应的连续风险评分用于LLM内容审核

Zhihao Ding, Jinming Li, Ze Lu, Jieming Shi

机构 * The Hong Kong Polytechnic University(香港理工大学) ByteDance(字节跳动)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出FlexGuard,一种基于LLM的连续风险评分系统,通过风险对齐优化提升审核准确性和在不同严格度下的鲁棒性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13528 2026-04-16 eess.AS cs.SD 90%

Few-Shot and Pseudo-Label Guided Speech Quality Evaluation with Large Language Models

基于少量样本和伪标签的语音质量评估方法

Ryandhimas E. Zezario, Dyah A. M. G. Wisnu, Szu-Wei Fu, Sabato Marco Siniscalchi, Hsin-Min Wang, Yu Tsao

机构 * Academia Sinica, National Chengchi University, NVIDIA, University of Palermo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出GatherMOS框架,利用大语言模型作为元评估器整合多种信号进行质量预测,通过零样本和少样本学习展示了其在不同条件下的优越性能。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13241 2026-04-16 cs.CE 89%

Early-Warning Learner Satisfaction Forecasting in MOOCs via Temporal Event Transformers and LLM Text Embeddings

通过时间事件Transformer和LLM文本嵌入在MOOCs中进行学习者满意度预警预测

Anna Kowalczyk, Jakub Kowalski

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出TET-LLM框架,结合时间事件Transformer、LLM嵌入和短文本主题分布,通过早期信号预测学习者满意度,实验表明其在7天预警范围内RMSE为0.82,AUC为0.77。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09819 2026-04-16 cs.LG cs.SY eess.SY 89%

FDM-Bench: A Comprehensive Benchmark for Evaluating Large Language Models in Additive Manufacturing Tasks

FDM-Bench:用于评估大型语言模型在增材制造任务中的综合基准

Ahmadreza Eslaminia, Adrian Jackson, Beitong Tian, Avi Stern, Hallie Gordon, Rajiv Malhotra, Klara Nahrstedt, Chenhui Shao

机构 * Department of Mechanical Science and Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校机械科学与工程系) Coordinated Science Laboratory, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校协调科学实验室) Department of Mechanical and Aerospace Engineering, Rutgers University(罗格斯大学机械与航空航天工程系) Department of Mechanical Engineering, University of Michigan(密歇根大学机械工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出FDM-Bench基准,用于评估大型语言模型在增材制造任务中的能力,通过用户查询和G代码样本评估不同模型的性能,发现闭源模型在检测G代码异常方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13504 2026-04-16 cs.LG cs.AI cs.CL cs.MA cs.RO 89%

Chain of Uncertain Rewards with Large Language Models for Reinforcement Learning

基于大语言模型的强化学习中不确定奖励链

Shentong Mo

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CoUR框架,利用大语言模型优化强化学习中的奖励函数设计,通过不确定性量化和贝叶斯优化提升效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08064 2026-04-16 cs.AI 88%

ImplicitMemBench: Measuring Unconscious Behavioral Adaptation in Large Language Models

ImplicitMemBench: 测量大语言模型中的无意识行为适应

Chonghan Qin, Xiachong Feng, Weitao Ma, Xiaocheng Feng, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出ImplicitMemBench,首个评估大语言模型隐性记忆的系统基准,通过三个认知基础构念测试隐性记忆,揭示模型在自动执行任务中的局限性。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13282 2026-04-16 physics.med-ph 88%

Agentic MR sequence development: leveraging LLMs with MR skills for automatic physics-informed sequence development

代理MR序列开发:利用LLM与MR技能进行自动物理引导的序列开发

Moritz Zaiss, Amr Aly, Jonathan Endres, Tobias Dornstetter, Simon Weinmüller, Andreas Maier

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Agent4MR框架,利用LLM和物理验证报告自动生成并优化PyPulseq序列,减少交互次数,实现高效序列开发。

Comments Word count abstract/body: 223 / 4303

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13298 2026-04-16 cs.CR 87%

Can Agents Secure Hardware? Evaluating Agentic LLM-Driven Obfuscation for IP Protection

代理能保障硬件吗?评估基于大语言模型的代理式硬件网表混淆用于知识产权保护

Sujan Ghimire, Parsa Mirfasihi, Muhtasim Alam Chowdhury, Veeramani Pugazhenthi, Harish Kumar Dharavath, Farshad Firouzi, Rozhin Yasaei, Pratik Satam, Soheil Salehi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于大语言模型的代理式硬件网表混淆框架,通过分阶段任务处理电路分析、综合、验证和攻击评估,验证了其在ISCAS-85基准上的有效性,展示了混淆技术的潜力与局限。

Comments 5 pages, 3 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13413 2026-04-16 cs.LG 85%

Dataset-Level Metrics Attenuate Non-Determinism: A Fine-Grained Non-Determinism Evaluation in Diffusion Language Models

数据层面指标削弱非确定性:扩散语言模型中的细粒度非确定性评估

Zhengyu Fang, Zhimeng Jiang, Huiyuan Chen, Xiaoge Zhang, Tianyi Li, Kaiyu Tang, Xiao Li, Jing Li

机构 * Department of Computer Data Sciences, Case Western Reserve University, Cleveland, USA Department of Computer Science \& Engineering, Texas A\&M University, College Station, USA Department of Biochemistry, Case Western Reserve University, Cleveland, USA Center for RNA Science Therapeutics, Case Western Reserve University, Cleveland, USA Department of Biomedical Engineering, Case Western Reserve University, Cleveland, USA

专题命中 评测与基准 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.LG

AI总结 本文研究了扩散语言模型中非确定性问题,指出数据层面指标限制了对模型行为变化的洞察,并提出基于样本级预测差异的细粒度评估方法,揭示了非确定性在代码生成中的高敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13997 2026-04-16 cs.SE 83%

Learned or Memorized ? Quantifying Memorization Advantage in Code LLMs

学习还是记忆?量化代码大语言模型中的记忆优势

Djiré Albérick Euraste, Kaboré Abdoul Kader, Jordan Samhi, Earl T. Barr, Jacques Klein, Tegawendé F. Bissyandé

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文通过扰动方法量化代码LLM的记忆优势,评估8个开源代码LLM在19个基准测试中的表现,发现任务和模型差异显著,部分基准测试显示低敏感度,挑战了数据泄露的常见担忧。

Comments 12 pages, 12 figures. Accepted at ICSE 2026 (to appear)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06989 2026-04-16 cs.SE 83%

Human-aligned AI Model Cards with Weighted Hierarchy Architecture

面向人类的AI模型卡片与加权层次架构

Pengyue Yang, Haolin Jin, Qingwen Zeng, Jiawen Wen, Harry Rao, Huaming Chen

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出CRAI-MCF框架,通过加权层次架构和量化标准,提升模型评估与比较的严谨性,促进LLM的负责任采用。

Comments 11 pages, 5 figures, 9 tables. Published in FSE Companion 2026

Journal ref In Proceedings of the 34th ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering Companion (FSE Companion '26), Montreal, QC, Canada, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14074 2026-04-16 cs.CV 82%

Training-Free Semantic Multi-Object Tracking with Vision-Language Models

无需训练的语义多目标跟踪与视觉-语言模型

Laurence Bonat, Francesco Tonini, Elisa Ricci, Lorenzo Vaquero

机构 * Department of Information Engineering and Computer Science, University of Trento(信息工程与计算机科学系,特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 评测与基准 :language model(title);LLM(abstract);foundation model(abstract)

AI总结 本文提出TF-SMOT,一种无需训练的语义多目标跟踪方法,结合预训练组件生成时间一致的跟踪片段,并通过InternVideo2.5生成视频摘要和实例描述,同时通过语义检索提升交互识别性能。

Comments Accepted to the 20th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13888 2026-04-16 cs.AI 81%

GeoAgentBench: A Dynamic Execution Benchmark for Tool-Augmented Agents in Spatial Analysis

GeoAgentBench: 一种面向空间分析工具增强代理的动态执行基准

Bo Yu, Cheng Yang, Dongyang Hou, Chengfu Liu, Jiayao Liu, Chi Wang, Zhiming Zhang, Haifeng Li, Wentao Yang

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) School of Earth Sciences and Spatial Information Engineering, Hunan University of Science and Technology(湖南科技大学地球科学与空间信息工程学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出GeoAgentBench,通过动态执行沙盒评估地理信息代理,引入PEA指标和视觉语言模型验证,改进Plan-and-React架构,提升空间分析代理的执行鲁棒性与逻辑严谨性。

Comments 20 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13817 2026-04-16 cs.LG 81%

RPS: Information Elicitation with Reinforcement Prompt Selection

RPS: 通过强化提示选择进行信息获取

Tao Wang, Jingyao Lu, Xibo Wang, Haonan Huang, Su Yao, Zhiqiang Hu, Xingyan Chen, Enmao Diao

机构 * Department of Computer Science, Southwestern University of Finance and Economics(西南财经大学计算机科学学院) China Telecom Corporation Limited(中国电信有限公司) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出RPS框架,通过强化学习实现对话中自适应的信息获取,引入IELegal数据集验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13417 2026-04-16 cs.SE cs.AI 81%

The Cognitive Circuit Breaker: A Systems Engineering Framework for Intrinsic AI Reliability

认知电路断路器:一种用于内在AI可靠性的系统工程框架

Jonathan Pan

机构 * Jonathan Pan

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出认知电路断路器框架,通过提取模型前向传递中的隐藏状态,计算认知不一致度,以实现低延迟的内在可靠性监控,同时展示其在分布外泛化中的有效性。

Comments 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13064 2026-04-16 cs.CL cs.CY 81%

Red Skills or Blue Skills? A Dive Into Skills Published on ClawHub

红技能还是蓝技能?深入探讨ClawHub上的技能

Haichuan Hu, Ye Shang, Quanjun Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanjing University(南京大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究ClawHub上的技能生态系统,分析语言分布、功能组织及安全性,发现英语技能更偏向技术能力,而中文技能更侧重应用场景,且超过30%的技能被标记为可疑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23682 2026-04-16 cs.HC cs.AI 81%

Assessment Design in the AI Era: A Method for Identifying Items Functioning Differentially for Humans and Chatbots

人工智能时代评估设计:一种识别人类与聊天机器人系统存在系统性反应差异的 方法

Licol Zeinfeld, Alona Strugatski, Ziva Bar-Dov, Ron Blonder, Shelley Rap, Giora Alexandron

机构 * Weizmann Institute of Science(魏茨曼科学研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种结合教育数据挖掘与心理测量理论的方法,用于识别人类与AI在评估项目上的系统性差异,以改进评估设计的公平性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21823 2026-04-16 cs.AI 81%

ProRe: A Proactive Reward System for GUI Agents via Reasoner-Actor Collaboration

ProRe:通过推理器-执行器协作的GUI代理前瞻性奖励系统

Gaole Dai, Shiqi Jiang, Ting Cao, Yuqing Yang, Yuanchun Li, Rui Tan, Mo Li, Lili Qiu

机构 * NTU(国立新加坡大学) Microsoft Research(微软研究院) Tsinghua University(清华大学) HKUST(香港理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ProRe通过推理器与领域特定评估器协作,提升GUI代理奖励准确性与F1分数,实验显示奖励准确性和F1分数提升达5.3%和19.4%。

Comments 23 pages, 12 figures, ICLR'2026

Journal ref The Fourteenth International Conference on Learning Representations, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11748 2026-04-16 cs.CL cs.LG 81%

LangFlow: Continuous Diffusion Rivals Discrete in Language Modeling

LangFlow: 连续扩散在语言建模中与离散模型相媲美

Yuxin Chen, Chumeng Liang, Hangke Sui, Ruihan Guo, Chaoran Cheng, Jiaxuan You, Ge Liu

机构 * UIUC(伊利诺伊大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 LangFlow通过连接嵌入空间DLM与流匹配的Bregman散度,提出三种创新方法,实现了连续扩散在语言建模中的突破,达到与离散模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13069 2026-04-16 cs.CY 80%

Geographic Blind Spots in AI Control Monitors: A Cross-National Audit of Claude Opus 4.6

AI控制监控中的地理盲区:对Claude Opus 4.6的跨国审计

Jason Hung

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文通过跨国审计揭示Claude Opus 4.6在地理知识上的缺陷,发现其对全球北半球查询的伪造率高于南半球,揭示了模型在部分知识机制下的漏洞。

Comments 21 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12400 2026-04-16 cs.NI 80%

Agentic AI for 6G: A New Paradigm for Autonomous RAN Security Compliance

面向6G的代理AI:自主RAN安全合规的新范式

Sotiris Chatzimiltis, Mahdi Boloursaz Mashhadi, Mohammad Shojafar, Merouane Debbah, Rahim Tafazolli

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文提出利用基于LLM的AI代理与RAG流程框架,实现RAN安全合规的智能自主执行,通过案例研究展示其在O-RAN联盟和3GPP标准合规性评估中的应用,并探讨模型幻觉、供应商不一致等挑战及未来发展方向。

Comments Accepted at IEEE Communications Standards Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07043 2026-04-16 cond-mat.mtrl-sci 80%

Uni2D: A Universal Machine Learning Interatomic Potential for Two-Dimensional Materials

Uni2D:一种适用于二维材料的通用机器学习交互势能模型

Haidi Wang, Yufan Yao, Haonan Song, Huimiao Wang, Xiaofeng Liu, Zhao Chen, Weiwei Chen, Weiduo Zhu, Zhongjun Li, Jinlong Yang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Uni2D,一种针对二维材料设计的交互势能模型,通过大规模数据训练实现了对能量、力和应力的可靠预测,支持高通量筛选和计算探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13803 2026-04-16 cs.CV cs.AI 79%

Gaslight, Gatekeep, V1-V3: Early Visual Cortex Alignment Shields Vision-Language Models from Sycophantic Manipulation

Gaslight, Gatekeep, V1-V3: 早期视觉皮层对齐保护视觉语言模型免受阿谀操控

Arya Shah, Vaibhav Tripathi, Mayank Singh, Chaklam Silpasuwanchai

机构 * Indian Institute of Technology Gandhinagar(印度理工学院加尔各答分校) Asian Institute of Technology(亚洲理工学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文研究了视觉语言模型在高风险场景中的脆弱性,通过评估12种模型的脑部对齐和顺从性,发现早期视觉皮层对齐能有效降低模型对阿谀操控的敏感性。

Comments 28 pages, 9 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏