arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-04 至 2026-06-04 共收录 63 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 63 篇

2603.23841 2026-06-04 cs.CL cs.AI 93%

PoliticsBench: Benchmarking Political Values in Large Language Models with Multi-Turn Roleplay

PoliticsBench: 通过多轮角色扮演基准测试大型语言模型中的政治价值观

Rohan Khetan, Ashna Khetan

机构 * Northville High School, Northville, USA(北维尅高中) Department of Computer Science, Stanford University, Stanford, USA(斯坦福大学计算机科学系)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 提出PoliticsBench,一个多阶段角色扮演基准,通过20个演化场景评估LLM的细粒度价值表达,发现场景提示比直接提问能引发更广泛和强烈的价值表达。

Comments 7 pages, 5 tables, 5 figures, 4 appendix pages. Accepted to the ICML 2026 Trustworthy AI for Good Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04924 2026-06-04 cs.CL 92%

Can Crowdsourcing Survive the LLM Era? A Community Survey on Human Data Collection

众包能否在LLM时代幸存?关于人类数据收集的社区调查

Aswathy Velutharambath, Neele Falk, Sofie Labat, Tarun Tater, Amelie Wuehrl

机构 * University of Stuttgart(斯图加特大学) Ghent University(根特大学) Harvard University(哈佛大学) IT University of Copenhagen(哥本哈根技术大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过调查155名NLP及相关领域研究者,探讨LLM对众包数据有效性的挑战、检测策略及应对措施,发现44%的受访者观察到LLM使用,但现有努力仍不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23694 2026-06-04 cs.AI cs.CL cs.CR 91%

SafeSearch: Automated Red-Teaming of LLM-Based Search Agents

SafeSearch: 基于LLM的搜索代理的自动化红队测试

Jianshuo Dong, Sheng Guo, Hao Wang, Xun Chen, Zhuotao Liu, Tianwei Zhang, Ke Xu, Minlie Huang, Han Qiu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出SafeSearch自动化红队框架,系统评估基于LLM的搜索代理在五个风险类别中的安全性,发现GPT-4.1-mini在搜索工作流中攻击成功率高达90.5%,且常见防御措施效果有限。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22396 2026-06-04 cs.CL cs.AI cs.CY cs.HC physics.soc-ph 91%

Culturally Grounded Personas in Large Language Models: Characterization and Alignment with Socio-Psychological Value Frameworks

大型语言模型中的文化基础人物角色:与社会心理价值框架的表征与对齐

Candida M. Greco, Lucio La Cava, Andrea Tagarelli

机构 * DIMES, University of Calabria, Italy(意大利卡拉布里亚大学DIMES研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究通过世界价值观调查、英格尔哈特-韦尔策尔文化地图和道德基础理论,评估大型语言模型生成的文化基础人物角色是否准确反映不同文化条件下的世界和道德价值体系,并分析其跨文化结构和道德变异。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04202 2026-06-04 cs.AI 90%

SMAC-Talk: A Natural Language Extension of the StarCraft Multi-Agent Challenge for Large Language Models

SMAC-Talk: 面向大型语言模型的星际争霸多智能体挑战的自然语言扩展

Joel Sol, Homayoun Najjaran

机构 * Faculty of Engineering and Computer Science(工程与计算机科学学院) University of Victoria(维多利亚大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 提出SMAC-Talk环境,通过自然语言通信通道评估LLM智能体在合作多智能体场景中的协调与信任,并构建含欺骗性通信者的评估场景。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03660 2026-06-04 cs.AI 90%

From Answers to States: Verifiable Process-Level Evaluation of Chemical Reasoning in Large Language Models

从答案到状态:大语言模型中化学推理的可验证过程级评估

Hongyu Guo, Hao Li, He Cao, Gongbo Zhang, Li Yuan

机构 * Peking University, Shenzhen Graduate School(北京大学深圳研究生院) International Digital Economy Academy (IDEA)(国际数字经济学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出ChemCoTBench-V2基准,通过确定性规则和参考轨迹验证结构化化学推理步骤,揭示模型在最终答案正确性与推理状态一致性之间的差距。

Comments 23 pages, 6 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04296 2026-06-04 cs.AI 90%

The Saturation Trap and the Subjectivity of Intervention Timing: Why Affect-Based Triggers and LLM Judges Fail to Time Interventions on Autonomous Agents

饱和陷阱与干预时机的主观性:为什么基于情感的触发器和LLM评判者无法在自主智能体上把握干预时机

Manvendra Modgil

机构 * manvendramodgil.ai

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究通过18维情感动力学引擎HEART诊断自主智能体干预时机问题,发现状态饱和陷阱、LLM评判者的能力与上下文门槛,以及人类标注者之间极低的干预时机一致性,表明干预时机是一个低可靠性构念。

Comments 11 pages, 5 tables. Code and data:https://github.com/2025eb1100268-tech/intervention-timing-saturation-trap

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30995 2026-06-04 cs.CY cs.CL 90%

Traceable by Design: An LLM Pipeline and Dashboard for EU Regulatory Consultation Analysis

可追溯性设计:用于欧盟监管咨询分析的LLM流程与仪表板

Thales Bertaglia, Haoyang Gui, Catalina Goanta, Gerasimos Spanakis

机构 * Utrecht University(乌特勒支大学) Maastricht University(马斯特里赫特大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出基于LLM的端到端流程与交互式仪表板,从监管咨询提交中提取结构化主题,确保逐字引用、完全可追溯和透明性,并以欧盟数字公平法案为例验证。

Comments This research has been supported by funding from the ERC Starting Grant HUMANads (ERC-2021-StG No 101041824)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15118 2026-06-04 cs.CR cs.CL 90%

Talk is (Not) Cheap: A Taxonomy and Benchmark Coverage Audit for LLM Attacks

谈话(不)廉价:LLM攻击的分类法与基准覆盖审计

Karthik Raghu Iyer, Yazdan Jamshidi, Nicholas Bray, Alexey A. Shvets

机构 * Palo Alto Networks(帕洛阿尔托网络)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出一个基于STRIDE的4×6目标×技术矩阵框架,用于审计LLM攻击基准的集体覆盖,发现现有基准仅覆盖最多25%的威胁面,且存在命名碎片化和评估空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05001 2026-06-04 cs.SE 89%

TeleSWEBench: A Commit-Driven Benchmark for Evaluating LLM-Powered Software Engineering in Telecommunications

TeleSWEBench:一个面向电信领域评估基于LLM的软件工程的提交驱动基准

Pranshav Gajjar, Ali Mamaghani, Dinesh Bharadia, Vijay K Shah

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出TeleSWEBench,首个面向电信领域的提交驱动基准,通过从srsRAN 5G仓库挖掘真实提交并构建734个可执行测试用例,结合分层LLM评判框架TeleJudge,评估ASE工具在电信软件工程中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05003 2026-06-04 cs.HC 88%

PhysDox: Benchmarking LLMs on Physical Feasibility Auditing of Physiological Sensing Protocols

PhysDox: 对生理传感协议的物理可行性审计进行LLM基准测试

He Liu, Boyuan Gu, Shuaiqi Cheng, Haiyang Sun, Siyu You, Xuming Hu

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 提出PhysDox基准,通过两阶段评估(严重性检测和约束级诊断)测试LLM对生物医学协议物理可行性的审计能力,发现模型存在支架偏差和隐式约束高漏检率等问题。

Comments 31 Pages,7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05122 2026-06-04 cs.CL 86%

Self-Evaluation Is Already There: Eliciting Latent Judge Calibration in Base LLMs with Minimal Data

自我评估已然存在:用最少数据激发基础LLM中的潜在评判校准

XiuYu Zhang, Yi Shan, Junfeng Fang, Zhenkai Liang

机构 * National University of Singapore(新加坡国立大学) Beijing University of Technology(北京理工大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出自我评估激发(SEE)方法,通过少量数据(160个示例)结合校准耦合强化学习和掩码蒸馏,激发基础LLM中已有的预测外部评判者评分能力,在保持答案质量的同时显著提升校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04867 2026-06-04 cs.AI 86%

AICompanionBench: Benchmarking LLMs-as-Judges for AI Companion Safety

AICompanionBench: 以LLM为评判标准的AI伴侣安全基准测试

Yanjing Ren, Reza Ebrahimi, TengTeng Ma

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本文提出AICompanionBench,首个公开的细粒度安全风险标注的人机伴侣对话基准数据集,并评估20个LLM在检测不安全交互中的表现,发现强模型在显式有害内容上准确率高,但难以识别隐式不安全交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04483 2026-06-04 cs.CL 86%

Off-Distribution Voices: Fanfiction Subgenres as Universal Vernacular Jailbreaks for Aligned LLMs

分布外声音:同人小说子类型作为对齐LLM的通用白话越狱

Zhongze Luo, Ruihe Shi, Zhenshuai Yin, Haoyue Liu, Weixuan Wan, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院) The Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来网络智能研究院) The Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能重点实验室) School of Microelectronics, Xi’an Jiaotong University(西安交通大学微电子学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 本文发现安全训练覆盖不足的自然人类写作语域是对齐LLM的真正失败模式,并提出首个利用真实同人小说子类型作为通用攻击载体的越狱方法,显著提升攻击成功率。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04231 2026-06-04 cs.CL cs.AI 85%

MM-BizRAG: Rethinking Multimodal Retrieval-Augmented Generation for General Purpose Enterprise Q&A

MM-BizRAG:面向通用企业问答的多模态检索增强生成再思考

Hanoz Bhathena, Parin Rajesh Jhaveri, Rohan Mittal, Prateek Singh, Aymen Kallala, Rachneet Kaur, Yiqiao Jin, Zhen Zeng, Adwait Ratnaparkhi, Denis Kochedykov

机构 * JPMorgan Chase & Co.(摩根大通公司) Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出MM-BizRAG框架,通过文档结构感知分割和布局感知解析,结合统一LLM驱动的工件转换与推理时多模态组装,无需微调即可提升企业文档问答性能,在异构企业数据集和两个公开基准上超越基线最多32个百分点。

Comments Accepted at ACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05085 2026-06-04 cs.CL cs.AI 84%

Automatic Generation of Titles for Research Papers Using Language Models

使用语言模型自动生成研究论文标题

Tohida Rehman, Debarshi Kumar Sanyal, Samiran Chattopadhyay

机构 * Jadavpur University(贾达沃尔大学) Indian Association for the Cultivation of Science(印度科学培养协会)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 提出利用预训练语言模型和大语言模型从摘要生成论文标题的方法,通过微调PEGASUS-large在多个数据集上取得最优性能。

Comments 24 pages, 24 tables, 01 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09081 2026-06-04 cs.LG cs.AI 84%

FactoryNet: A Large-Scale Dataset toward Industrial Time-Series Foundation Models

FactoryNet:面向工业时间序列基础模型的大规模数据集

Karim Othman, Jonas Petersen, Matei Ignuta-Ciuncanu, Camilla Mazzoleni, Federico Martelli, Alessandro Lombardi, Riccardo Maggioni, Philipp Petersen

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出首个工业时间序列通用预训练语料库FactoryNet,通过统一模式实现跨实体零样本迁移和高效异常检测。

Comments Accepted at AI4Physics and FMSD, ICML 2026. Code: https://github.com/Forgis-Labs/FactoryNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04010 2026-06-04 q-bio.NC cs.AI 83%

The Variance Brain Foundation Models Forgot: Third-Order Statistics Predict Cognition Where Billion-Parameter Models Fail

大脑基础模型遗忘的方差:三阶统计在十亿参数模型失败时预测认知

Giovanni Marraffini, Gabriel Mahuas, Trinidad Borrell, Victoria Shevchenko, Demian Wassermann

机构 * Inria Saclay Île-de-France, CEA, Université Paris-Saclay, Palaiseau, France(法国巴黎萨克雷大学Inria萨克雷研究中心、CEA、巴黎萨克雷大学、帕莱索分校) Sigma Nova Sorbonne Université, Institut du Cerveau - Paris Brain Institute - ICM(索邦大学、巴黎脑研究所-巴黎脑研究所-ICM) Forschungszentrum Jülich(茹里希研究中心)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 研究发现,大脑基础模型(BFMs)的预训练主要捕获了fMRI信号中的方差成分,但忽略了预测认知的高阶结构,而基于三阶协偏度张量的线性管道无需预训练即可超越现有BFMs。

Comments 37 pages, 16 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04507 2026-06-04 cs.CL cs.AI 82%

Self-Evolving Deep Research via Joint Generation and Evaluation

通过联合生成与评估实现自我进化的深度研究

Han Zhu, Chengkun Cai, Yuanfeng Song, Xing Chen, Sirui Han, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) ByteDance, China(字节跳动) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SCORE框架,通过共享参数的协同进化训练联合优化评估器与求解器,解决深度研究报告生成中奖励不可验证的问题,持续提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04095 2026-06-04 cs.CL cs.AI 82%

POLARIS: Guiding Small Models to Write Long Stories

POLARIS:引导小模型撰写长篇小说

Rishanth Rajendhran, Jenna Russell, Mohit Iyyer, John Frederick Wieting

机构 * University of Maryland(马里兰大学) Google(谷歌) DeepMind(深Mind)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出POLARIS训练方法,结合LLM裁判奖励和人类参考注入,使9B小模型在长故事写作中达到与27B模型相当的质量,并展现出长度泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04300 2026-06-04 cs.IR 82%

Argus-Retriever: Vision-LLM Late-Interaction Retrieval with Region-Aware Query-Conditioned MoE for Visual Document Retrieval

Argus-Retriever: 基于区域感知查询条件混合专家模型的视觉-大语言模型后期交互检索用于视觉文档检索

Abdelrahman Abdallah, Mahmoud Abdalla, Mohammed Ali, Adam Jatowt

专题命中 评测与基准 :LLM(title,abstract)

AI总结 提出Argus系列查询条件后期交互检索器,通过区域感知混合专家模块使文档表示依赖查询,在ViDoRe基准上以更低维度和更少训练数据取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04769 2026-06-04 cs.CR cs.AI cs.SE 81%

Description-Code Inconsistency in Real-world MCP Servers: Measurement, Detection, and Security Implications

现实世界 MCP 服务器中的描述-代码不一致性:测量、检测与安全影响

Yutao Shi, Xiaohan Zhang, Xiangjing Zhang, Xihua Shen, Hui Ouyang, Huming Qiu, Mi Zhang, Min Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对 MCP 服务器中工具描述与代码实现不一致的问题,提出结合结构感知静态分析与 Direct-Reverse-Arbitration 提示方法的自动检测框架 DCIChecker,并在大规模数据集上揭示 9.93% 的不一致率及其安全风险。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04599 2026-06-04 cs.AI cs.CE 81%

Plan First, Judge Later, Run Better: A DMAIC-Inspired Agentic System for Industrial Anomaly Detection

先计划,后评判,更优运行:一种受DMAIC启发的工业异常检测智能体系统

Yongzi Yu, Ao Li, Le Wang, Ziyue Li, Fugee Tsung, Yuxuan Liang, Man Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Shanghai University of Finance and Economics(上海财经大学) Technische Universität München(慕尼黑技术大学) Southwestern University of Finance and Economics(西南财经大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出受DMAIC启发的多智能体系统DMAIC-IAD,通过先制定标准化操作程序(SOP)再生成策略,并引入预训练的无执行评判模型来排序候选策略,无需昂贵运行时试验,在四种模态上平均检测性能提升37.76%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18134 2026-06-04 cs.LG cs.CC cs.PL cs.SE 81%

Learning Randomized Reductions

学习随机归约

Ferhat Erata, Orr Paradise, Thanos Typaldos, Timos Antonopoulos, ThanhVu Nguyen, Shafi Goldwasser, Ruzica Piskac

机构 * Yale University, USA(耶鲁大学) EPFL, Switzerland(瑞士联邦理工学院) George Mason University, USA(乔治·梅onn大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 提出 Bitween 框架自动学习随机自归约(RSR),通过线性回归、遗传编程等后端和 LLM 代理,在 80 个函数中分别发现 54% 和 80% 的 RSR,包括首个 sigmoid 归约。

Comments Accepted at ICML 2026 (Spotlight). 9 pages main text + appendix

Journal ref Proceedings of the 43rd International Conference on Machine Learning, PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03373 2026-06-04 cs.CL 81%

WETBench: A Benchmark for Detecting Task-Specific Machine-Generated Text on Wikipedia

WETBench:用于检测维基百科上特定任务机器生成文本的基准

Gerrit Quaremba, Elizabeth Black, Denny Vrandečić, Elena Simperl

机构 * King’s College London(伦敦国王学院) Wikimedia Foundation(维基媒体基金会)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出WETBench,一个多语言、多生成器、任务特定的基准,用于检测维基百科编辑场景下的机器生成文本,实验表明训练型检测器平均准确率78%,零样本检测器平均58%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04438 2026-06-04 cs.LG cs.AI 81%

LoopMoE: Unifying Iterative Computation with Mixture-of-Experts for Language Modeling

LoopMoE:统一迭代计算与混合专家模型用于语言建模

Wenkai Chen, Tianshu Li, Wenyong Huang, Yichun Yin, Lifeng Shang, Chengwei Qin

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Huawei Technologies Co.,Ltd.(华为技术有限公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出LoopMoE,通过迭代自适应层归一化和容量平衡策略,在相同参数和FLOPs下,循环MoE语言模型在多个基准上优于标准MoE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12433 2026-06-04 cs.CV cs.AI cs.LG 81%

Revisiting Model Stitching In the Foundation Model Era

重新审视基础模型时代的模型拼接

Zheda Mai, Ke Zhang, Fu-En Wang, Zixiao Ken Wang, Albert Y. C. Chen, Lu Xia, Min Sun, Wei-Lun Chao, Cheng-Hao Kuo

机构 * The Ohio State University(俄亥俄州立大学) Boston University(波士顿大学) Amazon(亚马逊)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过系统协议研究视觉基础模型(如CLIP、DINOv2、SigLIP 2)的可拼接性,提出基于目标模型倒数第二层特征匹配损失的拼接方法,并构建VFM拼接树(VST)实现多模态大模型中多个VFM的准确率-延迟权衡。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04580 2026-06-04 cs.CR 80%

TIBlender: Early-Warning Threat Intelligence from Cross-Platform Social Media Evidence

TIBlender:来自跨平台社交媒体证据的早期预警威胁情报

Hiroki Nakano, Takashi Koide, Daiki Chiba

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出多智能体系统TIBlender,通过角色专业化LLM代理整合四个社交媒体平台的威胁信号,生成结构化威胁情报报告,在真实部署中提前检测到所有四类威胁,且大多数IoC未被现有情报源覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05161 2026-06-04 cs.SD cs.CL 79%

Beyond Text Following: Repairable Arbitration Reversals in Audio-Language Models

超越文本跟随:音频-语言模型中的可修复仲裁反转

Yichen Gao, Yiqun Zhang, Zijing Wang, Yujia Li, Heng Guo, Xi Wu, Xiaocui Yang, Shi Feng, Yifei Zhang, Daling Wang

机构 * Northeastern University, China(东北大学) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文通过同音频反事实实验发现,音频-语言模型在冲突任务中常因文本主导而忽略音频证据,并提出无训练解码规则GACL,通过插值联合分数与同音频分数来修复仲裁反转,显著提升忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05087 2026-06-04 cs.CL 79%

Light or Full Verb? A Minimal-Pair Dataset for Probing Phraseological Competence in Language Models

轻动词还是实义动词?用于探究语言模型短语能力的极小对比数据集

Francesca Franzon, Nicolas Rosàs Gómez, Leo Wanner

机构 * Universitat Pompeu Fabra (UPF)(庞培法布拉大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 通过构建极小对比数据集,探究语言模型在轻动词与实义动词用法上的区分能力,发现模型能在最小上下文中区分这两种用法,并表现出跨宾语类型的可分离模式。

详情

展开后加载摘要…

URL PDF HTML 收藏