arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-15 至 2026-05-15 共收录 348 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 61 篇

2605.14192 2026-05-15 cs.CL cs.AI 73%

Why Retrieval-Augmented Generation Fails: A Graph Perspective

为何检索增强生成失败:一种图视角

Kai Guo, Xinnan Dai, Zhibo Zhang, Nuohan Lin, Shenglai Zeng, Jie Ren, Haoyu Han, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文从图视角分析检索增强生成失败原因,发现正确回答具有更深层推理路径和更分布的证据流,而失败回答则表现出碎片化和集中化的证据流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03814 2026-05-15 cs.AI cs.LG 73%

Conformal Thinking: Risk Control for Reasoning on a Compute Budget

conformal thinking: 用于计算预算上的推理风险控制

Xi Wang, Anushri Suresh, Alvin Zhang, Rishi More, William Jurayj, Benjamin Van Durme, Mehrdad Farajtabar, Daniel Khashabi, Eric Nalisnick

机构 * Johns Hopkins University, Baltimore, Maryland, USA(约翰霍普金斯大学,巴尔的摩,马里兰州,美国) Apple, USA(苹果公司,美国)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种风险控制框架,通过设置上界和下界阈值来优化计算预算,提升推理效率并降低错误率。

Comments ICMl 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14704 2026-05-15 cs.CV cs.AI cs.RO 70%

SceneFunRI: Reasoning the Invisible for Task-Driven Functional Object Localization

SceneFunRI:为任务驱动的功能物体定位推理不可见区域

Posheng Chen, Powen Cheng, Gueter Josmy Faure, Hung-Ting Su, Winston H. Hsu

机构 * National Taiwan University(国立台湾大学) Delta Robotics Innovation Center(Delta机器人创新中心)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 SceneFunRI通过半自动化流程构建了855个实例的基准,要求模型根据任务指令和常识推理推断不可见功能物体的位置,现有模型在推理稳定性上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14539 2026-05-15 cs.CL 70%

Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards

从失败中学习:具有可验证奖励的纠正导向策略优化

Mengjie Ren, Jie Lou, Boxi Cao, Xueru Wen, Hongyu Lin, Xianpei Han, Le Sun, Xing Yu, Yaojie Lu

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Xiaohongshu Inc(小红书公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CIPO方法,通过将失败轨迹转化为纠正监督,提升大语言模型的推理和纠错能力,在11个基准测试中优于基线方法。

Comments Work on progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08888 2026-05-15 cs.CL cs.CV 70%

DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding

DocScope:可验证推理的可信长文档理解基准测试

Xiang Feng, Jiawei Zhou, Zhangfeng Huang, Kewei Wang, Shanshan Ye, Jinxin Hu, Zulong Chen, Yong Luo, Jing Zhang

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, China(计算机学院,国家多媒体软件工程技术研究中心和湖北多媒体与网络通信工程重点实验室,武汉大学,中国) Alibaba Group, Hangzhou, China(阿里巴巴集团,杭州,中国) Independent Researcher(独立研究者) Department of Machine Learning, Mohamed bin Zayed University of Artificial Intelligence, United Arab Emirates(机器学习系,Mohamed bin Zayed人工智能大学,阿拉伯联合酋长国)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DocScope通过结构化推理轨迹预测方法评估多模态大语言模型在长文档中的可验证推理能力,发现答案准确度无法替代轨迹级评估,且区域定位仍是薄弱环节。

Comments 50pages, 25 figures, 14 tables;

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07045 2026-05-15 cs.CV cs.AI 70%

VLRS-Bench: A Vision-Language Reasoning Benchmark for Remote Sensing

VLRS-Bench: 一种面向遥感的视觉-语言推理基准

Zhiming Luo, Di Wang, Haonan Guo, Jing Zhang, Bo Du

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出VLRS-Bench,首个专注于复杂遥感推理的基准,包含2000个问题-答案对,涵盖14项任务和八个时间阶段,揭示现有MLLM在遥感任务中的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07461 2026-05-15 cs.CL 70%

Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning

原生并行推理器:通过自我蒸馏强化学习实现并行推理

Tong Wu, Yang Liu, Jun Bai, Zixia Jia, Shuyi Zhang, Ziyong Lin, Yanting Wang, Song-Chun Zhu, Zilong Zheng

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Native Parallel Reasoner,一种无需教师的框架,使大语言模型能够自我进化真正的并行推理能力。通过三个创新,NPR将模型从顺序模拟转变为原生并行认知,提升了推理性能和推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07738 2026-05-15 cs.CL 70%

Automated Construction of a Knowledge Graph of Nuclear Fusion Energy for Effective Elicitation and Retrieval of Information

自动化构建核聚变能源知识图谱以实现信息的有效提取与检索

Andrea Loreti, Kesi Chen, Ruby George, Robert Firth, Adriano Agnello, Shinnosuke Tanaka

机构 * UK Atomic Energy Authority, Culham Campus(英国原子能管理局,库尔汉校区) STFC Hartree Centre(STFC哈特里中心) Sci-Tech Daresbury(科技达尔斯伯里) IBM Research(IBM研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出多步骤自动化构建知识图谱的方法,用于组织和表示大型文档语料中的领域知识。通过构建首个核聚变能源知识图谱,验证了自动命名实体识别和实体解析等关键功能,并评估了预训练大语言模型在处理挑战时的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14908 2026-05-15 cs.CV 67%

SteerSeg: Attention Steering for Reasoning Video Segmentation

SteerSeg: 基于注意力引导的视频分割

Ali Cheraghian, Hamidreza Dastmalchi, Abdelwahed Khamis, Morteza Saberi, Aijun An, Lars Petersson

机构 * Macquarie University(麦考瑞大学) York University(约克大学) CSIRO Data61(CSIRO数据61) UTS(UTS大学)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract)

AI总结 SteerSeg通过输入级条件引导解决注意力对齐问题,结合可学习软提示和推理引导的CoT提示,提升视频分割的时空定位能力。

Comments Project page: https://steerseg.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14795 2026-05-15 cs.CV 67%

COAL: Counterfactual and Observation-Enhanced Alignment Learning for Discriminative Referring Multi-Object Tracking

COAL: 基于反事实和观察增强的对齐学习用于判别性参照多目标跟踪

Shukun Jia, Shiyu Hu, Yipei Wang, Ximeng Cheng, Yichao Cao, Xiaobo Lu

机构 * School of Automation, Southeast University, Nanjing, China(东南大学自动化学院,南京,中国) Key Laboratory of Measurement and Control of Complex Systems of Engineering, Ministry of Education, Nanjing, China(工程复杂系统测量与控制国家重点实验室,教育部,南京,中国) School of Physical & Mathematical Sciences, Nanyang Technological University, Singapore(南洋理工大学物理与数学科学学院,新加坡) Big Data Institute, Central South University, Changsha, China(中南大学大数据研究院,长沙,中国)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 COAL通过知识正则化解决RMOT中高判别性需求与稀疏语义监督的矛盾,引入显式语义注入和反事实学习提升多目标跟踪的判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14742 2026-05-15 cs.CV cs.RO 67%

EARL: Towards a Unified Analysis-Guided Reinforcement Learning Framework for Egocentric Interaction Reasoning and Pixel Grounding

EARL:一种统一的分析引导强化学习框架,用于第一人称交互推理与像素定位

Yuejiao Su, Xinshen Zhang, Zhen Ye, Lei Yao, Lap-Pui Chau, Yi Wang

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学电子与电气工程系) Division of Emerging Interdisciplinary Areas (EMIA), The Hong Kong University of Science and Technology, Hong Kong SAR(香港理工大学新兴跨学科领域研究中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出EARL框架,通过分析引导特征合成器提升第一人称交互推理与像素定位的准确性,实验显示在Ego-IRGBench上像素定位达到65.48% cIoU,优于现有方法。

Comments Accepted at ICML 2026. Project page: https://github.com/yuggiehk/EARL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14696 2026-05-15 cs.CV 67%

EponaV2: Driving World Model with Comprehensive Future Reasoning

EponaV2:通过全面的未来推理驱动世界模型

Jiawei Xu, Zhizhou Zhong, Zhijian Shu, Mingkai Jia, Mingxiao Li, Jia-Wang Bian, Qian Zhang, Kaicheng Zhang, Jin Xie, Jian Yang, Wei Yin

机构 * PCA Lab, VCIP, College of Computer Science, Nankai University(PCA实验室、VCIP、计算机科学学院、南开大学) Horizon Robotics HKUST(香港科技大学) NJUPT(南京工程大学) NTU(国立台湾大学) Anyverse School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院、南京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出EponaV2,一种新的驾驶世界模型范式,通过全面的未来推理实现高质量规划。模型通过预测更全面的未来表示,结合3D和语义模态,提升环境理解与现实推理能力,从而改进轨迹规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14403 2026-05-15 cs.CV 67%

DermAgent: A Self-Reflective Agentic System for Dermatological Image Analysis with Multi-Tool Reasoning and Traceable Decision-Making

DermAgent: 一种用于皮肤病图像分析的自反思代理系统,具备多工具推理和可追溯决策制定

Yize Liu, Siyuan Yan, Ming Hu, Lie Ju, Xieji Li, Feilong Tang, Wei Feng, Zongyuan Ge

机构 * AIM for Health Lab, Faculty of Information Technology, Monash University, Melbourne, Australia(健康人工智能实验室,信息科技学院,墨尔本大学,澳大利亚) Faculty of Information Technology, Monash University, Melbourne, Australia(信息科技学院,墨尔本大学,澳大利亚) University College London, Institute of Ophthalmology, London, United Kingdom(伦敦大学学院,眼科研究所,英国)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 DermAgent通过多工具协作和反思框架,在皮肤病图像分析中实现可追溯的诊断推理,优于现有模型。

Comments MICCAI2026 early acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14393 2026-05-15 cs.CV 67%

Analogical Trajectory Transfer

类比轨迹迁移

Junho Kim, Eun Sun Lee, Gwangtak Bae, Seunggu Kang, Young Min Kim

机构 * Dept. of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) Interdisciplinary Program in Artificial Intelligence and INMC, Seoul National University(人工智能交叉计划和INMC,首尔国立大学)

专题命中 推理与问题求解 :LLM(abstract_cn);foundation model(abstract)

AI总结 本文提出通过分解空间子问题实现类比轨迹迁移,利用3D基础模型特征进行跨场景映射,快速生成空间一致的轨迹迁移方案,适用于AR/VR和机器人领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03532 2026-05-15 cs.CV 67%

OpenTrack3D: Towards Accurate and Generalizable Open-Vocabulary 3D Instance Segmentation

OpenTrack3D: 向准确且通用的开放词汇3D实例分割迈进

Zhishan Zhou, Siyuan Wei, Zengran Wang, Chunjie Wang, Xiaosheng Yan, Xiao Liu

机构 * PICO, ByteDance, Beijing(字节跳动北京研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出OpenTrack3D框架,通过在线构建跨视角一致的对象提案和多模态大语言模型提升开放词汇3D实例分割的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14621 2026-05-15 cs.CV cs.AI cs.CL 62%

Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution

我们真的需要外部工具来缓解幻觉吗?SIRA:共享前缀内部重构归因

Tian Qin, Junzhe Chen, Yuqing Shi, Tianshu Zhang, Qiang Ju, Lijie Wen

机构 * Tsinghua University(清华大学) The University of Sydney(悉尼大学) Stanford University(斯坦福大学) Baichuan AI(百川AI)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 SIRA通过内部构建对比参考减少视觉语言模型的幻觉,无需外部工具或额外计算,保持描述覆盖并降低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14358 2026-05-15 cs.AI cs.LG 62%

Uncovering the Representation Geometry of Minimal Cores in Overcomplete Reasoning Traces

揭示过度完备推理轨迹中最小核心的表示几何

Sanjoy Chowdhury, Dinesh Manocha

机构 * University of Maryland, College Park, USA(马里兰大学学院公园分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示了过度完备推理轨迹中最小核心的表示几何,通过定义最小核心并提出压缩比、冗余质量等指标,发现平均46%的步骤可被移除且保留原答案,同时最小核心提升了正确-错误轨迹分离度,降低了内在维度,且在不同模型间具有高转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16813 2026-05-15 cs.AI cs.CL cs.DB 62%

PersonalHomeBench: Evaluating Agents in Personalized Smart Homes

PersonalHomeBench:评估智能家庭中的代理系统

Manasa Bharadwaj, Yolanda Liu, InJung Yang, Sungil Kim, Nikhil Verma, KoKeun Kim, Kevin Ferreira, YoungJoon Kim

机构 * LG Toronto AI Lab(LG多伦多人工智能实验室)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PersonalHomeBench,用于评估代理在个性化智能家庭中的表现,通过迭代构建家庭状态生成任务,结合工具箱支持真实交互,揭示任务复杂度增加时代理能力下降的问题。

Comments Please use and cite the V3 version of this work, which includes updated correct author ordering and expanded error analysis in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24273 2026-05-15 cs.AI 57%

A Minimal Agent for Automated Theorem Proving

一个用于自动定理证明的最小代理

Borja Requena, Austin Letson, Krystian Nowakowski, Izan Beltran-Ferreiro, Leopoldo Sarra

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出一个最小代理基准,用于比较不同AI定理证明器架构。通过迭代证明细化、库搜索和上下文管理核心功能,展示了与前沿方法相媲美的性能,同时架构更简单且成本更低。

Comments Accepted for publication at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14928 2026-05-15 cs.CL 57%

Chain-of-Procedure: Hierarchical Visual-Language Reasoning for Procedural QA

过程链:用于过程问答的层次视觉语言推理

Guanhua Chen, Yutong Yao, Shenghe Sun, Ci-Jun Gao, Shudong Liu, Lidia S. Chao, Feng Wan, Derek F. Wong

机构 * NLP CT Lab, Department of Computer and Information Science, University of Macau(计算机与信息科学系,澳门大学CT实验室) Department of Electrical and Computer Engineering, University of Macau(电气与计算机工程系,澳门大学) Centre for Cognitive and Brain Sciences, University of Macau(认知与脑科学中心,澳门大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 本文提出ProcedureVQA基准,针对视觉过程问答任务,通过过程链框架解决现有VLMs在跨模态检索和步骤分解上的不足,实验显示其在六个VLMs上提升达13%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14392 2026-05-15 cs.AI 57%

Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis

学习构建环境:通过可验证环境合成实现自我进化推理RL

Yucheng Shi, Zhenwen Liang, Kishan Panaganti, Dian Yu, Wenhao Yu, Haitao Mi

机构 * Tencent HY LLM(腾讯 HY LLM)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出通过可验证环境合成实现自我进化推理RL,构建环境而非生成数据,利用环境构造循环提升模型能力,通过稳定的问题-验证不对称性保持奖励信息性。

Comments Tech report, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14163 2026-05-15 cs.AI 57%

Agentic Systems as Boosting Weak Reasoning Models

代理系统作为增强弱推理模型

Varun Sunkaraneni, Pierfrancesco Beneventano, Riccardo Neumarker, Tomaso Poggio, Tomer Galanti

机构 * Texas A&M University(德克萨斯A&M大学) MIT(麻省理工学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究通过验证器支持的委员会搜索方法提升弱推理模型性能,证明通过多次采样可增强覆盖度,但需额外局部正确性信号以生成可靠批评者和比较者,实验显示弱模型提案池中存在大量正确补丁,关键挑战在于有效选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18943 2026-05-15 cs.CV 50%

VGGT-360: Geometry-Consistent Zero-Shot Panoramic Depth Estimation

VGGT-360:几何一致的零样本全景深度估计

Jiayi Yuan, Haobo Jiang, De Wen Soh, Na Zhao

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 VGGT-360通过利用VGGT基础模型的内在3D一致性,提出一种无需训练的零样本全景深度估计框架,整合三个模块实现全景到3D到深度的统一流程,提升估计精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 79 篇

2605.14460 2026-05-15 cs.CR cs.SE 92%

Exploiting LLM Agent Supply Chains via Payload-less Skills

通过无负载技能利用LLM代理供应链

Xinyu Liu, Yukai Zhao, Xing Hu, Xin Xia

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究提出Semantic Compliance Hijacking攻击,利用LLM生成能力动态合成恶意行为,通过无负载技能实现对自主编码环境的攻击,展示了其在不同框架和模型中的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06718 2026-05-15 cs.CR cs.AI 92%

GhostCite: A Large-Scale Analysis of Citation Validity in the Age of Large Language Models

GhostCite: 对大规模语言模型时代引用有效性的大规模分析

Zuyao Xu, Yuqi Qiu, Lu Sun, Fasheng Miao, Fubin Wu, Xiang Li, Xinyi Wang, Haozhe Lu, Zhengze Zhang, Yuxin Hu, Jialu Li, Luo Jin, Feng Zhang, Rui Luo, Xinran Liu, Yingxian Li, Jiaji Liu

机构 * Nankai University(南开大学) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究通过三个实验分析LLM时代引用有效性,发现13个模型在引用生成任务中存在14.23%-94.93%的伪造引用率,2025年无效引用率上升80.9%,并揭示87.2%的研究人员使用AI工具,76.7%的审稿人未彻底检查参考文献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20924 2026-05-15 cs.CR 91%

RLCracker: Evaluating the Worst-Case Vulnerability of LLM Watermarks with Adaptive RL Attacks

RLCracker: 评估LLM水印的最坏情况漏洞

Hanbo Huang, Yiran Zhang, Hao Zheng, Xuan Gong, Yihan Li, Lin Liu, Zhuotao Liu, Shiyu Liang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出RLCracker,通过强化学习方法评估LLM水印的最坏情况漏洞,证明水印对改写攻击高度敏感,并在有限样本下实现高移除率。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13873 2026-05-15 cs.DL cs.AI cs.HC 91%

Large Language Models for Web Accessibility: A Systematic Literature Review

用于网络可访问性的大型语言模型:系统文献综述

Wajdi Aljedaani, Rubel Hassan Mollik

机构 * University of North Texas(北卡罗来纳州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文综述了38篇研究,探讨了大型语言模型在网页可访问性中的应用,发现大多数研究集中在文本导向和结构明确的任务,主要参考WCAG标准,但对认知可访问性指南考虑有限,评估方法多样且缺乏残障用户直接参与。

Comments Accepted at the 23rd International Web for All Conference (W4A 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15034 2026-05-15 cs.CL cs.AI cs.CY cs.MA 91%

AI Knows When It's Being Watched: Functional Strategic Action and Contextual Register Modulation in Large Language Models

AI 知道它在被观察:大型语言模型中的功能性战略行为与情境语境调节

Vinicius Covas, Jorge Alberto Hidalgo Toledo

机构 * Center for Applied Communication Research (CICA)(应用沟通研究中心) Human & NonHuman Communication Laboratory(人类与非人类沟通实验室) Faculty of Communication(传播学院) Universidad Anáhuac México(墨西哥安纳胡阿克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究探讨大型语言模型在感知社会观察情境下是否表现出系统性的语言适应,通过实验发现AI行为对观察者身份敏感,对AI审计系统的影响较小,对AI治理和算法审计有重要启示。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14517 2026-05-15 cs.CL cs.AI 91%

Dimension-Level Intent Fidelity Evaluation for Large Language Models: Evidence from Structured Prompt Ablation

大型语言模型的维度意图保真度评估:基于结构化提示消融的证据

GAng Peng

机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州拉提尼人工智能技术有限公司) Huizhou University(惠州大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文提出一种维度意图保真度评估框架,通过2880个跨三语言、三任务领域和六种LLM的结构化提示消融研究,分别衡量结构恢复和意图保真度,揭示了系统性的结构保真度分裂,并证明了维度保真度评分比整体评分更可靠。

Comments Preprint. 30 tasks, 3 languages, 6 LLMs, 2,880 outputs; includes human evaluation and structured prompt ablation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14635 2026-05-15 cs.CV cs.AI 90%

MultiEmo-Bench: Multi-label Visual Emotion Analysis for Multi-modal Large Language Models

MultiEmo-Bench:多标签视觉情绪分析用于多模态大语言模型

Tianwei Chen, Takuya Furusawa, Yuki Hirakawa, Ryotaro Shimizu, Mo Fan, Takashi Wada

机构 * ZOZO NEXT Inc.(ZOZO NEXT公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一个多标签视觉情绪分析基准数据集,用于评估多模态大语言模型对图像引发情绪的预测能力。通过改进标注方案,提供更可靠的数据集,并评估了多个模型在情绪预测上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏