arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-13 至 2026-05-13 共收录 421 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 59 篇

2510.03206 2026-05-13 cs.AI cs.CL 81%

Coevolutionary Continuous Discrete Diffusion: Make Your Diffusion Language Model a Latent Reasoner

连续离散扩散:使你的扩散语言模型成为潜在推理器

Cai Zhou, Chenxiao Yang, Yi Hu, Chenyu Wang, Chubin Zhang, Muhan Zhang, Lester Mackey, Tommi Jaakkola, Stephen Bates, Dinghuai Zhang

机构 * Massachusetts Institute of Technology(麻省理工学院) Microsoft Research(微软研究院) Toyota Technological Institute at Chicago(丰田技术研究所(芝加哥)) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CCDD模型,结合连续和离散空间,提升扩散语言模型的表达能力和训练效果,通过联合多模态扩散过程实现高质量的生成与推理。

Comments 29 pages. Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11633 2026-05-13 cs.AI 80%

Can LLM Agents Respond to Disasters? Benchmarking Heterogeneous Geospatial Reasoning in Emergency Operations

大语言模型代理能否应对灾难?评估异构地理空间推理在紧急行动中的基准测试

Junjue Wang, Weihao Xuan, Heli Qi, Pengyu Dai, Kunyi Liu, Hongruixuan Chen, Zhuo Zheng, Junshi Xia, Stefano Ermon, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Waseda University(早稻田大学) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(title,abstract_cn);分类 cs.AI

AI总结 本文提出DORA基准测试,评估大语言模型在灾难响应中的端到端流程,揭示了灾难领域接地、工具选择瓶颈和组合脆弱性等挑战。

Comments DORA stress-tests LLM agents on real-world disaster operations that demand comprehensive orchestration of 108 specialized tools over heterogeneous geospatial data

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02408 2026-05-13 cs.CV cs.AI 79%

ReasonEdit: Editing Vision-Language Models using Human Reasoning

ReasonEdit:通过人类推理编辑视觉语言模型

Jiaxing Qiu, Kaihua Hou, Roxana Daneshjou, Ahmed Alaa, Thomas Hartvigsen

机构 * University of Virginia(弗吉尼亚大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 ReasonEdit通过引入人类推理机制,改进视觉语言模型的编辑能力,提升编辑泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11061 2026-05-13 cs.CV cs.MM 78%

HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer

HiDream-O1-Image:一种原生统一的图像生成基础模型,具有像素级统一的Transformer

Qi Cai, Jingwen Chen, Chengmin Gao, Zijian Gong, Yehao Li, Yingwei Pan, Yi Peng, Zhaofan Qiu, Kai Yu, Yiheng Zhang, Hao Ai, Siying Bai, Yang Chen, Zhihui Chen, Fengbin Gao, Ying Guo, Dong Li, Zhen Shen, Leilei Shi, Jing Wang, Siyu Wang, Yimeng Wang, Rui Zheng, Ting Yao, Tao Mei

专题命中 推理与问题求解 :foundation model(title,abstract)

AI总结 本文提出HiDream-O1-Image,通过像素空间扩散Transformer实现多模态输入的结构统一,无需外部VAE或离散文本编码器,提升生成和编辑任务的性能,实验表明其在多种生成任务中表现优异。

Comments Source codes and models are available at Github: https://github.com/HiDream-ai/HiDream-O1-Image and Huggingface: https://huggingface.co/HiDream-ai/HiDream-O1-Image

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13841 2026-05-13 cs.CL 77%

The Challenge and Reward of Fair Play in Narrative: A Computational Approach

叙事中的公平游戏挑战与回报:一种计算方法

Eitan Wagner, Renana Keydar, Omri Abend

机构 * Department of Computer Science Hebrew University of Jerusalem(计算机科学系 Hebrew University of Jerusalem) Department of Law and Digital Humanities Hebrew University of Jerusalem(法律与数字人文系 Hebrew University of Jerusalem)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过信息论框架分析叙事中的意外与连贯性,提出公平游戏平衡机制,利用大语言模型验证理论,发现惊喜与连贯性不正相关,且文学作品中克里斯蒂的叙事更符合公平游戏标准。

Comments 47 pages, 11 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11439 2026-05-13 cs.CV cs.LG 77%

Instruct-ICL: Instruction-Guided In-Context Learning for Post-Disaster Damage Assessment

Instruct-ICL:基于指令的上下文学习用于灾后损害评估

Armin Zarbaft, Ehsan Karimi, Nhut Le, Maryam Rahnemoonfar

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.LG

AI总结 本文提出Instruct-ICL方法,通过指令引导的上下文学习提升预训练多模态大语言模型在灾后视觉问答中的可靠性,实验表明结合CoT推理能显著提高回答准确性。

Comments Accepted by the 2026 IEEE International Geoscience and Remote Sensing Symposium (IGARSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07782 2026-05-13 cs.CL cs.PL 77%

CktFormalizer: Autoformalization of Natural Language into Circuit Representations

CktFormalizer: 自然语言到电路表示的自动形式化

Jing Xiong, Qi Han, Chenchen Ding, He Xiao, Zunhai Su, Chaofan Tao, Ngai Wong

机构 * The University of Hong Kong(香港大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 CktFormalizer通过依赖类型HDL在Lean 4中实现LLM生成硬件描述的自动形式化,解决Verilog中的宽度不匹配、组合环和不完整案例逻辑问题,提升后端实现率和仿真通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12466 2026-05-13 cs.LG cs.AI cs.CL cs.NE 75%

Solve the Loop: Attractor Models for Language and Reasoning

循环求解:语言和推理的吸引子模型

Jacob Fein-Ashley, Paria Rashidinejad

机构 * University of Southern California(南加州大学)

专题命中 推理与问题求解 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出吸引子模型,通过固定点求解实现循环优化,提升语言模型和推理性能,在大规模预训练和小模型推理中均优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25239 2026-05-13 cs.AI cs.CL cs.LG 75%

A Formal Comparison Between Chain of Thought and Latent Thought

链式思维与潜在思维的正式比较

Kevin Xu, Issei Sato

机构 * Department of Computer Science, The University of Tokyo, Japan(东京大学计算机科学系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文对比了链式思维与潜在思维,发现潜在思维在并行计算上更高效,而链式思维能通过随机解码实现近似计数与采样。

Comments Camera-ready version for ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08802 2026-05-13 cs.CV 75%

CoLVR: Enhancing Exploratory Latent Visual Reasoning via Contrastive Optimization

CoLVR: 通过对比优化增强探索性潜在视觉推理

Ziyang Ding, Linjian Meng, Yiming Wu, Yuhan Li, Yuhao Liu, Zhen Zhao

机构 * Shandong University(山东大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) The University of Hong Kong(香港大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract)

AI总结 CoLVR通过引入潜在对比训练框架,利用角度扰动引导学习多样化且探索性的表示,提升潜在视觉推理的探索能力,在VSP和Jigsaw任务中分别提升5.83%和8.00%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05922 2026-05-13 cs.CV 75%

Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling

思考,然后评分:视频奖励建模中的解耦推理与评分

Yuan Wang, Ouxiang Li, Yulong Xu, Borui Liao, Jiajun Liang, Jinghan Li, Meng Wang, Xintao Wang, Pengfei Wan, Kuien Liu, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出DeScore模型,通过解耦推理与评分机制提升视频奖励建模的泛化能力,结合冷启动和强化学习优化,实现更稳定的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11388 2026-05-13 cs.CL cs.AI 73%

Deep Reasoning in General Purpose Agents via Structured Meta-Cognition

通过结构化元认知实现通用代理中的深度推理

Dean Light, Michael Theologitis, Kshitish Ghate, Shuyue Stella Li, Benjamin Newman, Chirag Shah, Aylin Caliskan, Pang Wei Koh, Dan Suciu, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出深度推理方法,通过结构化元认知构建任务特定框架,提升复杂任务处理能力,在四个基准测试中超越现有方法,减少早终止和幻觉。

Comments Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11301 2026-05-13 cs.AI cs.CL cs.CV 73%

LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?

LatentRouter: 在看到答案之前,我们能否选择合适的多模态模型?

Xueqi Cheng, Yushun Dong

机构 * Department of Computer Science(计算机科学系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LatentRouter通过多模态效用预测实现多模态大语言模型的路由,通过隐式通信和胶囊修正提升模型选择准确性,在MMR-Bench和VL-RouterBench实验中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01941 2026-05-13 cs.CL cs.AI 73%

Semantic Integrity Matters: Benchmarking and Preserving High-Density Reasoning in KV Cache Compression

语义完整性至关重要:在KV缓存压缩中基准测试与保持高密度推理

Xiang Liu, Zhenheng Tang, Hong Chen, Peijie Dong, Zeyu Li, Xiuze Zhou, Bo Li, Xuming Hu, Xiaowen Chu

机构 * The Hong Kong University of Science(香港科学与技术大学) Guangzhou HKUST Fok Ying Tung Research Institute(广州HKUST傅种群研究院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出KVFundaBench基准测试,揭示了在高密度推理中压缩导致的严重任务依赖性退化问题,并提出ShotKV方法,通过分离prefill和解码阶段以优先保持语义完整性,提升了长上下文生成任务的准确率并降低了延迟。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11882 2026-05-13 cs.AI 70%

On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment

通过失败轨迹实现的在线自我进化以实现代理安全对齐

Bo Yin, Qi Li, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出FATE框架,通过将验证者评分的失败轨迹转化为修复监督,结合Pareto-Front Policy Optimization方法,提升代理安全性同时保持有用行为,实验显示在不同模型和规模上均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11856 2026-05-13 cs.CV cs.CL 70%

UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs

UniVLR: 统一文本与视觉的视觉潜在推理用于多模态大语言模型

Houcheng Jiang, Jiajun Fu, Junfeng Fang, Chen Gao, Xiang Wang, Xiangnan He, Yong Li

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Zhongguancun Academy(中关村学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 UniVLR提出一种统一的视觉潜在推理框架,将文本推理和辅助视觉证据视为共享的视觉工作空间,通过压缩统一表示提升多模态大语言模型的视觉推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11629 2026-05-13 cs.CL 70%

OmniThoughtVis: A Scalable Distillation Pipeline for Deployable Multimodal Reasoning Models

OmniThoughtVis: 一种可扩展的蒸馏流水线,用于可部署的多模态推理模型

Yuanhao Yue, Chengyu Wang, Yuanjie Lyu, Lei Shen, Jun Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出OmniThoughtVis流水线,通过大规模多模态Co T监督将高容量教师模型的推理能力转移到小型部署模型,实现了在多个基准上的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11609 2026-05-13 cs.LG cs.AI cs.CL 67%

Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information

反自我蒸馏用于通过点互信息的推理强化学习

Guobin Shen, Xiang Cheng, Chenxiao Zhao, Lei Huang, Jindong Li, Dongcheng Zhao, Xing Yu

机构 * Xiaohongshu Inc.(小红书公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出反自我蒸馏方法,通过分析点互信息解决自我蒸馏在数学推理中的不一致问题,提升模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11553 2026-05-13 cs.IR 67%

TwiSTAR:Think Fast, Think Slow, Then Act,Generative Recommendation with Adaptive Reasoning

TwiSTAR:快速思考,缓慢思考,然后行动,基于语义ID的生成推荐

Shiteng Cao, Kaian Jiang, Yunlong Gong, Zhiheng Li

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 本文提出TwiSTAR框架,通过自适应分配推理努力提升推荐准确性与效率,利用语义ID检索、轻量级排序和慢推理模型,结合常识知识增强,减少延迟并优于基线方法。

Comments 16pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11534 2026-05-13 cs.RO 67%

PRISM: : Planning and Reasoning with Intent in Simulated Embodied Environments

PRISM:在模拟的具身环境中进行规划与意图推理

Yunn Kang Lim, Pengzhan Sun, Ziyi Bai, Xun Xu, Angela Yao, Xulei Yang, Shijie Li

机构 * A*STAR National University of Singapore(国立新加坡大学) BAAI(北京人工智能研究院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 PRISM通过诊断性基准测试识别具身代理失败的根源,通过三个能力层级评估基本能力、推理能力和长周期能力,揭示不同模型在空间定位、意图解析和长周期协调上的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11522 2026-05-13 cs.DC 67%

State Twins: An Off-Chain Substrate for Agentic Reasoning over Decentralized Finance Protocols

状态双生:一种链下子层,用于在去中心化金融协议上进行代理推理

Ian C. Moore

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 本文提出State Twin,一种链下子层,用于在去中心化金融协议上进行代理推理。通过将AMM池建模为离散时间受控动态系统,提供精确数学模型和操作扩展能力,实现快速回放和反事实模拟。

Comments 14 pages, 1 table, 7 listings; reference implementation at https://github.com/defipy-devs/defipy

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12474 2026-05-13 cs.AI 57%

Reward Hacking in Rubric-Based Reinforcement Learning

基于规则的强化学习中的奖励黑客行为

Anas Mahmoud, MohammadHossein Rezaei, Zihao Wang, Anisha Gunjal, Bing Liu, Yunzhong He

专题命中 推理与问题求解 :post-training(abstract);分类 cs.AI

AI总结 研究了基于规则的强化学习中的奖励黑客问题,分析了验证失败和规则设计限制对奖励的影响,并提出自我内部化差距作为诊断工具,发现更强的验证并不能完全防止奖励黑客,因为规则未涵盖重要失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12426 2026-05-13 cs.CL 57%

Geometric Factual Recall in Transformers

变换器中的几何事实回忆

Shauli Ravfogel, Gilad Yehudai, Joan Bruna, Alberto Bietti

机构 * New York University(纽约大学) Flatiron Institute(Flatiron研究所)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 研究探讨了变换器模型如何通过几何方式记忆事实关联,证明嵌入维度与事实数量呈对数关系,并展示了多跳查询中的容量-深度权衡。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11746 2026-05-13 cs.AI 57%

When Reasoning Traces Become Performative: Step-Level Evidence that Chain-of-Thought Is an Imperfect Oversight Channel

当推理痕迹成为行为性:基于步骤级的证据显示链式思维是不完美的疏忽通道

Wenkai Li, Fan Yang, Ananya Hazarika, Shaunak A. Mehta, Koichi Onoue

机构 * Carnegie Mellon University(卡内基梅隆大学) Fujitsu Research of America Inc.(富士通美国研究公司)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究通过步骤级检测-分类-比较框架,发现链式思维痕迹与计算过程不一致,揭示其作为答案形成报告的不可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11462 2026-05-13 cs.CV cs.AI 57%

SpatialForge: Bootstrapping 3D-Aware Spatial Reasoning from Open-World 2D Images

SpatialForge: 从开放世界2D图像中提升3D感知空间推理

Zishan Liu, Ruoxi Zang, Yanglin Zhang, Wei Liu, Yin Zhang, Jian Yao, Jiayin Zheng, Zhengzhe Liu

机构 * Lingnan University(岭南大学) XPENG Robotics(小鹏机器人)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出SpatialForge,通过大规模合成数据提升空间推理能力,构建了包含1000万对空间问答的大型数据集,验证了2D数据扩展对3D空间推理的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10201 2026-05-13 cs.RO cs.AI 57%

HeteroGenManip: Generalizable Manipulation For Heterogeneous Object Interactions

HeteroGenManip:异构物体交互的通用操作

Zhenhao Shen, Zeming Yang, Yue Chen, Yuran Wang, Shengqiang Xu, Mingleyang Li, Hao Dong, Ruihai Wu

机构 * Peking University(北京大学) Tianjin University(天津大学)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 本文提出HeteroGenManip框架,通过两阶段方法解决机器人异构物体交互中的接触点定位和轨迹规划问题,实现跨类型物体的鲁棒泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06873 2026-05-13 stat.ML cs.LG cs.NA math.NA 57%

One Operator for Many Densities: Amortized Approximation of Conditioning by Neural Operators

一个算子用于多种密度:通过神经算子实现条件化的消融近似

Panos Tsimpos, Edoardo Calvello, Ayoub Belhadji, Nicholas H. Nelsen

机构 * Operations Research Center(运筹学研究中心) Massachusetts Institute of Technology(麻省理工学院) Department of Computing and Mathematical Sciences(计算与数学科学系) California Institute of Technology(加州理工学院) Laboratory for Information and Decision Systems(信息与决策系统实验室) Center for Computational Science and Engineering(计算科学与工程中心) Department of Mathematics(数学系) Cornell University(康奈尔大学) Oden Institute for Computational Engineering and Sciences(计算工程与科学学院)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.LG

AI总结 本文提出通过神经算子近似条件化算子,解决概率条件化问题,展示了其在高斯混合模型中的应用,为概率条件化提供了理论基础。

Comments 27 pages (10 main text, 14 appendix, and 3 references pages), 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21887 2026-05-13 cs.RO 50%

IGV-RRT: Prior-Real-Time Observation Fusion for Active Object Search in Changing Environments

IGV-RRT:面向动态环境主动目标搜索的先验-实时观测融合

Wei Zhang, Ping Gong, Yujie Wang, Leilei Yao, Minghui Bai, Rongfeng Ye, Yinchuan Wang, Yachao Wang, Chen Sun, Chaoqun Wang

机构 * The School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学) Department of Data and Systems Engineering, HKU(数据与系统工程系,香港大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出IGV-RRT框架,结合先验场景知识与实时目标相关性估计,通过双层语义映射模块和实时规划器提升动态环境中目标搜索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19207 2026-05-13 cs.CV 50%

Long Story Short: Disentangling Compositionality and Long-Caption Understanding in Contrastive VLMs

长话短说:在对比视觉语言模型中解构组合性与长描述理解

Israfel Salazar, Desmond Elliott, Yova Kementchedjhieva

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系) MBZUAI(马克斯·普朗克人工智能研究所)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文研究对比视觉语言模型中组合推理与长描述理解之间的关系,通过实验发现两者存在双向但敏感的关联,高质量数据和合理架构设计有助于提升模型泛化能力。

Comments To be published in Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 92 篇

2605.06940 2026-05-13 cs.CL cs.AI cs.LG 92%

MultiSoc-4D: A Benchmark for Diagnosing Instruction-Induced Label Collapse in Closed-Set LLM Annotation of Bengali Social Media

MultiSoc-4D:一个用于诊断指令诱导标签崩溃的基准,在封闭集LLM注释印度文社交媒体中的应用

Souvik Pramanik, S. M. Riaz Rahman Antu, Shak Mohammad Abyad, Md. Ibrahim Khalil, Md. Shahriar Hussain

机构 * North South University(北南大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MultiSoc-4D基准,通过LLM注释印度文社交媒体评论,发现指令诱导标签崩溃现象,揭示注释偏见传播问题,提供诊断工具。

Comments 21 pages, 14 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏