arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-09 至 2026-04-09 共收录 277 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 65 篇

2604.06714 2026-04-09 cs.AI cs.CL cs.CV cs.LG 75%

Steering the Verifiability of Multimodal AI Hallucinations

操控多模态AI幻觉的可验证性

Jianhong Pang, Ruoxi Cheng, Ziyi Ye, Xingjun Ma, Zuxuan Wu, Xuanjing Huang, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究多模态AI幻觉的可验证性差异,提出基于激活空间的干预方法,通过区分明显和隐秘幻觉,实现对模型可验证性的精细控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19640 2026-04-09 cs.CV 75%

Focus on What Really Matters in Low-Altitude Governance: A Management-Centric Multi-Modal Benchmark with Implicitly Coordinated Vision-Language Reasoning Framework

聚焦低空治理中真正重要的问题:一种以管理为中心的多模态基准与隐式协调的视觉-语言推理框架

Hao Chang, Zhihui Wang, Lingxiang Wu, Wei An, Boyang Li, Zaiping Lin, Weidong Sheng, Jinqiao Wang

机构 * National University of Defense Technology(国防科技大学) Zidong Taichu (Beijing) Technology Co., Ltd.(紫东太初(北京)科技有限公司) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Wuhan AI Research(武汉人工智能研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出GovLA-10K多模态基准和GovLA-Reasoner框架,通过功能显著目标和隐式协调的视觉-语言推理提升低空治理中的管理需求理解与执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03013 2026-04-09 cs.CR 75%

LLMs, You Can Evaluate It! Design of Multi-perspective Report Evaluation for Security Operation Centers

LLMs, You Can Evaluate It! 多视角报告评估设计用于安全运营中心

Hiroyuki Okada, Tatsumi Oba, Naoto Yanai

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文设计多视角报告评估框架MESSALA,利用LLM提升安全运营中心分析报告质量,实验表明其评估结果最接近资深分析师。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05429 2026-04-09 eess.SY cs.AI cs.CL cs.SY 73%

Bridging Natural Language and Microgrid Dynamics: A Context-Aware Simulator and Dataset

连接自然语言与微电网动态:一种上下文感知的模拟器和数据集

Tinko Sebastian Bartels, Ruixiang Wu, Xinyu Lu, Yikai Lu, Fanzeng Xia, Haoxiang Yang, Yue Chen, Tongxin Li

机构 * School of Data Science, The Chinese University of Hong Kong-Shenzhen(香港中文大学(深圳)数据科学学院) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出OpenCEM模拟器和数据集,通过整合丰富的非结构化上下文信息与量化可再生能源动态,解决传统能源管理忽视人类生成上下文预测能力的问题,展示其在负载预测和电池充电控制中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23642 2026-04-09 cs.SE cs.AI cs.CL cs.PL 73%

VisCoder2: Building Multi-Language Visualization Coding Agents

VisCoder2:构建多语言可视化编码代理

Yuansheng Ni, Songcheng Cai, Xiangchao Chen, Jiarong Liang, Zhiheng Lyu, Jiaqi Deng, Kai Zou, Ping Nie, Fei Yuan, Xiang Yue, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) Carnegie Mellon University(卡内基梅隆大学) Korea Advanced Institute of Science & Technology(韩国科学技术院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VisCoder2,一种多语言可视化编码模型,通过VisCode-Multi-679K大规模数据集和VisPlotBench基准测试,显著提升了多轮自调试能力,在32B规模下达到82.4%的执行通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07006 2026-04-09 cs.CL 70%

Continuous Interpretive Steering for Scalar Diversity

标量多样性中的连续解释性引导

Ye-eun Cho

机构 * Sungkyunkwan University(成均馆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出连续解释性引导(CIS)方法,通过激活层面的连续变量探究分级语用解释,结合新数据集GraSD验证了LLM中分级语用敏感性的存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06566 2026-04-09 cs.DB cs.AI 70%

AI-Driven Research for Databases

基于人工智能的数据库研究

Audrey Cheng, Harald Ng, Aaron Kabcenell, Peter Bailis, Matei Zaharia, Lin Ma, Xiao Shi, Ion Stoica

机构 * UC Berkeley(加州大学伯克利分校) KTH Royal Institute of Technology(瑞典皇家理工学院) Meta Workday University of Michigan(密歇根大学) Maven AGI

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型自动化发现数据库性能优化方案,通过共进化设计评估器与解决方案,展示了在缓冲管理、查询重写和索引选择中的有效性,实现了优于现有方法的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06551 2026-04-09 cs.CL 70%

CCD-CBT: Multi-Agent Therapeutic Interaction for CBT Guided by Cognitive Conceptualization Diagram

CCD-CBT:基于认知概念图的多智能体治疗交互

Chang Liu, Changsheng Ma, Yongfeng Tao, Bin Hu, Minqiang Yang

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CCD-CBT框架,通过动态重构认知概念图和信息不对称交互提升CBT模拟效果,基于合成数据集验证了其在治疗可信度和积极情绪增强方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06264 2026-04-09 q-bio.QM cs.AI 70%

ToxReason: A Benchmark for Mechanistic Chemical Toxicity Reasoning via Adverse Outcome Pathway

ToxReason: 一个通过不良后果途径进行机理化学毒性推理的基准

Jueon Park, Wonjune Jang, Chanhwi Kim, Yein Park, Jaewoo Kang

机构 * Korea University(高丽大学) Myongji University(明知大学) University of Texas Health Science Center at Houston(德克萨斯大学休斯顿健康科学中心) AIGEN Sciences

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ToxReason基准通过整合药物-靶点相互作用证据与毒性标签,评估多器官水平的毒性推理能力,发现强预测性能不等于可靠推理,且推理意识训练能提升机理推理和毒性预测性能。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00239 2026-04-09 cs.CL 70%

A Taxonomy of Programming Languages for Code Generation

编程语言的分类:为代码生成提供分类

Nishat Raihan, Christian Newman, Marcos Zampieri

机构 * George Mason University(乔治梅森大学) Rochester Institute of Technology(罗彻斯特理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出首个可复现的编程语言资源分类,将646种语言分为四类,揭示资源分布的极端不均衡,为多语言大模型的评估提供框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25477 2026-04-09 cs.CL 70%

The Rise of AfricaNLP: A Survey of Contributions, Contributors, Community Impact, and Bibliometric Analysis

非洲NLP的崛起:对贡献、贡献者和社区影响的调查及文献计量分析

Tadesse Destaw Belay, Kedir Yassin Hussen, Sukairaj Hafiz Imam, Ibrahim Said Ahmad, Isa Inuwa-Dutse, Abrham Belete Haile, Grigori Sidorov, Eusebio Ricardez Vazquez, Iqra Ameer, Idris Abdulmumin, Tajuddeen Gwadabe, Vukosi Marivate, Seid Muhie Yimam, Shamsuddeen Hassan Muhammad

机构 * Instituto Politécnico Nacional(国立理工学院) University of Gondar(贡德尔大学) Northwest University Kano(卡诺西北大学) Bayero University Kano(巴耶罗大学卡诺分校) University of Huddersfield(哈德斯菲尔德大学) iCog Labs(iCog实验室) Pennsylvania State University(宾夕法尼亚州立大学) University of Pretoria(比勒陀利亚大学) Masakhane University of Hamburg(汉堡大学) Imperial College London(伦敦帝国理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过分析非洲NLP领域近20年的研究进展,探讨了出版物、主题、任务、数据、方法和贡献者等方面的变化,提出了非洲NLP研究的趋势分析工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24857 2026-04-09 cs.CL cs.CY 70%

Between Help and Harm: An Evaluation of Mental Health Crisis Handling by LLMs

在帮助与伤害之间:对LLM处理心理健康危机的评估

Adrian Arnaiz-Rodriguez, Miguel Baidal, Erik Derner, Jenn Layton Annable, Mark Ball, Mark Ince, Elvira Perez Vallejos, Nuria Oliver

机构 * ELLIS Alicante(ELLIS 阿利坎特) CTU in Prague(捷克布拉格理工大学) School of Health Science, The University of Nottingham(诺丁汉大学健康科学学院) School of Psychology, Public Health and Social Care, Derby University(德比大学心理学、公共卫生与社会关怀学院) Mental Health Practitioner, Social Worker & Independent Scholar(心理健康从业者、社会工作者与独立学者) School of Computer Science & School of Medicine, The University of Nottingham(诺丁汉大学计算机科学学院与医学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估了LLM在处理心理健康危机时的性能,提出六类危机分类、2252个示例数据集及临床评估协议,发现部分模型在自残和自杀类别中存在不安全输出,强调需加强安全防护和上下文感知能力。

Comments Accepted for publication in JMIR Mental Health. DOI: 10.2196/88435

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16150 2026-04-09 cs.AI cs.HC cs.SY eess.SY 70%

A Comprehensive Survey of Agents for Computer Use: Foundations, Challenges, and Future Directions

用于计算机的代理全面综述:基础、挑战与未来方向

Pascal J. Sager, Benjamin Meyer, Peng Yan, Rebekka von Wartburg-Kottler, Layan Etaiwi, Aref Enayati, Gabriel Nobel, Ahmed Abdulkadir, Benjamin F. Grewe, Thilo Stadelmann

机构 * Zurich University of Applied Sciences(苏黎世应用科技大学) University of Zurich(苏黎世大学) ETH AI Center(苏黎世联邦理工学院人工智能中心) University of Fribourg(弗里堡大学) European Centre for Living Technology(欧洲生活技术中心)

专题命中 评测与基准 :foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文综述了用于计算机的代理(ACUs)的发展现状、趋势及研究空白,提出统一的分类体系,分析了六个主要研究缺口,并提出改进方向。

Journal ref Journal of Artificial Intelligence Research, vol. 85, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07338 2026-04-09 cs.CV cs.CL cs.MM 70%

Appear2Meaning: A Cross-Cultural Benchmark for Structured Cultural Metadata Inference from Images

Appear2Meaning: 一个跨文化的结构化文化元数据图像推理基准

Yuechen Jiang, Enze Zhang, Md Mohsinul Kabir, Qianqian Xie, Stavroula Golfomitsou, Konstantinos Arvanitis, Sophia Ananiadou

机构 * University of Manchester(曼彻斯特大学) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Getty Conservation Institute(盖蒂保护研究所)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一个跨文化的结构化文化元数据图像推理基准,评估VLMs在文化元数据推断中的表现,发现模型在不同文化和元数据类型上存在显著性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07321 2026-04-09 cs.LO cs.AI 70%

Syntax Is Easy, Semantics Is Hard: Evaluating LLMs for LTL Translation

语法是容易的,语义是困难的:评估LLM在LTL翻译中的表现

Priscilla Kyei Danso, Mohammad Saqib Hasan, Niranjan Balasubramanian, Omar Chowdhury

机构 * Stony Brook University(石溪大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了多个LLM将自然语言句子转换为LTL公式的能力,发现其在语法层面表现较好,但在语义层面存在挑战,且更详细的提示和重新表述为代码补全问题能提升性能。

Comments SecDev 2026 in Montreal, Canada, 10 pages, maximum 16 pages

Journal ref Proceedings of the 2026 ACM Secure Development Conference (SecDev 2026), July 05--06, 2026, Montreal, QC, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07264 2026-04-09 cs.CR cs.AI 70%

Validated Intent Compilation for Constrained Routing in LEO Mega-Constellations

面向低轨巨型星座受限路由的意图验证编译

Yuanhang Li

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出端到端系统,通过图神经网络路由器、语言模型意图编译器和确定性验证器,实现高阶意图到低阶路由约束的转换,确保路由安全性和网络配置的准确性。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11635 2026-04-09 cs.AI 70%

Do MLLMs Really Understand Space? A Mathematical Reasoning Evaluation

大规模语言模型真的能理解空间吗?一项数学推理评估

Shuo Lu, Jianjie Cheng, Yinuo Xu, Yongcan Yu, Lijun Sheng, Peijie Wang, Siru Jiang, Yongguan Hu, Run Ling, Yihua Shao, Ao Ma, Wei Feng, Lingxiao He, Meng Wang, Qianlong Xie, Xingxing Wang, Nicu Sebe, Ran He, Jian Liang

机构 * Meituan Inc.(美团) Northeastern University(东北大学) University of Trento(特伦托大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过MathSpatial数据集评估了大规模语言模型在数学空间推理上的能力,发现其在空间推理任务上表现不佳,提出该数据集有助于提升模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10658 2026-04-09 cs.CV 67%

How to Embed Matters: Evaluation of EO Embedding Design Choices

如何嵌入至关重要:EO嵌入设计选择的评估

Luis Gilch, Isabelle Wittmann, Maximilian Nitsche, Johannes Jakubik, Arne Ewald, Thomas Brunschwiler

机构 * IBM Germany(IBM德国) IBM Research – Europe(IBM欧洲研究院) NORDAKADEMIE Germany(德国北方学院)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract)

AI总结 本文评估了EO工作流中嵌入设计对性能和可扩展性的影响,通过系统分析发现Transformer架构与均值池化提供强默认嵌入,中间ResNet层表现更优,自监督目标具有任务特异性优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13379 2026-04-09 cs.AR eess.SP 67%

A Quantitative Evaluation of Approximate Softmax Functions for Deep Neural Networks

深度神经网络中近似Softmax函数的定量评估

Anthony Leiva-Valverde, Fabricio Elizondo-Fernández, Luis G. León-Vega, Cristina Meinhardt, Jorge Castro-Godínez

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文评估了利用泰勒级数和插值方法加速Softmax计算的近似技术,发现二次插值在精度上最佳,而泰勒方法在速度和资源效率上更优,实验证明在资源受限FPGA上具有应用潜力。

Comments A new author has been added due to his contributions in the FPGA part (Section IV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07167 2026-04-09 cs.HC 67%

Critical Inker: Scaffolding Critical Thinking in AI-Assisted Writing Through Socratic Questioning

关键性批注:通过苏格拉底提问在AI辅助写作中培养批判性思维

Philipp Hugenroth, Valdemar Danry, Pattie Maes

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出Critical Inker工具,通过逻辑分析和苏格拉底反馈在写作中培养批判性思维,采用苏格拉底聊天机器人和视觉反馈两种方法,评估其论证提取和逻辑有效性准确率达91.2%和87%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06409 2026-04-09 cs.CR cs.AI cs.CL 62%

Say Something Else: Rethinking Contextual Privacy as Information Sufficiency

说点别的:重新思考上下文隐私作为信息充分性

Yunze Xiao, Wenkai Li, Xiaoyuan Wu, Ningshan Ma, Yueqi Song, Weihao Xuan

机构 * Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) University of Tokyo(东京大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出信息充分性任务,引入自由文本假名化策略,并设计对话评估协议,评估七种前沿LLM在隐私、隐蔽性和效用上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06176 2026-04-09 cs.IR cs.AI cs.CL 62%

Robustness Risk of Conversational Retrieval: Identifying and Mitigating Noise Sensitivity in Qwen3-Embedding Model

对话检索的鲁棒性风险:识别和缓解Qwen3-嵌入模型中的噪声敏感性

Weishu Chen, Zhouhui Hou, Mingjie Zhan, Zhicheng Zhao, Fei Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) SenseTime(商汤科技) Beijing Key Laboratory of Network System and Network Culture(网络系统与网络文化北京市重点实验室)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了基于嵌入的对话检索在现实场景中的鲁棒性问题,发现未提示查询时,结构化对话噪声易被检索,影响排名稳定性,提出轻量级查询提示可缓解此问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11703 2026-04-09 cs.LG 61%

EvoFlows: Evolutionary Edit-Based Flow-Matching for Protein Engineering

EvoFlows:基于进化编辑的蛋白质工程流匹配

Nicolas Deutschmann, Constance Ferragu, Jonathan D. Ziegler, Shayan Aziznejad, Eli Bixby

机构 * Cradle Zürich, CH(Cradle 苏黎世,瑞士)

专题命中 评测与基准 :language model(abstract);分类 cs.LG;foundation model(comments)

AI总结 EvoFlows通过编辑流学习蛋白质序列间的突变轨迹,实现可控的插入、删除和替换操作,生成与自然蛋白家族一致的变异体,优于现有方法。

Comments Accepted at Workshop on Foundation Models for Science: Real-World Impact and Science-First Design, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07101 2026-04-09 cs.CV cs.AI cs.MM eess.IV 57%

SurFITR: A Dataset for Surveillance Image Forgery Detection and Localisation

SurFITR:用于监控图像伪造检测与定位的数据集

Qizhou Wang, Guansong Pang, Christopher Leckie

机构 * The University of Melbourne(墨尔本大学) Singapore Management University(新加坡管理大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 SurFITR数据集旨在解决监控场景中伪造检测与定位的挑战,通过多模态LLM生成大量高质量伪造图像,提升检测模型在不同场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06997 2026-04-09 cs.CL 57%

ChunQiuTR: Time-Keyed Temporal Retrieval in Classical Chinese Annals

ChunQiuTR: 经典汉语编年史中的时间键检索

Yihao Wang, Zijian He, Jie Ren, Keze Wang

机构 * Sun Yat-Sen University(中山大学) Shaanxi Normal University(陕西师范大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出ChunQiuTR基准,通过编年史和注释传统构建,结合傅里叶绝对日历上下文与相对偏移偏差,提升时间键检索的准确性,支持历史RAG的忠实生成。

Comments 24 pages, 11 figures. To appear in Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06901 2026-04-09 cs.CE cs.AI cs.CV cs.CY cs.ET 57%

XR-CareerAssist: An Immersive Platform for Personalised Career Guidance Leveraging Extended Reality and Multimodal AI

XR-CareerAssist:一种结合扩展现实与多模态AI的沉浸式个性化职业指导平台

N. D. Tantaroudas, A. J. McCracken, I. Karachalios, E. Papatheou, V. Pastrikakis

机构 * Institute of Communications and Computer Systems (ICCS)(通信与计算机系统研究所) DASKALOS-APPS National Technical University of Athens(雅典国家技术大学) University of Exeter(埃克塞特大学) CVCOSMOS Ltd(CVCOSMOS有限公司)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出XR-CareerAssist平台,结合扩展现实与多模态AI,提供沉浸式、多语言的职业指导。系统整合语音识别、神经机器翻译、对话训练助手、视觉-语言模型和3D虚拟形象,通过动态Sankey图展示职业轨迹,实验显示高准确率和用户满意度。

Comments 21

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06552 2026-04-09 cs.CL 57%

To Lie or Not to Lie? Investigating The Biased Spread of Global Lies by LLMs

说谎还是不说谎?研究LLMs在全球谎言传播中的偏见

Zohaib Khan, Mustafa Dogan, Ifeoma Okoh, Pouya Sadeghi, Siddhartha Shrestha, Sergius Justus Nyah, Mahmoud O. Mokhiamar, Michael J. Ryan, Tarek Naous

机构 * Fatima Fellowship(法蒂玛奖学金) Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 研究LLMs在多语言多地区传播虚假信息的行为,揭示低资源语言和低HDI国家中谎言传播的系统性差异,提出GlobalLies数据集以支持减少全球虚假信息传播的策略。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06456 2026-04-09 cs.CL 57%

Context-Aware Dialectal Arabic Machine Translation with Interactive Region and Register Selection

具有交互区域和语域选择的上下文感知方言阿拉伯语机器翻译

Afroza Nowshin, Prithweeraj Acharjee Porag, Haziq Jeelani, Fayeq Jeelani Syed

机构 * University of Toledo(托莱多大学) Claremont Graduate University(克莱蒙特研究生大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出一种上下文感知的阿拉伯语方言机器翻译框架,通过规则基于的数据增强生成多区域语料,提升翻译输出的方言和语域可控性。

Comments 14 pages, 5 figures, 5 tables. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06392 2026-04-09 cs.AI cs.MA cs.SE 57%

Qualixar OS: A Universal Operating System for AI Agent Orchestration

Qualixar OS:面向AI代理编排的通用操作系统

Varun Pratap Bhardwaj

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 Qualixar OS是首个应用层操作系统,支持异构多代理系统,提供10个LLM供应商、8+代理框架和7种传输的完整运行时,包含12种多代理拓扑执行语义、LLM驱动的团队设计引擎、三层模型路由、共识判断管道、四层内容归属和通用兼容性等功能。

Comments 20 pages, 7 figures, 8 tables. Zenodo DOI: 10.5281/zenodo.19454219

URL PDF HTML 收藏
2604.06250 2026-04-09 cs.CV cs.AI 57%

DISSECT: Diagnosing Where Vision Ends and Language Priors Begin in Scientific VLMs

DISSECT:诊断视觉结束和语言先验开始的位置在科学视觉-语言模型中

Dikshant Kukreja, Kshitij Sah, Karan Goyal, Mukesh Mohania, Vikram Goyal

机构 * IIIT Delhi(德里印度理工学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 DISSECT通过12000个问题诊断科学VLMs中视觉与语言先验的界限,揭示了视觉信息提取与下游推理之间的差距,发现开源模型在自身描述推理中表现更优,而闭源模型无此差距,表明跨模态能力的前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏