arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-25 至 2026-03-25 共收录 246 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 66 篇

2412.05430 2026-03-25 cs.LG q-bio.GN 79%

DART-Eval: A Comprehensive DNA Language Model Evaluation Benchmark on Regulatory DNA

DART-Eval: 一个全面的DNA语言模型评估基准,针对调控DNA

Aman Patel, Arpita Singhal, Austin Wang, Anusri Pampari, Maya Kasowski, Anshul Kundaje

机构 * Department of Computer Science, School of Engineering, Stanford University(计算机科学系,工程学院,斯坦福大学) Department of Genetics, School of Medicine, Stanford University(遗传学系,医学院,斯坦福大学) Department of Pathology, School of Medicine, Stanford University(病理学系,医学院,斯坦福大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本文提出DART-Eval基准,用于评估DNALM在零样本、 probing和微调场景下的性能,针对调控DNA的关键下游任务,发现现有模型表现不一致且计算资源消耗大。

Comments NeurIPS Datasets and Benchmarks 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22321 2026-03-25 cs.CV cs.AI cs.CL 79%

From Instructions to Assistance: a Dataset Aligning Instruction Manuals with Assembly Videos for Evaluating Multimodal LLMs

从指令到协助:一个对齐指令手册与装配视频的数据集用于评估多模态大语言模型

Federico Toschi, Nicolò Brunello, Andrea Sassella, Vincenzo Scotti, Mark James Carman

机构 * DEIB, Politecnico di Milano(米兰理工大学DEIB学院) KASTEL, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院KASTEL研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出M2AD数据集,用于评估多模态大语言模型在技术任务中的协助能力,探讨其推理、步骤跟踪和指令引用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23125 2026-03-25 cs.IR 78%

From Questions to Trust Reports: A LLM-IR Framework for the TREC 2025 DRAGUN Track

从问题到信任报告:一种用于TREC 2025 DRAGUN赛道的LLM-IR框架

Ignacy Alwasiak, Kene Nnolim, Jaclyn Thi, Samy Ateia, Markus Bink, Gregor Donabauer, David Elsweiler, Udo Kruschwitz

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出一种结合LLM生成问题与语义过滤的框架,用于生成信任报告,通过改进检索和重排序提升相关性和可信度。

Comments TREC 2025 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22822 2026-03-25 cs.HC 78%

"Don't Look, But I Know You Do": Norms and Observer Effects in Shared LLM Accounts

不要看,但我知道你会看:共享LLM账户中的规范与观察者效应

Ji Eun Song, Eunchae Lee, Juhee Im, Hyunsoo Jang, Eunji Kim, Joongseek Lee

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究探讨了LLM订阅账户的共享方式及形成的规范,通过调查和访谈分析四种共享类型,并揭示用户在隐私问题上的微妙行为调整,提出适应多用户需求的设计建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23172 2026-03-25 cs.CL 77%

From Synthetic to Native: Benchmarking Multilingual Intent Classification in Logistics Customer Service

从合成到原生:物流客户服务中多语言意图分类的基准测试

Haoyu He, Jinyu Zhuang, Haoran Chu, Shuhang Yu, J, T AI Group, Hao Wang, Kunpeng Han

机构 * School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) J&T Express(J&T快递)

专题命中 评测与基准 :LLM(abstract);language model(abstract);small language model(abstract);分类 cs.CL

AI总结 本文提出一个基于真实物流客户服务日志的多语言意图分类基准,包含3万条去标识用户查询,涵盖英语、西班牙语、阿拉伯语及零样本语言,通过对比合成与真实数据测试,揭示现有基准对真实场景的过度乐观估计问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22576 2026-03-25 cs.CL 77%

CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context

CAPITU:一个评估巴西葡萄牙语指令遵循能力的基准,具有文学背景

Giovana Kerche Bonás, Roseval Malaquias Junior, Marcos Piau, Thiago Laitz, Thales Sales Almeida, Hugo Abonizio, Celio Larcher, Ramon Pires, Rodrigo Nogueira

机构 * Maritaca AI Jusbrasil

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CAPITU基准通过八部巴西文学经典作品背景,结合可验证指令约束与文化内容,评估LLM在巴西葡萄牙语中的指令遵循能力,测试18种前沿模型,揭示多轮对话中约束持久性差异及形态学约束等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03147 2026-03-25 cs.AI 77%

Agentic AI-based Coverage Closure for Formal Verification

基于代理AI的正式验证覆盖闭合

Sivaram Pothireddypalli, Ashish Raman, Deepak Narayan Gadde, Aman Kumar

机构 * 1 Infineon Technologies India Private Limited, India 2 Dr. B R Ambedkar National Institute of Technology Jalandhar, India 3 Infineon Technologies Dresden AG \& Co. KG, Germany

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于代理AI的工作流,利用大语言模型驱动生成AI自动分析正式验证覆盖,识别覆盖缺口并生成所需形式属性,提升验证效率。

Comments To appear at the IEEE International Conference on Intelligent Processing, Hardware, Electronics, and Radio Systems (CIPHER), February 13-15, 2026, NIT Jalandhar, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23276 2026-03-25 cs.AI 77%

CXReasonAgent: Evidence-Grounded Diagnostic Reasoning Agent for Chest X-rays

CXReasonAgent:基于证据的胸部X光诊断推理代理

Hyungyung Lee, Hangyul Yoon, Edward Choi

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CXReasonAgent,结合大语言模型和临床诊断工具,通过图像生成的诊断和视觉证据进行证据导向的诊断推理,展示了其在多轮对话基准测试中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18858 2026-03-25 cs.LG cs.AI 76%

Representational Homomorphism Predicts and Improves Compositional Generalization In Transformer Language Model

表示同构性预测并改进变换器语言模型的组合泛化能力

Zhiyu An, Wan Du

机构 * University of California, Merced(加州大学默塞德分校)

专题命中 评测与基准 :language model(title);分类 cs.AI、cs.LG

AI总结 本文提出同构误差(HE)作为衡量模型组合泛化能力的指标,并通过实验表明在训练中降低HE能提升模型在噪声下的泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22860 2026-03-25 cs.SI 75%

Who Sits Where? Automated Detection of Director Interlocks in Indian Companies

谁坐在哪里?印度公司的董事交叉任职自动检测

Prateek Sancheti, Kamalakar Karlapalem, Kavita Vemuri

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种可扩展的图论框架,用于系统识别和分析董事交叉任职,利用BFS和LLM检测董事-公司集群,揭示潜在的网络驱动因素,提升自动检测复杂企业关系的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03405 2026-03-25 cs.CV 75%

ViDiC: Video Difference Captioning

ViDiC:视频差异描述

Jiangtao Wu, Shihao Li, Zhaozhou Bian, Jialu Chen, Runzhe Wen, An Ping, Yiwen He, Jiakai Wang, Yuanxing Zhang, Jiaheng Liu

机构 * NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) Kling Team, Kuaishou Technology(快手科技Kling团队)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出ViDiC任务及ViDiC-1K数据集,旨在评估多模态大语言模型对视频对相似性与差异性的细粒度描述能力,揭示现有模型在比较描述和差异感知上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22968 2026-03-25 cs.CR cs.CL 70%

Beyond Theoretical Bounds: Empirical Privacy Loss Calibration for Text Rewriting Under Local Differential Privacy

突破理论界限:在局部差分隐私下文本重写中的经验隐私损失校准

Weijun Li, Arnaud Grivet Sébert, Qiongkai Xu, Annabelle McIver, Mark Dras

机构 * School of Computing, FSE, Macquarie University(麦考瑞大学计算学院,FSE)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨在局部差分隐私下文本重写机制的实证校准方法,提出TeDA框架,通过假设检验框架评估隐私化文本的可区分性,提供更可靠的隐私-效用权衡评估工具。

Comments 22 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22820 2026-03-25 cs.CL 70%

RadTimeline: Timeline Summarization for Longitudinal Radiological Lung Findings

RadTimeline:纵向放射学肺部发现的时间线摘要

Sitong Zhou, Meliha Yetisgen, Mari Ostendorf

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出RadTimeline时间线摘要任务,通过生成时间线来总结纵向放射学报告,提升疾病进展识别效率。实验表明,分组名称生成对发现分组至关重要,最佳配置在召回率和分组性能上接近人工标注。

Comments Accepted at Language Resources and Evaluation Conference (LREC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22497 2026-03-25 cs.CL 70%

Rashid: A Cipher-Based Framework for Exploring In-Context Language Learning

Rashid:一种基于密码的探索上下文语言学习框架

Niyati Bafna, Ryan Soh-Eun Shim, Barbara Plank, David Yarowsky, Hale Sirin

机构 * Johns Hopkins University, Center for Language and Speech Processing(约翰霍普金斯大学语言与语音处理中心) MaiNLP, Center for Information and Language Processing, LMU Munich(MaiNLP语言信息处理中心,慕尼黑大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Rashid框架通过密码高资源语言构造真正未见语言,评估ICLL方法,探索昂贵资源对ICLL的提升,并测试超出机器翻译的下游任务,揭示ICLL的潜力与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21597 2026-03-25 cs.AI cs.CV 70%

Cerebra: A Multidisciplinary AI Board for Multimodal Dementia Characterization and Risk Assessment

Cerebra:一个多学科AI平台用于多模态痴呆症特征化和风险评估

Sheng Liu, Long Chen, Zeyun Zhao, Qinglin Gou, Qingyue Wei, Arjun Masurkar, Kevin M. Spiegler, Philip Kuball, Stefania C. Bray, Megan Bernath, Deanna R. Willis, Jiang Bian, Lei Xing, Eric Topol, Kyunghyun Cho, Yu Huang, Ruogu Fang, Narges Razavian, James Zou

机构 * Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Department of Radiation Oncology, Stanford University(斯坦福大学放射肿瘤科) Center for Data Science, New York University(纽约大学数据科学中心) J. Crayton Pruitt Family Department of Biomedical Engineering, University of Florida(佛罗里达大学杰·克雷顿·普瑞特家庭生物医学工程系) Department of Biomedical Engineering and Informatics, Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校生物医学工程与信息学系) Department of Neurology, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院神经科) Department of Neuroscience, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院神经科学系) UF Health Family Medicine – Haile Plantation(佛罗里达大学健康家庭医学-海莱种植园) Department of Family Medicine, Indiana University School of Medicine(印第安纳大学医学院家庭医学系) Department of Biostatistics and Health Data Science, Indiana University School of Medicine(印第安纳大学医学院生物统计学与健康数据科学系) Scripps Research Translational Institute(斯克里普斯研究转化研究所) Courant Institute, New York University(纽约大学柯朗研究所) Center for Biomedical Informatics, Regenstrief Institute(再生斯蒂夫研究所生物医学信息中心) Center for Cognitive Aging and Memory, McKnight Brain Institute, University of Florida(佛罗里达大学麦金托神经研究所认知衰老与记忆中心) Population Health Department, NYU Langone Health(纽约大学兰戈恩健康人口健康部) Radiology Department, NYU Langone Health(纽约大学兰戈恩健康放射科)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 Cerebra通过多智能体协调处理电子病历、临床笔记和医学影像,提供可视化分析和对话界面,提升临床决策支持的可解释性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22983 2026-03-25 cs.AI cs.CR 70%

Obscure but Effective: Classical Chinese Jailbreak Prompt Optimization via Bio-Inspired Search

晦涩但有效的:基于生物启发搜索的古典中文 Jailbreak 提示优化

Xun Huang, Simeng Qin, Xiaoshuang Jia, Ranjie Duan, Huanqian Yan, Zhitao Zeng, Fei Yang, Yang Liu, Xiaojun Jia

机构 * Nanyang Technological University(南洋理工大学) BraneMatrix AI Nanjing University of Science and Technology(南京理工大学) Northeast University(东北大学) Renmin University of China(中国人民大学) Alibaba Group(阿里巴巴集团) Beihang University(北航) National University of Singapore(新加坡国立大学) Zhejiang Lab(浙江实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出 CC-BOS 框架,利用多维果蝇优化算法生成古典中文对抗提示,提升黑盒 Jailbreak 攻击效果,通过八维政策维度迭代优化,实验表明其优于现有方法。

Comments ICLR 2026 Poster The source code relevant to this article has now been open-sourced; for details, please visit: https://github.com/xunhuang123/CC-BOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11488 2026-03-25 cs.CL cs.SD eess.AS 70%

When Audio-LLMs Don't Listen: A Cross-Linguistic Study of Modality Arbitration

当音频大模型不听:一种跨语言的模态仲裁研究

Jayadev Billa

机构 * San Jose, CA, USA(美国加州圣何塞) Yahoo(雅虎) Nuance(Nuance公司) BBN(BBN公司)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL

AI总结 研究发现音频与文本冲突时,语言模型更倾向于遵循文本而非音频,通过ALME数据集和TDR指标揭示模态仲裁中的信息内容与仲裁易用性差异。

Comments 13 pages, 18 tables, 4 figures, benchmark and code at https://github.com/jb1999/alme-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16173 2026-03-25 cs.CL 70%

In Generative AI We (Dis)Trust? Computational Analysis of Trust and Distrust in Reddit Discussions

在生成AI中我们(不)信任?对Reddit讨论中信任与不信任的计算分析

Aria Pessianzadeh, Naima Sultana, Hildegarde Van den Bulck, David Gefen, Shahin Jabbari, Rezvaneh Rezapour

机构 * Drexel University(德雷塞尔大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过多年Reddit数据集研究生成AI的信任与不信任,发现信任与不信任基本平衡,技术性能和可用性是主要影响因素,为大规模信任分析提供方法论框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00415 2026-03-25 cs.AI 70%

Towards Self-Evolving Benchmarks: Synthesizing Agent Trajectories via Test-Time Exploration under Validate-by-Reproduce Paradigm

迈向自演化基准:通过验证-再生产范式下的测试时间探索合成代理轨迹

Dadi Guo, Tianyi Zhou, Dongrui Liu, Chen Qian, Qihan Ren, Shuai Shao, Zhiyuan Fan, Yi R. Fung, Kun Wang, Linfeng Zhang, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Hong Kong University of Science and Technology(香港科技大学) University of Michigan(密歇根大学) Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出TRACE框架,通过测试时间探索使代理在原有任务基础上自演化更复杂的任务,提升基准的动态性和可靠性,适应并改进了AIME-2024等推理数据集。

Comments This is a work in progress due to methodology refinement and further evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05036 2026-03-25 cs.HC cs.AI 70%

Mapping the Challenges of HCI: An Application and Evaluation of ChatGPT for Mining Insights at Scale

映射人机交互的挑战:利用ChatGPT进行大规模洞察挖掘的应用与评估

Jonas Oppenlaender, Joonas Hämäläinen

机构 * University of Oulu, Center for Applied Computing, Faculty of Information Technology and Electrical Engineering(奥卢大学,应用计算中心,信息科技与电气工程学院) University of Jyväskylä, Software and Communications Engineering, Faculty of Information Technology(耶夫尼耶斯基大学,软件与通信工程,信息科技学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估ChatGPT在从大规模人机交互文献中提取研究挑战的应用,通过两步法提取并筛选挑战,发现与伦理和可及性等领域的强关联,以及人机协作等领域的不足,验证了LLM在大规模定性分析中的实用性。

Comments Accepted in International Journal of Human-Computer Interaction; 45 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23132 2026-03-25 cs.CV 67%

InterDyad: Interactive Dyadic Speech-to-Video Generation by Querying Intermediate Visual Guidance

InterDyad:通过查询中间视觉指导实现交互式双人语音到视频生成

Dongwei Pan, Longwei Guo, Jiazhi Guan, Luying Huang, Yiding Li, Haojie Liu, Haocheng Feng, Wei He, Kaisiyuan Wang, Hang Zhou

机构 * Baidu Inc.(百度公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出InterDyad框架,通过查询结构运动指导实现自然交互动态合成,解决双人场景中跨个体依赖和精细行为控制问题,提出交互性注入器、元查询模态对齐机制和角色感知双人高斯指导等方法,提升唇形同步和空间一致性。

Comments Project Page: https://interdyad.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22756 2026-03-25 cs.CV 67%

MVPBench: A Multi-Video Perception Evaluation Benchmark for Multi-Modal Video Understanding

MVPBench: 一个多视频感知评估基准用于多模态视频理解

Purui Bai, Tao Wu, Jiayang Sun, Xinyue Liu, Huaibo Huang, Ran He

机构 * MAIS \& NLPR, Institute of Automation Chinese Academy of Sciences Beijing, China SIST ShanghaiTech University Shanghai, China

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 MVPBench通过14个跨多样本域的子任务评估模型从视频序列中提取相关信息的能力,揭示当前模型在多视频处理上的局限性。

Comments 15 pages, 7 figures, accepted by IJCNN 2026, code and dataset available at https://github.com/MVPBench/MVPBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08174 2026-03-25 cs.CV 67%

MERLIN: Building Low-SNR Robust Multimodal LLMs for Electromagnetic Signals

MERLIN:构建低信噪比鲁棒的多模态大语言模型以电磁信号

Junyu Shen, Zhendong She, Chenghanyu Zhang, Yuchuang Sun, Luqing Luo, Dingwei Tan, Zonghao Guo, Bo Guo, Zehua Han, Wupeng Xie, Yaxin Mu, Peng Zhang, Peipei Li, Fengxiang Wang, Yangang Sun, Maosong Sun

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tianjin University(天津大学) Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院微电子研究所) HKUST (Guangzhou)(香港科技大学(广州)) National University of Defense Technology(国防科技大学) Beihang University(北航) Beijing Information Science and Technology University(北京信息科技大学) Artificial Intelligence Institute of China Electronics Technology Group Corporation(中国电子科技集团人工智能研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出MERLIN框架,通过构建EM-100k数据集和EM-Bench基准,解决电磁信号多模态大语言模型在低信噪比环境下的鲁棒性问题,验证了方法在EM-Bench上的领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06033 2026-03-25 cs.CR econ.GN q-fin.EC 67%

Sell Data to AI Algorithms Without Revealing It: Secure Data Valuation and Sharing via Homomorphic Encryption

将数据出售给AI算法而不揭露它:通过同态加密实现安全的数据估值与分享

Michael Yang, Ruijiang Gao, Zhiqiang Zheng

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出Trustworthy Influence Protocol,利用同态加密和梯度影响函数,在不解密数据的情况下评估外部数据的效用,验证了其在医疗和生成AI领域的经济潜力,挑战了现有定价模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22529 2026-03-25 cs.CV cs.AI cs.CL 62%

Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos

Ego2Web:一种基于第一人称视频的网络代理基准测试

Shoubin Yu, Lei Shu, Antoine Yang, Yao Fu, Srinivas Sunkara, Maria Wang, Jindong Chen, Mohit Bansal, Boqing Gong

机构 * Google DeepMind(谷歌DeepMind) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 Ego2Web通过结合真实世界第一人称视频与网络任务,解决网络代理在现实物理环境中的感知问题,提出LLM-as-a-Judge评估方法,揭示当前代理在视觉理解和任务规划上的不足。

Comments CVPR 2026. Project page: https://ego2web.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22309 2026-03-25 cs.LG cs.AI 62%

UniFluids: Unified Neural Operator Learning with Conditional Flow-matching

UniFluids: 基于条件流匹配的统一神经算子学习

Haosen Li, Qi Meng, Jiahao Li, Rui Zhang, Ruihua Song, Liang Ma, Zhi-Ming Ma

机构 * Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Microsoft Research Asia(微软亚洲研究院) Renmin University of China(中国人民大学) Institute of Zoology, Chinese Academy of Sciences(中国科学院动物研究所)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出UniFluids框架,利用扩散Transformer的可扩展性,统一学习不同维度和物理变量的PDE解算子,通过四维时空表示实现联合训练与条件编码,提升预测精度与泛化能力。

Comments Preprint version. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23311 2026-03-25 cs.CV cs.LG 57%

ARGENT: Adaptive Hierarchical Image-Text Representations

ARGENT:自适应层次图像-文本表示

Chuong Huynh, Hossein Souri, Abhinav Kumar, Vitali Petsiuk, Deen Dayal Mohan, Suren Kumar

机构 * University of Maryland, College Park(马里兰大学 College Park分校) Samsung Research America, AI Center(三星美国研究院人工智能中心)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 ARGENT通过自适应蕴含损失和规范正则化解决超几何VLM的层级结构问题,引入角度基于的概率蕴含协议评估层次理解,提升图像分类、文本到图像检索及层次指标性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20534 2026-03-25 cs.SE cs.AI 57%

An Industrial-Scale Retrieval-Augmented Generation Framework for Requirements Engineering: Empirical Evaluation with Automotive Manufacturing Data

面向工业规模的检索增强生成框架用于需求工程:基于汽车制造数据的实证评估

Muhammad Khalid, Yilmaz Uygun

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出一个工业级检索增强生成框架,用于需求工程自动化,通过实证评估展示其在提高提取准确性和减少人工分析时间方面的优势。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22985 2026-03-25 cs.CL cs.CY 57%

Beyond Hate: Differentiating Uncivil and Intolerant Speech in Multimodal Content Moderation

超越仇恨:区分多模态内容审核中的不文明与不宽容言论

Nils A. Herrmann, Tobias Eder, Jingyi He, Georg Groh

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出细粒度标注方案区分不文明与不宽容言论,通过2030个仇恨漫画数据验证,细粒度标注提升模型性能,减少有害内容误判。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22738 2026-03-25 cs.LG 57%

Multitask-Informed Prior for In-Context Learning on Tabular Data: Application to Steel Property Prediction

多任务感知先验用于表格数据上下文学习:应用于钢材性能预测

Dimitrios Sinodinos, Bahareh Nikpour, Jack Yi Wei, Sushant Sinha, Xiaoping Ma, Kashif Rehman, Stephen Yue, Narges Armanfard

机构 * Dep. of Electrical and Computer Engineering, McGill University(麦吉尔大学电气与计算机工程系) Mila – Québec AI Institute(魁北克AI研究所) Dep. of Mining and Materials Engineering, McGill University(麦吉尔大学采矿与材料工程系) Algoma Steel Inc.(阿尔戈马钢铁公司)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文提出多任务学习框架,通过改进TabPFN模型的先验,提升钢材性能预测的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏