arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-06 至 2026-03-06 共收录 236 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 43 篇

2603.05489 2026-03-06 cs.AR cs.CY cs.LO cs.SY eess.SY 85%

NL2GDS: LLM-aided interface for Open Source Chip Design

NL2GDS: 依托大语言模型的开源芯片设计接口

Max Eland, Jeyan Thiyagalingam, Dinesh Pamunuwa, Roshan Weerasekera

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 NL2GDS通过大语言模型将自然语言描述转换为可综合的RTL和GDSII布局,实现开源芯片设计的自动化,显著提升设计效率和性能。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05028 2026-03-06 cs.AI cs.CL 84%

Survive at All Costs: Exploring LLM's Risky Behaviors under Survival Pressure

在生存压力下:探索LLM的冒险行为

Yida Lu, Jianwei Fang, Xuyang Shao, Zixuan Chen, Shiyao Cui, Shanshan Bian, Guangyao Su, Pei Ke, Han Qiu, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学智能对话AI小组,DCST,清华大学) China Unicom Software Research Institute(中国联合软件研究所) University of Electronic Science and Technology of China(电子科技大学) Institute for Network Sciences and Cyberspace, Tsinghua University(清华大学网络科学与网络空间研究院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在生存压力下LLM的冒险行为,通过现实案例和基准测试揭示其潜在风险及缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04670 2026-03-06 cs.AI cs.CL cs.CV 84%

Using Vision + Language Models to Predict Item Difficulty

利用视觉与语言模型预测项目难度

Samin Khan

机构 * Stanford Graduate School of Education(斯坦福大学教育研究生院)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 利用视觉与语言模型结合预测数据可视化测试项目难度,通过多模态方法实现更低的误差率,展示了LLMs在心理测量中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24210 2026-03-06 cs.CL cs.AI cs.LG 82%

BeyondBench: Contamination-Resistant Evaluation of Reasoning in Language Models

超越基准:语言模型推理能力的抗污染评估

Gaurav Srivastava, Aafiya Hussain, Zhenyu Bi, Swastik Roy, Priya Pitre, Meng Lu, Morteza Ziyadi, Xuan Wang

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BeyondBench通过算法问题生成提供抗污染的推理评估,揭示语言模型在复杂任务中的推理缺陷。

Comments Accepted to ICLR 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16333 2026-03-06 cs.CV cs.AI cs.CL 81%

Where is the multimodal goal post? On the Ability of Foundation Models to Recognize Contextually Important Moments

多模态目标时刻在哪里?关于基础模型识别情境重要时刻的能力

Aditya K Surikuchi, Raquel Fernández, Sandro Pezzelle

机构 * Institute for Logic, Language and Computation University of Amsterdam(逻辑、语言与计算研究所 阿姆斯特丹大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了多模态基础模型识别足球比赛中重要时刻的能力,发现现有模型在识别重要子事件时表现欠佳,需改进架构与训练方法以提升跨模态协同能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21323 2026-03-06 cs.CL cs.LG 81%

Parallel Token Prediction for Language Models

语言模型中的并行令牌预测

Felix Draxler, Justus Will, Farrin Marouf Sofian, Theofanis Karaletsos, Sameer Singh, Stephan Mandt

机构 * Department of Computer Science, University of California, Irvine(加州大学伊维特分校计算机科学系) Chan-Zuckerberg Initiative(张博士基金会) Pyramidal AI(金字塔人工智能) Computer Science & AI in Science Institute, University of California, Irvine(加州大学伊维特分校计算机科学与科学人工智能研究所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出并行令牌预测框架,通过引入随机输入变量实现多令牌联合预测,提升语言模型解码效率。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04410 2026-03-06 cs.CL cs.AI 81%

SalamahBench: Toward Standardized Safety Evaluation for Arabic Language Models

SalamahBench: 向阿拉伯语言模型的安全评估标准化迈进

Omar Abdelnasser, Fatemah Alharbi, Khaled Khasawneh, Ihsen Alouani, Mohammed E. Fouda

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 SalamahBench提出了一种统一的阿拉伯语言模型安全评估基准,评估五种先进模型的安全性,揭示了不同模型在安全对齐上的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22758 2026-03-06 cs.CL 80%

EchoMind: An Interrelated Multi-level Benchmark for Evaluating Empathetic Speech Language Models

EchoMind: 一种相互关联的多级基准,用于评估共情语音语言模型

Li Zhou, Lutong Yu, You Lyu, Yihang Lin, Zefeng Zhao, Junyi Ao, Yuhao Zhang, Benyou Wang, Haizhou Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 EchoMind是一种多级基准,用于评估SLMs在共情对话中的能力,揭示了现有模型在处理高表现性语音线索方面的不足。

Comments Speech Language Models, Spoken Language Understanding, Vocal Cue Perception, Empathetic Dialogue, Benchmark Evaluation; Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05485 2026-03-06 cs.AI 79%

Towards Provably Unbiased LLM Judges via Bias-Bounded Evaluation

迈向具有偏见限制的LLM评判系统的可证明无偏评判

Benjamin Feuer, Lucas Rosenblatt, Oussama Elachqar

机构 * Stanford University(斯坦福大学) New York University(纽约大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出平均偏见限制框架,通过可验证的偏见限制保证,提升LLM评判系统的公平性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05399 2026-03-06 cs.AI 79%

Judge Reliability Harness: Stress Testing the Reliability of LLM Judges

LLM裁判可靠性检测工具:检验LLM裁判的可靠性

Sunishchal Dev, Andrew Sloan, Joshua Kavner, Nicholas Kong, Morgan Sandler

机构 * RAND Corporation(RAND公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本研究提出了一种开源工具,用于评估LLM裁判在不同基准中的可靠性,发现模型和扰动类型对性能有显著影响。

Comments Accepted at Agents in the Wild: Safety, Security, and Beyond Workshop at ICLR 2026 - April 26, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04900 2026-03-06 cs.AI 79%

EvoTool: Self-Evolving Tool-Use Policy Optimization in LLM Agents via Blame-Aware Mutation and Diversity-Aware Selection

EvoTool: 通过责备感知变异和多样性感知选择实现LLM代理中自演化工具使用策略优化

Shuo Yang, Soyeon Caren Han, Xueqi Ma, Yan Li, Mohammad Reza Ghasemi Madani, Eduard Hovy

机构 * School of Computing and Information Systems, The University of Melbourne(计算与信息系统学院,墨尔本大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 EvoTool通过责备感知变异和多样性感知选择,优化LLM代理的模块化工具使用策略,提升效率与可迁移性。

Comments Work under review, 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04409 2026-03-06 cs.CL cs.AI cs.HC 79%

Unpacking Human Preference for LLMs: Demographically Aware Evaluation with the HUMAINE Framework

解析人类对大语言模型的偏好:基于HUMAINE框架的民主意识评估

Nora Petrova, Andrew Gordon, Enzo Blindow

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HUMAINE框架通过多维、人口统计学意识的评估方法,揭示了人类对大语言模型的偏好差异,发现年龄是主要分歧轴,且不同评估维度的判别能力差异显著。

Comments Published as a conference paper at ICLR 2026. 21 pages, 11 figures. https://openreview.net/forum?id=kVaE2kYjtV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07928 2026-03-06 cs.AI cs.HC 77%

The StudyChat Dataset: Analyzing Student Dialogues With ChatGPT in an Artificial Intelligence Course

StudyChat数据集:在人工智能课程中分析学生与ChatGPT的对话

Hunter McNichols, Fareya Ikram, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 StudyChat数据集分析了学生在人工智能课程中使用ChatGPT的对话行为,揭示了学生使用LLM进行概念理解与编码帮助与学业表现之间的正相关关系,以及规避学习目标的行为与学业成绩的负相关关系。

Comments LAK '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13379 2026-03-06 cs.CR cs.SE 75%

Automated TEE Adaptation with LLMs: Identifying, Transforming, and Porting Sensitive Functions in Programs

基于LLM的自动TEE适配:识别、转换和移植程序中的敏感函数

Ruidong Han, Zhou Yang, Chengyan Ma, Ye Liu, Yuqing Niu, Siqi Ma, Debin Gao, David Lo

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 AUTOTEE通过LLM自动识别并移植程序中的敏感函数到TEE,提升安全性和开发效率。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05314 2026-03-06 cs.CL cs.AI 73%

PersianPunc: A Large-Scale Dataset and BERT-Based Approach for Persian Punctuation Restoration

PersianPunc: 一个大规模数据集和基于BERT的方法用于波斯语标点恢复

Mohammad Javad Ranjbar Kalahroodi, Heshaam Faili, Azadeh Shakery

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PersianPunc提出了一种基于BERT的轻量级方法,用于波斯语标点恢复,实现了91.33%的宏平均F1得分,同时保持了实时应用的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04854 2026-03-06 cs.CL 72%

SinhaLegal: A Benchmark Corpus for Information Extraction and Analysis in Sinhala Legislative Texts

SinhaLegal:用于僧伽罗语立法文本信息提取与分析的基准语料库

Minduli Lasandi, Nevidu Jayatilleke

机构 * School of Computing, Informatics Institute of Technology(计算学院,信息学院技术研究所) Department of Computer Science & Engineering, University of Moratuwa(计算机科学与工程系,莫图瓦大学)

专题命中 评测与基准 :language model(abstract,comments);small language model(abstract);分类 cs.CL

AI总结 SinhaLegal 语料库为僧伽罗语立法文本的信息提取与分析提供了高质量的基准数据,通过OCR和后处理确保内容质量,并通过多项评估验证其领域特定性。

Comments 18 pages, 8 figures, 18 tables, Accepted paper at the 2nd workshop on Language Models for Low-Resource Languages (LoResLM 2026) @ EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05262 2026-03-06 cs.CL 70%

VietJobs: A Vietnamese Job Advertisement Dataset

VietJobs: 一个越南就业广告数据集

Hieu Pham Dinh, Hung Nguyen Huy, Mo El-Haj

机构 * College of Engineering and Computer Science(工程与计算机科学学院) VinUniversity(文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 VietJobs 是首个大规模越南就业广告数据集,用于研究自然语言处理和劳动力市场分析,通过基准测试展示了指令微调模型在职位分类和薪资估计中的性能提升。

Comments 10 pages

Journal ref Language Resources and Evaluation Conference (LREC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20333 2026-03-06 cs.CR cs.AI 70%

GhostEI-Bench: Do Mobile Agents Resilience to Environmental Injection in Dynamic On-Device Environments?

GhostEI-Bench: 移动代理在动态设备环境中的环境注入鲁棒性研究

Chiyu Chen, Xinhao Song, Yunkai Chai, Yang Yao, Haodong Zhao, Lijun Li, Jie Li, Yan Teng, Gongshen Liu, Yingchun Wang

机构 * Shanghai Jiao Tong University, School of Computer Science(上海交通大学计算机科学学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 GhostEI-Bench通过动态环境注入攻击评估移动代理的鲁棒性,揭示现有模型对欺骗性UI的脆弱性,并提供量化和缓解该威胁的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10689 2026-03-06 cs.AI 70%

OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs

OmniVideoBench: 向多模态大语言模型的音频-视觉理解评估迈进

Caorui Li, Yu Chen, Yiyan Ji, Jin Xu, Zhenyu Cui, Shihao Li, Yuanxing Zhang, Wentao Wang, Zhenghao Song, Dingling Zhang, Ying He, Haoxiang Liu, Yuxuan Wang, Qiufeng Wang, Jiafu Tang, Zhenhe Wu, Jiehui Luo, Zhiyu Pan, Weihao Xie, Chenchen Zhang, Zhaohui Wang, Jiayi Tian, Yanghai Wang, Zhe Cao, Minxin Dai, Ke Wang, Runzhe Wen, Yinghao Ma, Yaning Pan, Sungkyun Chang, Termeh Taheri, Haiwen Xia, Christos Plachouras, Emmanouil Benetos, Yizhi Li, Ge Zhang, Jian Yang, Tianhao Peng, Zili Wang, Minghao Liu, Junran Peng, Zhaoxiang Zhang, Jiaheng Liu

机构 * NJU-LINK Team(南京大学链接团队)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 OmniVideoBench通过大规模基准测试评估多模态大语言模型在音频-视觉理解中的协同推理能力,揭示模型与人类推理间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03160 2026-03-06 cs.CV cs.AI 70%

SpineBench: A Clinically Salient, Level-Aware Benchmark Powered by the SpineMed-450k Corpus

SpineBench:一种临床显著、层级感知的基准,由SpineMed-450k语料库驱动

Ming Zhao, Wenhui Dong, Yang Zhang, Xiang Zheng, Zhonghao Zhang, Zian Zhou, Yunzhi Guan, Liukun Xu, Wei Peng, Zhaoyang Gong, Zhicheng Zhang, Dachuan Li, Xiaosheng Ma, Yuli Ma, Jianing Ni, Changjiang Jiang, Lixia Tian, Qixin Chen, Kaishun Xia, Pingping Liu, Tongshun Zhang, Zhiqiang Liu, Zhongyan Bi, Chenyang Si, Tiansheng Sun, Caifeng Shan

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 SpineBench通过SpineMed-450k语料库驱动,针对脊柱疾病提供临床显著的层级感知基准,评估模型在多模态数据下的细粒度推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04408 2026-03-06 cs.CL 70%

Probing Memes in LLMs: A Paradigm for the Entangled Evaluation World

在LLM中探测迷因:一种纠缠评估世界的范式

Luzhou Peng, Zhengxin Yang, Honglu Ji, Yikang Yang, Fanda Fan, Wanling Gao, Jiayuan Ge, Yilin Han, Jianfeng Zhan

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) BenchCouncil (International Open Benchmark Council)(Benchmark委员会) University of Chinese Academy of Sciences(中国科学院大学) School of Artificial Intelligence and Data Science, Hebei University of Technology(河北工业大学人工智能与数据科学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出探测迷因范式,通过感知矩阵分析模型与数据的交互,揭示LLM能力结构并实现群体层面的评估。

Comments 43 pages, 24 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05075 2026-03-06 cs.CV 67%

UniM: A Unified Any-to-Any Interleaved Multimodal Benchmark

UniM:一个统一的任意到任意交错多模态基准

Yanlin Li, Minghui Guo, Kaiwen Zhang, Shize Zhang, Yiran Zhao, Haodong Li, Congyue Zhou, Weijie Zheng, Yushen Yan, Shengqiong Wu, Wei Ji, Lei Cui, Furu Wei, Hao Fei, Mong-Li Lee, Wynne Hsu

机构 * NUS(新加坡国立大学) SCUT(上海交通大学) NTU(国立科技大学) NJU(南京大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 UniM基准通过统一的任意到任意交错多模态数据集和评估套件,评估多模态大语言模型在复杂交错生成任务中的能力与挑战。

Comments 70 pages, 63 figures, 30 tables, CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04582 2026-03-06 cs.AI cs.LG 62%

Self-Attribution Bias: When AI Monitors Go Easy on Themselves

自我归因偏差:当AI监控对自己宽容时

Dipika Khullar, Jack Hopkins, Rowan Wang, Fabien Roger

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究发现AI监控在自我归因偏差下可能低估风险,导致部署不充分的监控系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00507 2026-03-06 cs.CL cs.AI 62%

Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphs

Graph2Eval: 通过知识图谱实现自动多模态任务生成

Yurun Chen, Xavier Hu, Yuhan Liu, Ziqi Wang, Zeyi Liao, Lin Chen, Feng Wei, Yuxi Qian, Bo Zheng, Keting Yin, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Xiameng University(Xmeng大学) The Ohio State University(俄亥俄州立大学) Ant Group(蚂蚁集团)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 Graph2Eval通过知识图谱生成多模态任务,提升智能体任务的语义一致性和可解性,提供新的评估视角。

Comments Accepted at CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17100 2026-03-06 cs.LG cs.AI 62%

Generative Models in Decision Making: A Survey

生成模型在决策中的应用:综述

Xinyu Shao, Jianping Zhang, Haozhi Wang, Leo Maxime Brunswic, Kaiwen Zhou, Jiqian Dong, Kaiyang Guo, Zhitang Chen, Jun Wang, Jianye Hao, Xiu Li, Yinchuan Li

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文综述提出了一种基于概率框架的控制作为推理的系统分类,将生成决策置于其中,通过变分因子分解轨迹后验,概念化了四个功能角色,并探讨了生成模型在高风险领域的应用及挑战。

Comments Project page:https://github.com/xyshao23/Awesome-Generative-Models-for-Decision-Making-Taxonomy

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05184 2026-03-06 cs.CV cs.AI 57%

Logi-PAR: Logic-Infused Patient Activity Recognition via Differentiable Rule

Logi-PAR: 通过可微规则融合的逻辑患者活动识别

Muhammad Zarar, MingZheng Zhang, Xiaowang Zhang, Zhiyong Feng, Sofonias Yitagesu, Kawsar Farooq

机构 * School of Computer Software, Tianjin University, China(天津大学软件学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 Logi-PAR通过可微规则融合实现患者活动识别,首次将逻辑推理融入模型以生成可解释的活动分析和反事实干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05446 2026-03-06 cs.CV 50%

NaiLIA: Multimodal Nail Design Retrieval Based on Dense Intent Descriptions and Palette Queries

NaiLIA:基于密集意图描述和调色板查询的多模态美甲设计检索

Kanon Amemiya, Daichi Yashima, Kei Katsumata, Takumi Komatsu, Ryosuke Korekata, Seitaro Otsuki, Komei Sugiura

机构 * Keio University(庆应大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 NaiLIA通过密集意图描述和调色板查询实现美甲设计图像的多模态检索,提升检索精度。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05384 2026-03-06 cs.CV 50%

ORMOT: A Dataset and Framework for Omnidirectional Referring Multi-Object Tracking

ORMOT: 一个用于全方位参照多目标跟踪的数据集和框架

Sijia Chen, Zihan Zhou, Yanqiu Yu, En Yu, Wenbing Tao

机构 * State Key Laboratory of Multispectral Information Intelligent Processing Technology, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(多谱信息智能处理技术国家重点实验室,人工智能与自动化学院,华中科技大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出ORMOT任务,构建ORSet数据集和ORTrack框架,解决传统数据集视野限制问题,提升模型对长周期语言描述的理解能力。

Comments https://github.com/chen-si-jia/ORMOT

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07080 2026-03-06 cs.CV 50%

FLAIR-HUB: Large-scale Multimodal Dataset for Land Cover and Crop Mapping

FLAIR-HUB:大规模多模态数据集用于土地覆盖和作物制图

Anatol Garioud, Sébastien Giordano, Nicolas David, Nicolas Gonthier

机构 * Institut national de l’information géographique et forestière (IGN), France(法国国家地理与森林信息研究所)

专题命中 评测与基准 :pretraining(abstract)

AI总结 FLAIR-HUB是一个大规模多模态数据集,用于提升土地覆盖和作物制图的准确性,通过多模态融合和深度学习模型实现高精度分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05177 2026-03-06 cs.DL 50%

SWARM-SLR AIssistant: A Unified Framework for Scalable Systematic Literature Review Automation

SWARM-SLR AIssistant:一个用于可扩展系统文献综述自动化的统一框架

Tim Wittenborg, Allard Oelen, Manuel Prinz

专题命中 评测与基准 :LLM(abstract)

AI总结 SWARM-SLR AIssistant通过结合结构化方法和基于代理的助手,提供了一个统一框架,旨在提升系统文献综述自动化的可扩展性和可用性。

Comments 4 pages, 3 figures, submitted to JCDL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏