arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-30 至 2026-03-30 共收录 201 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 27 篇

2603.26348 2026-03-30 cs.CV cs.AI 70%

Reflect to Inform: Boosting Multimodal Reasoning via Information-Gain-Driven Verification

反思以获取信息:通过信息增益驱动的验证提升多模态推理

Shuai Lv, Chang Liu, Feng Tang, Yujie Yuan, Aojun Zhou, Kui Zhang, Xi Yang, Yangqiu Song

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Foundation Model Department(华为基础模型部) The Chinese University of Hong Kong(香港中文大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出VRE框架,通过信息增益驱动的自我进化训练,提升多模态大语言模型的推理准确性和感知可靠性,减少幻觉,尤其在长链任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23610 2026-03-30 cs.AI 70%

Environment Maps: Structured Environmental Representations for Long-Horizon Agents

环境地图:面向长周期智能体的结构化环境表示

Yenchia Feng, Chirag Sharma, Karime Maamari

机构 * Distyl AI

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出环境地图,通过整合异构证据构建结构化图表示,提升长周期任务的鲁棒性。在WebArena基准上,环境地图使智能体成功率提升至28.2%,优于基线方法。

Comments 9 pages, 5 figures, accepted to ICLR 2026 the 2nd Workshop on World Models; updated formatting issue

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19669 2026-03-30 cs.AI 70%

HeaRT: A Hierarchical Circuit Reasoning Tree-Based Agentic Framework for AMS Design Optimization

HeaRT:一种基于分层电路推理树的代理框架用于AMS设计优化

Souradip Poddar, Chia-Tung Ho, Ziming Wei, Weidong Cao, Haoxing Ren, David Z. Pan

机构 * ECE Department, The University of Texas at Austin(德克萨斯大学奥斯汀分校电子与计算机工程系) NVIDIA Corporation(英伟达公司) The George Washington University(乔治华盛顿大学)

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 HeaRT提出了一种分层电路推理树的代理框架,通过提升F1(subcircuits)和F1(loops)指标,实现更高效的AMS设计优化,且在不同架构上表现出更好的适应性和收敛速度。

Comments Analog Design Automation, Hierarchical Circuit Reasoning, Context-Aware Design Adaptation, LLMs, Agentic Frameworks, Electronic Design Automation (EDA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26646 2026-03-30 cs.CV 67%

Beyond Language: Grounding Referring Expressions with Hand Pointing in Egocentric Vision

超越语言:基于手部指向的自我中心视觉指称表达定位

Ling Li, Bowen Liu, Zinuo Zhan, Peng Jie, Jianhui Zhong, Kenglun Chang, Zhidong Deng

机构 * Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Northwestern Polytechnical University(西北工业大学) Apple(苹果公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出EgoPoint-Ground数据集,通过手部指向与语音结合的指称机制,改进视觉指称表达的定位方法,并提出SV-CoT框架提升多模态理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26126 2026-03-30 cs.CV 67%

Beyond Where to Look: Trajectory-Guided Reinforcement Learning for Multimodal RLVR

超越寻找范围:用于多模态RLVR的轨迹引导强化学习

Jinda Lu, Junkang Wu, Jinghan Li, Kexin Huang, Shuo Yang, Mingzhu Chen, Jiancan Wu, Kuien Liu, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Pecking University(北京大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出轨迹引导强化学习(TGRL),通过专家推理轨迹引导策略模型整合视觉证据进行精细推理,提升多模态推理性能,弥合视觉感知与逻辑推理间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26541 2026-03-30 cs.CV 50%

OVI-MAP:Open-Vocabulary Instance-Semantic Mapping

OVI-MAP:开放词汇实例语义映射

Zilong Deng, Federico Tombari, Marc Pollefeys, Johanna Wald, Daniel Barath

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌) University of Zurich(苏黎世大学) TU Munich(慕尼黑工业大学) Microsoft(微软)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出OVI-MAP,通过解耦实例重建与语义推断,实现增量开放词汇3D实例语义映射,提升实时处理与零样本语义标注能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26322 2026-03-30 cs.RO 50%

DiffusionAnything: End-to-End In-context Diffusion Learning for Unified Navigation and Pre-Grasp Motion

DiffusionAnything: 端到端的上下文扩散学习用于统一导航和预抓取运动

Iana Zhura, Yara Mahmoud, Jeffrin Sam, Hung Khang Nguyen, Didar Seyidov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(斯科尔科沃科学技术学院数字工程中心智能空间机器人实验室)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出一种端到端的上下文扩散学习方法,通过多尺度特征调制实现统一的导航与精细操控,仅需5分钟自监督数据即可实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04428 2026-03-30 cs.CV 50%

A.I.R.: Enabling Adaptive, Iterative, and Reasoning-based Frame Selection For Video Question Answering

A.I.R.: 为视频问答实现适应性、迭代性和基于推理的帧选择

Yuanhao Zou, Shengji Jin, Andong Deng, Youpeng Zhao, Jun Wang, Chen Chen

机构 * University of Central Florida(中佛罗里达大学) Weill Cornell Medicine(威尔康奈尔医学院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出A.I.R方法,通过深度语义分析和高效迭代循环提升视频问答的帧选择效果,实验表明其在性能和计算效率上均优于现有方法。

Comments ICLR 2026 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10300 2026-03-30 cs.CV 50%

From Imitation to Intuition: Intrinsic Reasoning for Open-Instance Video Classification

从模仿到直觉:用于开放实例视频分类的内在推理

Ke Zhang, Xiangchen Zhao, Yunjie Tian, Jiayu Zheng, Vishal M. Patel, Di Fu

机构 * Johns Hopkins University(约翰霍普金斯大学) ByteDance Inc(字节跳动公司)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出DeepIntuit框架,通过冷启动监督对齐和GRPO优化,将视频分类从模仿转向直觉推理,提升开放实例分类性能。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 50 篇

2509.00841 2026-03-30 cs.CL 88%

Neural Models and Language Model Prompting for the Multidimensional Evaluation of Open-Ended Conversations

神经模型与语言模型提示用于开放式对话的多维评估

Michelle Elizabeth, Alicja Kasicka, Natalia Krawczyk, Magalie Ochs, Gwénolé Lecorvé, Justyna Gromada, Lina M. Rojas-Barahona

机构 * Orange Research(Orange研究院) Aix-Marseille University(艾克斯-马赛大学)

专题命中 评测与基准 :language model(title,abstract);prompting(title,abstract);分类 cs.CL

AI总结 本文提出通过对话系统技术挑战赛(DSTC-12 Track 1)开发模型,用于预测对话层面的维度特定评分。采用语言模型提示和编码器分类回归模型,尽管LM提示与人类判断相关性较低,但仍优于基线,回归模型在验证集上表现优异。

Comments This work was granted access to the HPC resources of IDRIS under the allocations AD011015150R1 made by GENCI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26105 2026-03-30 cs.LG 87%

Are LLM-Enhanced Graph Neural Networks Robust against Poisoning Attacks?

基于大语言模型的图神经网络是否对污染攻击具有鲁棒性?

Yuhang Ma, Jie Wang, Zheng Yan

机构 * State Key Laboratory of Integrated Services Networks, School of Cyber Engineering, Xidian University(西安电子科技大学网络与信息安全学院综合业务网理论及关键技术国家重点实验室) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文研究了大语言模型增强的图神经网络在面对污染攻击时的鲁棒性,通过系统评估框架评估了24种模型,分析了影响鲁棒性的关键因素,并提出了新的攻击方法和防御策略。

Comments To appear at 2026 IEEE Symposium on Security and Privacy (SP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20660 2026-03-30 cs.LG cs.AI cs.SE 86%

The Dual-State Architecture for Reliable LLM Agents

双状态架构用于可靠的LLM代理

Matthew Thompson

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出双状态动作对DSAP,通过结合随机生成与确定性后置条件验证,提升LLM代理在软件工程中的可靠性,实验表明在1.2-2.1倍基准成本下可靠性提升达66个百分点。

Comments 18 pages, 2 figures, 5 tables. V2 extends and supersedes V1, introducing tri-state guard semantics, a three-level recovery hierarchy, and SWE-Bench boundary analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12522 2026-03-30 cs.CL cs.AI cs.CY cs.HC 86%

LLM BiasScope: A Real-Time Bias Analysis Platform for Comparative LLM Evaluation

LLM BiasScope:一种用于比较LLM评估的实时偏见分析平台

Himel Ghosh, Nick Elias Werner

机构 * Technical University of Munich(慕尼黑工业大学) Sapienza University of Rome(罗马大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LLM BiasScope通过实时偏见分析帮助比较不同LLM模型的输出,支持多供应商模型对比,提供统计、可视化和偏见类型分析。

Comments Accepted at EACL 2026 (24-29 March, Morocco)

Journal ref Proceedings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26106 2026-03-30 cs.CL 85%

LLM Benchmark-User Need Misalignment for Climate Change

LLM基准-气候变化中的用户需求错位

Oucheng Liu, Lexing Xie, Jing Jiang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究揭示现有LLM基准与实际用户需求存在显著不匹配,提出主动知识行为框架和主题-意图-形式分类法,为基准设计、RAG系统开发和LLM训练提供指导。

Comments 37 pages (8 main), 31 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25791 2026-03-30 cs.CV 85%

ArtHOI: Taming Foundation Models for Monocular 4D Reconstruction of Hand-Articulated-Object Interactions

ArtHOI:通过基础模型驯化实现单目4D手-物体交互重建

Zikai Wang, Zhilu Zhang, Yiqing Wang, Hui Li, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出ArtHOI框架,通过整合多基础模型先验知识,解决单目视频中手-物体交互的4D重建问题,引入自适应采样细化和多模态大语言模型引导对齐方法,构建两个新数据集并验证方法有效性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26544 2026-03-30 cs.CL q-bio.QM 84%

Development of a European Union Time-Indexed Reference Dataset for Assessing the Performance of Signal Detection Methods in Pharmacovigilance using a Large Language Model

欧盟时间索引参考数据集的开发:利用大型语言模型评估药监信号检测方法性能

Maria Kefala, Jeffery L. Painter, Syed Tauhid Bukhari, Maurizio Sessa

机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系) GSK(葛兰素史克)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL

AI总结 本文开发了欧盟时间索引参考数据集,利用大型语言模型识别药品不良反应,以评估信号检测方法的性能,填补了药监领域的时间信息缺失空白。

Comments 4 Figures and 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20093 2026-03-30 cs.CL cs.AI 81%

Evaluating Neural Language Models as Cognitive Models of Language Acquisition

评估神经语言模型作为语言习得的认知模型

Héctor Javier Vázquez Martínez, Annika Lea Heuser, Charles Yang, Jordan Kodner

机构 * University of Pennsylvania(宾夕法尼亚大学) Stony Brook University(石溪大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文指出现有神经语言模型语法能力评估基准不够严谨,建议使用经过严格评估的语料库以更准确研究语言习得机制。

Comments To appear in the GenBench 2023 workshop proceedings, the first workshop on (benchmarking) generalisation in NLP. GenBench 2023 will be held at EMNLP 2023 on December 6, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26516 2026-03-30 cs.CL cs.AI cs.LG 80%

ALBA: A European Portuguese Benchmark for Evaluating Language and Linguistic Dimensions in Generative LLMs

ALBA:一个用于评估生成大语言模型中语言和语言学维度的欧洲葡萄牙语基准

Inês Vieira, Inês Calvo, Iago Paulo, James Furtado, Rafael Ferreira, Diogo Tavares, Diogo Glória-Silva, David Semedo, João Magalhães

机构 * NOVA University of Lisbon(新里斯本大学) NOVA LINCS(新里斯本大学计算机科学与系统研究实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ALBA是首个针对欧洲葡萄牙语的语言学评估基准,通过八个维度评估生成模型在语言多样性、文化绑定语义等任务中的表现,揭示了模型在不同语言学维度上的性能差异。

Comments PROPOR 2026 - The 17th International Conference on Computational Processing of Portuguese

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26611 2026-03-30 cs.LG stat.ME stat.ML 79%

Benchmarking Tabular Foundation Models for Conditional Density Estimation in Regression

对回归中条件密度估计的表格基础模型进行基准测试

Rafael Izbicki, Pedro L. C. Rodrigues

机构 * Department of Statistics, Federal University of São Carlos (UFSCar)(圣卡洛斯联邦大学统计系) Univ. Grenoble Alpes, Inria, CNRS, Grenoble INP, LJK(格勒诺布尔阿尔卑斯大学、法国国家信息与自动化研究所、法国国家科学研究中心、格勒诺布尔国立理工学院、让·库尔坦数学实验室)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文评估了三种表格基础模型变体在39个真实数据集上的条件密度估计性能,发现基础模型在大多数数据集上表现最佳,但校准在小样本时竞争,大样本时不如任务特定神经基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00262 2026-03-30 cs.CV cs.AI 79%

INSIGHT: Enhancing Autonomous Driving Safety through Vision-Language Models on Context-Aware Hazard Detection and Edge Case Evaluation

洞察:通过基于视觉-语言模型的上下文感知危险检测与边缘案例评估提升自动驾驶安全性

Dianwei Chen, Zifan Zhang, Lei Cheng, Yuchen Liu, Xianfeng Terry Yang

机构 * University of Maryland(马里兰大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出INSIGHT框架,通过多模态数据融合提升自动驾驶中危险检测和边缘案例评估的准确性和泛化能力,实验表明在BDD100K数据集上显著提高了危险预测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26015 2026-03-30 cs.CV cs.AI 79%

VLAgeBench: Benchmarking Large Vision-Language Models for Zero-Shot Human Age Estimation

VLAgeBench: 大视觉-语言模型在零样本人类年龄估计中的基准测试

Rakib Hossain Sajib, Md Kishor Morol, Rajan Das Gupta, Mohammad Sakib Mahmood, Shuvra Smaran Das

机构 * Begum Rokeya University, Rangpur(贝古姆·罗基亚大学,朗布尔) American International University - Bangladesh(美国国际大学-孟加拉国)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出VLAgeBench,评估大视觉-语言模型在零样本人类年龄估计中的性能,展示通用LVLM在无微调情况下表现优异,揭示图像质量和人口子群体差异对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23376 2026-03-30 cs.CV cs.RO 78%

ABot-PhysWorld: Interactive World Foundation Model for Robotic Manipulation with Physics Alignment

ABot-PhysWorld:用于机器人操作的交互世界基础模型,具有物理对齐

Yuzhi Chen, Ronghan Chen, Dongjie Huo, Yandan Yang, Dekang Qi, Haoyun Liu, Tong Lin, Shuang Zeng, Junjin Xiao, Xinyuan Chang, Feng Xiong, Xing Wei, Zhiheng Ma, Mu Xu

专题命中 评测与基准 :foundation model(title);post-training(abstract)

AI总结 ABot-PhysWorld通过物理对齐的交互世界模型,生成物理合理且可控的视频,解决了传统方法在物理仿真中的不足,通过新框架和基准测试提升了性能。

Comments Code: https://github.com/amap-cvlab/ABot-PhysWorld.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25933 2026-03-30 cs.HC 78%

Explore LLM-enabled Tools to Facilitate Imaginal Exposure Exercises for Social Anxiety

探索基于大语言模型的工具以促进社交焦虑的意象暴露练习

Yimeng Wang, Yinzhou Wang, Alicia Hong, Yixuan Zhang

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文探讨了基于大语言模型的工具在社交焦虑意象暴露练习中的可行性,通过与心理健康专业人员合作设计工具,并进行用户研究,验证了该工具在生成个性化暴露脚本方面的有效性及适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25802 2026-03-30 cs.CV 78%

LEMON: a foundation model for nuclear morphology in Computational Pathology

LEMON:计算病理学中核形态的基础模型

Loïc Chadoutaud, Alice Blondel, Hana Feki, Jacqueline Fontugne, Emmanuel Barillot, Thomas Walter

机构 * Institut Curie(居里研究所) Mines Paris PSL, Centre for Computational Biology (CBIO)(巴黎高科矿业学院计算生物学中心) INSERM, U1331(法国国家健康与医学研究院U1331) Institut Curie, U1353/UMR9029 IRIS, Equipe IMPACT(居里研究所U1353/UMR9029 IRIS IMPACT团队)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 LEMON通过大规模单细胞图像表示学习,为计算病理学提供新的范式,其在多种预测任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13592 2026-03-30 cs.CL 77%

Don't Stop the Multi-Party! On Generating Synthetic Written Multi-Party Conversations with Constraints

不要停止多方对话!通过约束生成合成的书面多方对话

Nicolò Penzo, Marco Guerini, Bruno Lepri, Goran Glavaš, Sara Tonelli

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨利用指令微调的大语言模型生成合成书面多方对话,通过确定性约束如对话结构和参与者立场,发现逐轮生成比一次性生成更符合约束且语言多样性更高。

Comments Accepted at AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26496 2026-03-30 cs.NI 75%

Innovation Discovery System for Networking Research

网络研究创新发现系统

Mengrui Zhang, Bang Huang, Yunxin Xu, Haiying Huang, Luxi Zhao, Mochun Long, Qingyu Song, Qiao Xiang, Xue Liu, Jiwu Shu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出SciNet,通过构建网络科研数据集、模拟人类创新流程和开发评估方法,生成实用且新颖的网络研究想法,优于传统LLM生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26512 2026-03-30 cs.AI 70%

CADSmith: Multi-Agent CAD Generation with Programmatic Geometric Validation

CADSmith: 基于程序化几何验证的多智能体CAD生成

Jesse Barkley, Rumi Loghmani, Amir Barati Farimani

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 CADSmith通过多智能体管道生成CadQuery代码,并通过双重嵌套修正循环进行迭代优化,结合精确测量和视觉评估提升CAD生成质量。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26156 2026-03-30 cs.CL cs.CY 70%

Clash of the models: Comparing performance of BERT-based variants for generic news frame detection

模型之争:比较基于BERT的变体在通用新闻框架检测中的性能

Vihang Jumle

机构 * University of Bern(伯尔尼大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文比较了BERT、RoBERTa、DeBERTa、DistilBERT和ALBERT在通用新闻框架检测中的性能,提出了多种经过微调的模型,并构建了一个基于瑞士选举语境的标注数据集以测试框架分析的上下文鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26122 2026-03-30 cs.CV cs.AI 70%

SkinGPT-X: A Self-Evolving Collaborative Multi-Agent System for Transparent and Trustworthy Dermatological Diagnosis

SkinGPT-X: 一种自演化协作多智能体系统用于透明和可信的皮肤病诊断

Zhangtianyi Chen, Yuhao Shen, Florensia Widjaja, Yan Xu, Liyuan Sun, Zijian Wang, Hongyi Chen, Wufei Dai, Juexiao Zhou

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Department of Dermatology, Tianjin Institute of Integrative Dermatology, Tianjin Academy of Traditional Chinese Medicine Affiliated Hospital(天津中医药大学附属医院天津市中西医结合皮肤病研究所皮肤科) Department of Dermatology, Beijing AnZhen Hospital, Capital Medical University(首都医科大学附属北京安贞医院皮肤科)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SkinGPT-X通过自演化皮肤病记忆机制,解决单一大语言模型在细粒度多类诊断和罕见皮肤病诊断中的不足,实现透明可信的皮肤病诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08316 2026-03-30 cs.SE cs.AI 70%

SWE Context Bench: A Benchmark for Context Learning in Coding

SWE Context Bench: 一个用于编码上下文学习的基准测试

Jared Zhu, Minhao Hu, Junde Wu

机构 * Independent Researcher(独立研究员) University of Oxford(牛津大学) University of Edinburgh(爱丁堡大学) Technical University of Munich(慕尼黑工业大学) MemoraX AI National University of Singapore(新加坡国立大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SWE-ContextBench基准,用于评估编程代理的上下文重用能力,通过1100个基础任务和376个相关任务,从GitHub问题和拉取请求中挖掘真实依赖关系,评估预测准确度、时间效率和成本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏