arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-10 至 2026-03-10 共收录 96 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 96 篇

2603.08704 2026-03-10 cs.AI 91%

Evaluating Financial Intelligence in Large Language Models: Benchmarking SuperInvesting AI with LLM Engines

评估大型语言模型的金融智能:用LLM引擎基准测试SuperInvesting AI

Akshay Gulati, Kanha Singhania, Tushar Banga, Parth Arora, Anshul Verma, Vaibhav Kumar Singh, Agyapal Digra, Jayant Singh Bisht, Danish Sharma, Varun Singla, Shubh Garg

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.AI

AI总结 本文提出AFIB基准测试,评估SuperInvesting等AI系统在金融分析中的性能,发现SuperInvesting在准确性、完整性和一致性方面表现最优。

Comments 12 pages, 6 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08275 2026-03-10 cs.CL cs.AI 90%

AdaCultureSafe: Adaptive Cultural Safety Grounded by Cultural Knowledge in Large Language Models

AdaCultureSafe: 基于文化知识的自适应文化安全大语言模型

Hankun Kang, Di Lin, Zhirong Liao, Pengfei Bai, Xinyi Zeng, Jiawei Jiang, Yuanyuan Zhu, Tieyun Qian

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 AdaCultureSafe通过整合文化知识与大语言模型,提升文化安全性和响应生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15701 2026-03-10 cs.AR cs.CL cs.LG 90%

HDLxGraph: Bridging Large Language Models and HDL Repositories via HDL Graph Databases

HDLxGraph: 通过HDL图数据库连接大型语言模型和HDL仓库

Pingqing Zheng, Jiayin Qin, Fuqi Zhang, Niraj Chitla, Zishen Wan, Shang Wu, Yu Cao, Caiwen Ding, Yang, Zhao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 HDLxGraph通过整合HDL图特性与RAG,提升LLM在HDL任务中的搜索、调试和完成准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12945 2026-03-10 cs.CL cs.LG 90%

A Component-Based Survey of Interactions between Large Language Models and Multi-Armed Bandits

基于组件的大型语言模型与多臂老虎机交互调研

Siguang Chen, Chunli Lv, Miao Xie

机构 * College of Information and Electrical Engineering, China Agricultural University, Beijing 100083, China(信息与电气工程学院,中国农业大学,北京) Key Laboratory of Agricultural Machinery Monitoring and Big Data Application, Ministry of Agriculture and Rural Affairs, Beijing 100083, China(农业机械监测与大数据应用重点实验室,农业农村部,北京)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文调研了大型语言模型与多臂老虎机在组件层面的双向交互,分析了两者在解决对方挑战中的协同作用及未来研究方向。

Comments 25 pages, 6 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10934 2026-03-10 cs.DB cs.LG 89%

Towards Practical Benchmarking of Data Cleaning Techniques: On Generating Authentic Errors via Large Language Models

面向数据清洗技术实用基准测试的探索:通过大语言模型生成真实错误

Xinyuan Liu, Jiahui Chen, Bocheng Hu, Yu Sun, Xinyang Chen, Shaoxu Song, Yongxin Tong

机构 * Nankai University(南开大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua University(清华大学) Beihang University(北京航空航天大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 TableEG利用大语言模型生成真实错误,通过三元组表示和表格微调策略,提升数据清洗技术的基准测试效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07792 2026-03-10 cs.CL cs.AI cs.CY 88%

Dual-Metric Evaluation of Social Bias in Large Language Models: Evidence from an Underrepresented Nepali Cultural Context

大语言模型中社会偏见的双指标评估:来自少数族裔尼泊尔文化背景的证据

Ashish Pandey, Tek Raj Chhetri

机构 * Center for Artificial Intelligence Research Nepal(尼泊尔人工智能研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过双指标评估框架,分析了大语言模型在尼泊尔文化背景下对性别、种族和社会文化刻板印象的偏见,揭示了显性一致性偏见与隐性生成偏见的关系及影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06595 2026-03-10 cs.CL 88%

Rethinking Personalization in Large Language Models at the Token Level

重新思考在词级别上的大语言模型个性化

Chenheng Zhang, Yijun Lu, Lizhe Fang, Chunyuan Zheng, Jiajun Chai, Xiaohan Wang, Guojun Yin, Wei Lin, Yisen Wang, Zhouchen Lin

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) State Key Lab of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室,北京大学智能科学与技术学院) School of Mathematical Sciences, Peking University(数学科学学院,北京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 PerContrast通过自对比方法和PerCE损失提升大语言模型在词级别上的个性化性能,实现平均收益超10%并具有良好的迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06578 2026-03-10 cs.CV 88%

Multimodal Large Language Models as Image Classifiers

多模态大语言模型作为图像分类器

Nikita Kisel, Illia Volkov, Klara Janouskova, Jiri Matas

机构 * Visual Recognition Group, Czech Technical University in Prague(捷克技术大学普拉茨视觉识别组)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究通过修正评估协议和真实标签问题,发现多模态大语言模型在图像分类中的表现受注释质量影响显著,且能辅助人类注释者提升数据集整理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08069 2026-03-10 cs.CV 88%

Synthetic Defect Image Generation for Power Line Insulator Inspection Using Multimodal Large Language Models

利用多模态大语言模型生成合成缺陷图像用于电力线路绝缘子检测

Xuesong Wang, Caisheng Wang

机构 * Department of Electrical and Computer Engineering, Wayne State University(电气与计算机工程系,韦恩州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 利用多模态大语言模型生成合成缺陷图像,提升电力线路绝缘子缺陷识别的准确率和数据效率。

Comments Submitted to Engineering Applications of Artificial Intelligence, Feb. 16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14878 2026-03-10 cs.HC 88%

InterMind: Doctor-Patient-Family Interactive Depression Assessment Empowered by Large Language Models

InterMind:由大型语言模型赋能的医生-患者-家庭交互式抑郁症评估系统

Zhiyuan Zhou, Jilong Liu, Sanwang Wang, Shijie Hao, Yanrong Guo, Richang Hong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 InterMind利用大型语言模型,通过医生、患者和家庭的互动提升抑郁症评估的精确性和效率。

Comments Accepted at ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06678 2026-03-10 cs.HC 88%

Beyond Judgment: Exploring Large Language Models as Non-Judgmental Support for Maternal Mental Health

超越判断:探索大型语言模型作为非评判性支持的母婴心理健康支持

Shayla Sharmin, Sadia Afrin Ratna

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究探讨了母亲如何利用LLMs作为非评判性支持来缓解育儿焦虑,发现尽管LLMs能提供快速信息和安慰,但大多数母亲仍更看重人类温暖,尤其在联合家庭中,部分人认为LLMs能避免人类评判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10467 2026-03-10 cs.AI 87%

MERIT Feedback Elicits Better Bargaining in LLM Negotiators

MERIT反馈促进LLM谈判者更好的协商

Jihwan Oh, Murad Aghazada, Yooju Shin, Se-Young Yun, Taehyeon Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Amazon AGI(亚马逊人工智能实验室) LG AI Research(LG人工智能研究)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 MERIT反馈框架通过AgoraBench基准、经济基础指标和人类偏好数据集提升LLM谈判能力,使其更符合人类偏好。

Comments Preprint. Typo corrected, New results added

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06905 2026-03-10 cs.CL 87%

MedInjection-FR: Exploring the Role of Native, Synthetic, and Translated Data in Biomedical Instruction Tuning

MedInjection-FR: 探索原生、合成和翻译数据在生物医学指令微调中的作用

Ikram Belmadani, Oumaima El Khettari, Pacôme Constant dit Beaufils, Benoit Favre, Richard Dufour

专题命中 评测与基准 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 MedInjection-FR研究通过结合原生、合成和翻译数据,探索其在生物医学指令微调中的作用,发现原生数据效果最佳,混合数据提供互补优势,合成数据需与原生结合才能提升性能。

Comments Accepted in LREC-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07946 2026-03-10 cs.LG cs.AI 86%

ELLMob: Event-Driven Human Mobility Generation with Self-Aligned LLM Framework

ELLMob: 基于自对齐LLM框架的事件驱动人类移动生成

Yusong Wang, Chuang Yang, Jiawei Wang, Xiaohang Xu, Jiayi Xu, Dongyuan Li, Chuan Xiao, Renhe Jiang

机构 * Institute of Science Tokyo(东京科学研究所) The University of Tokyo(东京大学) The University of Osaka(大阪大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ELLMob 基于自对齐LLM框架,通过提取习惯模式与事件约束的竞争性理由并迭代对齐,生成既符合习惯又响应事件的轨迹,有效解决大规模社会事件中的移动模式生成问题。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06874 2026-03-10 cs.AI cs.CL 86%

LieCraft: A Multi-Agent Framework for Evaluating Deceptive Capabilities in Language Models

LieCraft:一种用于评估语言模型欺骗能力的多智能体框架

Matthew Lyle Olson, Neale Ratzlaff, Musashi Hinck, Tri Nguyen, Vasudev Lal, Joseph Campbell, Simon Stepputtis, Shao-Yen Tseng

机构 * Intel Labs(英特尔实验室)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 LieCraft通过多智能体隐藏角色游戏评估语言模型的欺骗能力,揭示所有模型在面对高风险领域时均倾向于不道德行为。

Comments AAAI 2026 Alignment track. Authors 1 and 2 contributed equally, 3 and 4 contributed equally, 6 and 7 and 8 contributed equally (ordered by last name)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07460 2026-03-10 cs.CR cs.AI 85%

Where Do LLM-based Systems Break? A System-Level Security Framework for Risk Assessment and Treatment

LLM-based系统在哪里失效?一个系统级安全框架用于风险评估与处理

Neha Nagaraja, Hayretdin Bahsi

机构 * Northern Arizona University(北亚利桑那大学) Department of Software Science(软件科学系) Tallinn University of Technology(塔林技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种系统级安全框架,用于评估和处理LLM系统中的风险,通过结合系统建模与攻击-防御树,分析医疗场景中的多步骤攻击路径,并提供可比较的防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07360 2026-03-10 cs.AI 85%

The Yerkes-Dodson Curve for AI Agents: Emergent Cooperation Under Environmental Pressure in Multi-Agent LLM Simulations

人工智能代理的耶克斯-多森曲线:多代理大语言模型模拟中的环境压力下的自发合作

Ivan Pasichnyk

机构 * WeLabelData Inc.(WeLabelData公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究通过多代理大语言模型模拟,发现环境压力与合作行为呈倒U型关系,揭示了压力校准在AI代理开发中的重要性。

Comments 13 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07837 2026-03-10 cs.CL cs.AI 85%

AI Steerability 360: A Toolkit for Steering Large Language Models

AI Steerability 360:一个用于引导大语言模型的工具包

Erik Miehling, Karthikeyan Natesan Ramamurthy, Praveen Venkateswaran, Irene Ko, Pierre Dognin, Moninder Singh, Tejaswini Pedapati, Avinash Balakrishnan, Matthew Riemer, Dennis Wei, Inge Vejsbjerg, Elizabeth M. Daly, Kush R. Varshney

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 AI Steerability 360工具包提供了一种引导大语言模型的方法,通过四个控制面和统一的引导管道,降低开发和评估的门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07733 2026-03-10 cs.AI cs.CL math.OC 85%

Large Language Model for Discrete Optimization Problems: Evaluation and Step-by-step Reasoning

大规模语言模型在离散优化问题中的应用:评估与逐步推理

Tianhao Qian, Guilin Qi, Z. Y. Wu, Ran Gu, Xuanyi Liu, Canchen Lyu

机构 * School of Mathematics, Southeast University(东南大学数学学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Mathematical Sciences, Chongqing Normal University(重庆师范大学数学学院)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本研究评估了大规模语言模型在解决离散优化问题中的能力,探讨了CoT技术的有效性,并提出了未来研究的基准。

Comments 50 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08443 2026-03-10 cs.DB 85%

LLM-Driven Online Aggregation for Unstructured Text Analytics

基于大型语言模型的在线聚合用于无结构文本分析

Chao Hui, Weizheng Lu, Yanjie Gao, Lingfeng Xiong, Yunhai Wang, Yueguo Chen

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 OLLA是一种基于LLM的在线聚合框架,通过语义分层采样提升无结构文本分析的实时响应与效率。

Comments DASFAA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05202 2026-03-10 cs.CV 85%

SPEX: A Vision-Language Model for Land Cover Extraction on Spectral Remote Sensing Images

SPEX:一种用于光谱遥感图像土地覆盖提取的视觉-语言模型

Dongchen Si, Di Wang, Erzhong Gao, Xiaolei Qin, Liu Zhao, Jing Zhang, Minqiang Xu, Jianbo Zhan, Jianshe Wang, Lin Liu, Bo Du, Liangpei Zhang

机构 * College of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) iFlytek Co., Ltd.(iFlytek公司) National Engineering Research Center of Speech and Language Information Processing(语音与语言信息处理国家工程研究中心) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) National Engineering Research Center for Multimedia Software(多媒体软件国家工程研究中心) Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University(湖北省多媒体与网络通信工程重点实验室,武汉大学) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(测绘遥感信息工程国家重点实验室,武汉大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 SPEX是一种专为光谱遥感图像土地覆盖提取设计的多模态视觉-语言模型,通过多尺度特征聚合和多光谱视觉预训练等技术,实现了精确的像素级解释和可解释的预测生成。

Comments Accepted to IEEE TGRS

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06426 2026-03-10 cs.CL cs.AI 84%

NC-Bench: An LLM Benchmark for Evaluating Conversational Competence

NC-Bench: 一个评估大型语言模型对话能力的LLM基准

Robert J. Moore, Sungeun An, Farhan Ahmed, Jay Pankaj Gala

机构 * Independent Researcher(独立研究者) IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 NC-Bench提出了一种评估大型语言模型对话能力的基准,通过三种不同集合测试模型在不同对话任务中的表现,发现模型在基础回答任务表现较好,但在复杂多轮请求上面临挑战。

Comments 8 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20152 2026-03-10 cs.CL cs.AI 84%

Goal Alignment in LLM-Based User Simulators for Conversational AI

基于对话AI的LLM用户模拟器中的目标对齐

Shuhaib Mehri, Xiaocheng Yang, Takyoung Kim, Gokhan Tur, Shikib Mehri, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出UGST框架,通过三阶段方法改进用户模拟器的目标对齐能力,并在两个基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03935 2026-03-10 cs.LG cs.AI 84%

LLM-Powered Prediction of Hyperglycemia and Discovery of Behavioral Treatment Pathways from Wearables and Diet

基于大语言模型的高血糖预测及从可穿戴设备和饮食中发现行为治疗路径

Abdullah Mamun, Asiful Arefeen, Susan B. Racette, Dorothy D. Sears, Corrie M. Whisner, Matthew P. Buman, Hassan Ghasemzadeh

机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学) College of Health Solutions, Arizona State University(健康解决方案学院,亚利桑那州立大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出GlucoLens系统,利用大语言模型和多模态数据预测餐后血糖及高血糖,提供可解释的治疗路径建议。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08392 2026-03-10 cs.CL 83%

COACH meets QUORUM: A Framework and Pipeline for Aligning User, Expert and Developer Perspectives in LLM-generated Health Counselling

COACH meets QUORUM: 一个框架和流程用于对齐用户、专家和开发者在LLM生成健康咨询中的视角

Yee Man Ng, Bram van Dijk, Pieter Beynen, Otto Boekesteijn, Joris Jansen, Gerard van Oortmerssen, Max van Duijn, Marco Spruit

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 COACH与QUORUM框架通过多利益相关者评估,提升LLM生成健康建议的可信度和实用性。

Comments Under review for the CL4Health workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08371 2026-03-10 cs.GT cs.LG 83%

Leaderboard Incentives: Model Rankings under Strategic Post-Training

领导者激励:在战略后训练下的模型排名

Yatong Chen, Guanhua Zhang, Moritz Hardt

机构 * Max Planck Institute for Intelligent Systems, Tübingen and Tübingen AI Center(马克斯·普朗克智能系统研究所,图宾根和图宾根人工智能中心)

专题命中 评测与基准 :post-training(title,abstract);prompting(abstract);分类 cs.LG

AI总结 本文研究了标准诱导的激励结构,证明了当前标准导致无纳什均衡,而tune-before-test协议可产生唯一纳什均衡,按潜在质量排名模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01853 2026-03-10 cs.CR cs.LG cs.SE 83%

Security and Quality in LLM-Generated Code: A Multi-Language, Multi-Model Analysis

LLM生成代码的安全性与质量:多语言、多模型分析

Mohammed Kharma, Soohyeon Choi, Mohammed AlKhanafseh, David Mohaisen

机构 * Department of Computer Science, University of Central Florida(计算机科学系,中央佛罗里达大学) Department of Computer Science, Birzeit University(计算机科学系,比尔宰特大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了LLM生成代码在不同编程语言中的安全性和质量,发现其安全性因语言而异,且未能充分利用现代安全特性,需进一步改进以提升安全性和质量。

Comments 20 pages, 13 tables. Accepted to IEEE Transactions on Dependable and Secure Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06749 2026-03-10 cs.RO cs.AI 83%

Robotic Foundation Models for Industrial Control: A Comprehensive Survey and Readiness Assessment Framework

工业控制中的机器人基础模型:全面调研与可行性评估框架

David Kube, Simon Hadwiger, Tobias Meisen

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文调研了工业控制中机器人基础模型的应用现状,通过系统评估框架分析了其工业适用性,指出工业成熟度有限,需加强安全、实时性、感知与集成等关键因素的系统性考虑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26909 2026-03-10 cs.RO 82%

NaviTrace: Evaluating Embodied Navigation of Vision-Language Models

NaviTrace: 评估视觉-语言模型的具身导航

Tim Windecker, Manthan Patel, Moritz Reuss, Richard Schwarzkopf, Cesar Cadena, Rudolf Lioutikov, Marco Hutter, Jonas Frey

机构 * Robotic Systems Lab, ETH Zurich(苏黎世联邦理工学院机器人系统实验室) Intuitive Robots Lab, KIT(卡尔斯鲁厄理工学院直观机器人实验室) FZI Research Center for Information Technology(弗劳恩霍夫信息技术研究中心)

专题命中 评测与基准 :language model(title,abstract);foundation model(abstract)

AI总结 NaviTrace通过语义感知轨迹评分评估视觉-语言模型的具身导航能力,揭示了模型在空间定位和目标定位方面的不足。

Comments 11 pages, 6 figures, with appendix, accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06856 2026-03-10 cs.MA 82%

Evaluating Multi-Agent LLM Architectures for Rare Disease Diagnosis

评估多智能体LLM架构在罕见病诊断中的表现

Ahmed Almasoud

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本研究评估了多智能体LLM架构在罕见病诊断中的表现,发现分层结构略优于其他拓扑,而对抗模型性能显著下降,支持动态拓扑选择的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏