arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

2026-08-18 至 2026-08-18 共收录 4
2608.16011 2026-08-18 cs.CL cs.CV 新提交

ReRef-3D: A Benchmark for Spatial Referring Expression-Guided 3D Scene Rearrangement

ReRef-3D:空间指代表达引导的3D场景重排基准

Mary Lynn Martin, Yifei Zhang, Martha Palmer, Maria Leonor Pacheco

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

AI总结 该研究提出ReRef-3D基准,针对3D场景语言引导放置任务,经微调的LLaVA-3D等模型在该基准上验证了关系满足度优于物理有效性等结论。

Comments 18 pages, 4 figures. Submitted to ACL Rolling Review (ARR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14566 2026-08-18 cs.AI 新提交

Position: Evaluations of AI Moral Reasoning Still Miss Half of the Picture

立场:AI道德推理的评估仍遗漏了一半关键内容

Aidan Kierans, Ritam Dutt, Kaley Rittichier, Shiri Dori-Hacohen, Avijit Ghosh

机构 * University of Connecticut(康涅狄格大学) Carnegie Mellon University(卡内基梅隆大学) Hugging Face

AI总结 该研究指出现有LLM道德推理评估聚焦道德价值问题而忽视规范问题,识别出三大缺口并提出含规范表征、标注数据集及分层评估的研究议程,以推动规范推理的系统研究。

Comments 8 pages, 1 figure. Accepted for archival publication at the ACL 2026 Workshop on Evaluating Evaluations (EvalEval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23049 2026-08-18 cs.AI 版本更新

MedMCP-Calc: Benchmarking LLMs for Realistic Medical Calculator Scenarios via MCP Integration

MedMCP-Calc:通过MCP整合建立LLMs在真实医疗计算场景中的基准测试

Yakun Zhu, Yutong Huang, Shengqian Qin, Zhongzhen Huang, Shaoting Zhang, Xiaofan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 MedMCP-Calc通过MCP整合建立首个LLMs在真实医疗计算场景的基准测试,揭示模型在多步骤计算和外部工具利用上的不足,并开发CalcMate实现开源模型的最佳性能。

Comments Accepted to the ACL 2026 Main Conference as an Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14107 2026-08-18 cs.CL cs.AI 版本更新

DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models

DiagnosisArena:面向大型语言模型的诊断推理基准测试

Yakun Zhu, Zhongzhen Huang, Linjie Mu, Yutong Huang, Wei Nie, Jiaji Liu, Shaoting Zhang, Pengfei Liu, Xiaofan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) SII SPIRAL Lab(SPIRAL实验室) Generative AI Research Lab (GAIR)(生成式AI研究实验室) Shanghai Chest Hospital(上海胸科医院) Beijing Anzhen Hospital, Capital Medical University(北京安贞医院,首都医科大学)

AI总结 该研究提出DiagnosisArena基准,评估大型语言模型的临床诊断推理能力,发现顶尖模型准确率仅最高51.12%,凸显其泛化瓶颈,旨在推动AI诊断推理进步。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏