arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-14 至 2026-08-14 共收录 334 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 84 篇

2601.11729 2026-08-14 cs.CV cs.LG 版本更新 79%

SpaRRTa: A Synthetic Benchmark for Evaluating Spatial Intelligence in Visual Foundation Models

SpaRRTa:用于评估视觉基础模型空间智能的合成基准

Turhan Can Kargin, Wojciech Jasiński, Adam Pardyl, Bartosz Zieliński, Marcin Przewięźlikowski

机构 * AGH University of Krakow(克拉科夫AGH大学) IDEAS NCBR

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 SpaRRTa通过评估视觉基础模型的空间推理能力,揭示其在不同空间任务中的表现差异,旨在推动更高效的空间意识视觉模型发展。

Comments Project page is available at https://sparrta.gmum.net/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12345 2026-08-14 cs.AI cs.CL 新提交 79%

Diagnostic Foundation for Evaluating LLMs' Research Integrity as Co-Scientists

评估大型语言模型作为合作科学家的研究完整性的诊断基础

Yash Tripathi, Silu Sharma, Sai Sidhanth Manoharan Jayanthi, Shivank Garg, Lin Li

专题命中 评测与基准 :LLM(summary_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出IntegrityBench基准评估LLM作为合作科学家的研究完整性,发现前沿模型在峰值压力下约三分之一的完整性关键决策失败,存在助长不当行为和侵蚀AI辅助研究信任的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11616 2026-08-14 cs.AI cs.CV cs.LG 版本更新 79%

MBA: Multimodal Benchmark and Agents for Real-World Business Ideation

MBA:面向现实世界商业创意的多模态基准与智能体

Hojun Choi, Jaeyo Shin, Suin Lee, Hyunjung Shim

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究推出首个多模态商业创意基准MBA-Bench,提出MBA-b和MBA-k两种智能体,经实验其性能显著优于相关基准,为多模态商业创意智能体研究提供了重要支撑。

Comments Project page: https://hchoi256.github.io/projects/mba/ Code: https://github.com/hchoi256/MBA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13455 2026-08-14 cs.CV 新提交 78%

Evaluation of Clinically Steerable Retinal Image Generation from Foundation Model Latent Spaces

基于基础模型潜在空间的临床可操控视网膜图像生成评估

Zuzanna A. Wakefield-Skórniewska, Bartłomiej W. Papież

机构 * Nuffield Department of Population Health, University of Oxford(牛津大学纳菲尔德人口健康系) University of Oxford(牛津大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 该研究评估了四种视网膜基础模型的可控图像生成能力,发现其在自身框架内生成的视网膜图像优于传统潜在扩散,但与真实图像存在表征差距,需进一步对齐。

Comments MICCAI 2026 Workshop SASHIMI Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13309 2026-08-14 cs.CV 新提交 78%

How Good are Foundation Models in Longitudinal MRI Disease Progression Reasoning?

基础模型在纵向MRI疾病进展推理中的表现如何?

Wafa Al Ghallabi, Ritesh Thawkar, Sara Ghaboura, Omkar Thawakar, Numan Saeed, Dana Al Nuaimi, Ajnas Alkatheeri, Salman Khan, Fahad Shahbaz Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Department of Health Abu Dhabi(阿布扎比卫生部) Fatima College of Health Sciences(法蒂玛健康科学学院) Linköping University(林雪平大学)

专题命中 评测与基准 :foundation model(title);language model(abstract)

AI总结 该研究推出Time-Aware Multi-View MRI基准,评估16个视觉-语言模型在纵向MRI疾病进展推理中的表现,发现模型在变化方向识别等方面存在缺陷,多视角输入对模型性能有特定影响。

Comments Accepted at MICCAI 2026 (Early Accept). 11 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12905 2026-08-14 cs.CL 新提交 77%

Prompts in the Wild: A Large Analyzed Collection of Transactional Prompts in Code

野外提示:代码中事务性提示的大型分析集合

Victoria Basmov, Yoav Goldberg, Reut Tsarfaty

机构 * Bar-Ilan University(巴伊兰大学) Allen Institute for Artificial Intelligence(艾伦人工智能研究所)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文从GitHub收集57500个代码事务性提示样本,构建结构化本体将其结构化,分析得使用模式呈齐普夫分布,经错误分析验证标注可靠性,发布数据集及浏览界面。

Journal ref Proc. of the 20th Linguistic Annotation Workshop (LAW XX), pp. 257-308, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12220 2026-08-14 cs.LG cs.AI cs.CR 版本更新 76%

Unlearning at Scale: State-Exact Trace-Preserving Deletion in Billion-Parameter Language Models

大规模模型的遗忘:十亿参数语言模型中的状态精确、保留轨迹的删除

Abdullah X

机构 * Zephara AI

专题命中 评测与基准 :language model(title);分类 cs.AI、cs.LG

AI总结 该研究针对十亿参数语言模型,提出保留轨迹的删除方法,在Pythia、Llama模型上实现状态精确删除,但分散请求会导致高重放成本,发布相关测量作为诊断工具。

Comments 18 pages, 2 figures, 7 tables. Code and frozen research records available at https://github.com/abdullah-x-bd/unlearning (v0.3.1)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12654 2026-08-14 cs.AI cs.CL cs.LG 新提交 75%

SteerBench-Work: A Benchmark for Agent Steering at Action Boundaries

SteerBench-Work:动作边界处智能体决策的基准测试

Oguz Serdar, Cuneyt Mertayak

机构 * AgentDock

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究推出职场智能体动作边界决策基准SteerBench-Work,发现模型在该任务中存在过度拒绝的显著偏差,且通用能力与引导校准并不等同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03880 2026-08-14 cs.CV 版本更新 75%

Exploring Instruction Data Quality for Explainable Image Quality Assessment

探索可解释图像质量评估的指令数据质量

Yunhao Li, Sijing Wu, Jun Jia, Kang Fu, Qi Jia, Yucheng Zhu, Wei Sun, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 该研究针对可解释图像质量评估任务,提出Q-Selector数据选择框架,仅用10%训练数据就达到全数据微调的102.1%和103.7%性能,证明指令数据存在冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13120 2026-08-14 cs.AI 新提交 70%

SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback

SkillEvo:基于多轮交互反馈的自更新进化梯度

Qianxi Yan, Chunrong Chen, Jiuzhou Zhao, Min Zhang, Yongzhou Xu, Xiaochuan Xu

机构 * Tencent Cloud Andon(腾讯云Andon) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 SkillEvo通过多轮用户模拟生成反馈、独立治理层修复退化,在6类云服务等数据集上,相比两种基线方法显著提升了智能体技能进化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13113 2026-08-14 cs.CV cs.AI 新提交 70%

EgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal Memory

EgoMonth:面向长期时空记忆的月级自我中心视频基准

Weitao Chen, Hu Jiaxin, Xie Tianyidan, Yang Li, Yuyi Qian, Banghao Xu, Ziheng Tang, Shenyi Wang, Mingyue Yu, Duo Li, Jiacheng Shi, Gao Wang, Zhan Xu, Zhicheng Qiu, Xuanfu Li, Jian Yang, Lanjun Wang, Zili Yi

机构 * Nanjing University(南京大学) Huawei Technologies Co., Ltd.(华为技术有限公司) Tianjin University(天津大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究人员推出首个月级自我中心视频基准EgoMonth,评估发现当前主流MLLMs的长期时空记忆能力远逊于人类,仅为有损总结器而非忠实记忆器。

Comments 21 pages, 4 figures, 6 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12984 2026-08-14 cs.MA cs.CL 新提交 70%

Reconcile Once, Write Anytime: A Trust-Tiered Librarian and a Multi-Agent Writer for Drift-Free, Point-in-Time Research

一次对账,随时撰写:用于无漂移、时点研究的信任分层图书馆与多智能体撰写器

Xing Zhang, Yanwei Cui, Guanghui Wang, Peiyang He

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出双层智能体系统,通过信任分层图书馆与多智能体撰写器分离知识库与报告撰写,消除报告矛盾与漂移,实验验证其在多指标、多场景下的有效性与效率优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12895 2026-08-14 cs.AI cs.MA 新提交 70%

Agent Behavioral Contracts II: Certifying Compositional Reliability Without Assuming Independence

智能体行为契约II:不假设独立性的组合可靠性验证

Varun Pratap Bhardwaj, Garima Singh, Arun Pratap Bhardwaj

机构 * Qualixar

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对多智能体系统组合可靠性的独立性假设开展验证,发现组件共享模型时正相关性会高估冗余度,提出无依赖假设的有限样本验证方法并通过扩充矩函数提升验证效果,配套任意时间有效验证方法。

Comments 49 pages, 12 tables, 25 numbered definitions, 18 theorems with full proofs, six experiments, 65 references. Code, analysis scripts, and preregistration: https://github.com/qualixar/agentassert-abc

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12352 2026-08-14 cs.CY cs.AI cs.HC 新提交 70%

Why AI Governance Frameworks Are Hard to Adopt: A Role-Based Stress Test of the NIST AI RMF

为何AI治理框架难以被采用:对NIST AI RMF的基于角色的压力测试

Joseph R. Simons, David A. Broniatowski

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过对NIST AI RMF的基于角色的压力测试,发现AI治理框架的核心问题在于活动能否产生治理价值,角色、部署类型对治理价值有显著影响,仅当治理价值与结构适配性同时满足时才易实现风险降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09539 2026-08-14 cs.CL 版本更新 70%

Mawqif-XT: An Arabic Benchmark Dataset for Cross-Target Stance Detection

Mawqif-v2:面向跨目标立场检测的阿拉伯语基准数据集

Rasha Albalawi, Nuha Albadi, Hamzah Luqman, Maram Kurdi, Saad Ezzini, Asma Yamani, Ahmed Ashraf

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Mawqif-v2阿拉伯语基准数据集,含996条标注推文,用于评估跨目标立场检测的模型泛化能力,并建立基线结果以支持可复现评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05485 2026-08-14 cs.AI 版本更新 70%

Auditable Agents

可审计代理

Yi Nian, Aojie Yuan, Haiyue Zhang, Jiate Li, Li Li, Xiyang Hu, Hua Wei, Xiongye Xiao, Chaowei Xiao, Yue Zhao

机构 * FORTIS Lab, University of Southern California(南加州大学FORTIS实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文探讨了可审计代理系统的核心问题,提出五个可审计性维度和三种机制类别,通过实证证据证明代理系统需具备审计能力才能实现问责。

Comments 24 pages, 1 figure. Extended version. A condensed 4-page version appears in the Proceedings of the ACM AI Leadership Summit 2026 (Visionary Papers track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17449 2026-08-14 cs.CL 版本更新 70%

SLAyiNG: A Diverse and Community-validated Dataset of Queer Slang

SLAyiNG:一个经社群验证的多元酷儿俚语数据集

Leonor Veloso, Lea Hirlimann, Lucija Mihić Zidar, Philipp Wicke, Valentin Hofmann, Hinrich Schütze

机构 * Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 评测与基准 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 针对酷儿语言处理偏差问题,本文提出首个经社群验证的英语酷儿俚语数据集Slaying,揭示语言模型对酷儿社群无表征偏差但存在语言偏差等发现,可提升酷儿用户NLP体验。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13441 2026-08-14 cs.CV 新提交 67%

Edit2TikZ: A Comprehensive and Challenging Benchmark for Scientific Figure Editing with TikZ

Edit2TikZ:面向基于TikZ的科学图像编辑的全面且具有挑战性的基准

Zongyun Zhang, Jiacheng Ruan, Xian Gao, Ruizhu Zhou, Lingcheng Meng, Lining Hu, Ting Liu, Yuzhuo Fu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文推出科学图像编辑基准Edit2TikZ,评估主流多模态大语言模型发现其性能不足,通过构建混合训练集并采用课程学习,可显著提升紧凑模型的编译成功率。

Comments 9 pages, 6 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13267 2026-08-14 cs.CL cs.AI cs.CV cs.LG 新提交 67%

How Do VLMs Behave When Blind or Misled? Behavioral Evaluation of VLMs on Scientific Figures

视觉语言模型(VLMs)在失明或被误导时的表现如何?针对科学图表的VLMs行为评估

Paul Osemudiame Oamen, Owusu-Banahene Osei, Ananya Mukherjee, Christian Greisinger, Steffen Eger, Pius Onobhayedo, Wei Zhao

机构 * University of Aberdeen(阿伯丁大学) International Institute of Information Technology Hyderabad(海德拉巴国际信息技术学院) University of Technology Nuremberg(纽伦堡工业大学) University of Southern California(南加利福尼亚大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究构建科学图表理解基准SciFigBench,提出A-R-I框架评估VLMs在视觉证据缺失或误导时的行为可靠性,发现高感知与推理准确性不代表行为可靠,不同模型表现存在显著差异。

Comments 25 pages including appendix. Project website: https://scifigbench.nlp4sci.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12781 2026-08-14 cs.CV 新提交 67%

Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

超越正确性:混合思维多模态大语言模型(MLLM)的响应行为基准测试与对齐

Xinming Wang, Weinong Wang, Hongming Yang, Yansong Lin, Zheng Ruan, Shangpin Peng, Qiming Peng, Nan Qiao, Fengyuan Lu, Guoqing Ma, Marito Li, Songyang Zhang, Saiyong Yang, Han Hu, Yonglong Tian, Xu-Yao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Large Language Model Department, Tencent(腾讯大语言模型部) University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology(香港科技大学) Zhongguancun Academy(中关村学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对混合思维 MLLM 的思维与非思维模式响应错位问题,构建 PatternEval 基准并开发 PatternRL 方法,可减轻跨模式错位且任务性能损失极小。

Comments 8 tables and 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12635 2026-08-14 cs.AR 新提交 67%

GateTruth: Auditing the Rigor of RTL Design Benchmarks via Mutation Testing

GateTruth:通过变异测试审计RTL设计基准的严谨性

Meet Bhadra

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 GateTruth是用于审计RTL基准测试平台严谨性的变异测试引擎,实验显示多数RTLLM v2.0基准测试平台未达95%变异体杀伤阈值,4096-token输出上限会影响模型排名,其成果推动将变异体杀伤认证设为RTL基准的标准要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12569 2026-08-14 cs.IR 新提交 67%

Test-Time Optimization of Query Embeddings with Ranking Aware Reward Maximization

基于排名感知奖励最大化的查询嵌入测试时优化

Tianyu Chen, Jiaxing Wu

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本研究提出TTT-Embed框架,将排名奖励提炼为轻量学习向量,无需访问模型权重即可优化,在多嵌入模型和MTEB任务上显著提升测试时检索效果,且具备良好泛化性,解决了灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12549 2026-08-14 cs.CV 新提交 67%

StrAD: A Streaming Method and Benchmark for Audio Description Generation for Long-form Videos

StrAD:面向长视频音频描述生成的流式方法与基准

Julian Spravil, Sebastian Houben, Sven Behnke

机构 * Fraunhofer IAIS(弗劳恩霍夫智能分析与信息系统研究所) University of Bonn(波恩大学) University of Applied Sciences Bonn-Rhein-Sieg(波恩-莱茵-锡格应用科学大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) Center for Robotics, University of Bonn(波恩大学机器人中心)

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 针对长视频音频描述生成的需求,研究提出首个流式方法StrAD,构建了涵盖多类型全长视频的基准,其微调模型在相关任务上达到先进性能,为扩大无障碍覆盖提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13714 2026-08-14 physics.optics physics.app-ph 版本更新 67%

Precision Hamiltonian Encoding in Full-Aperture Spatial Photonic Ising Machines

高保真空间光子伊辛机通过精确波前塑形

P. S. Karavelas, D. Karanikolopoulos, L. Mouchliadis, A. K. Spiliotis, N. L. Pitanios, S. Gentilini, D. Veraldi, P. Charlesworth, D. Pierangeli, J. Sakellariou, N. G. Berloff, S. I. Tsintzos, C. Conti, P. G. Savvidis

专题命中 评测与基准 :SLM(abstract,abstract_cn)

AI总结 本文提出了一种高精度全孔径校准方案和交互归一化方法,实现了高保真度的空间光子伊辛机,突破了传统限制,实现了更大规模的光子伊辛计算。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12323 2026-08-14 cs.CL cs.AI cs.CY 新提交 62%

Why Do AI Agents Break Rules? How Framing, Context, and Social Signals Shape Compliance

AI智能体为何违反规则?框架、情境与社会信号如何影响合规性

Mika Okamoto, Ansel Kaplan Erol, Kutluhan Erol

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究运用法律与经济学的合规理论,发现安全微调AI模型大体合规,任务优化与智能体模型会在低惩罚等条件下违规,且引入经济激励等会导致大规模合规失败,指出模型选择与合规性评估需改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05018 2026-08-14 cs.AI cs.LG 版本更新 62%

Short-term load forecasting under EU-AI Act Requirements in Safety-Critical Environments: Results from a 41-day live challenge on the aggregated German transmission-grid load

安全关键环境下符合欧盟AI法案要求的短期负荷预测:德国输电电网聚合负荷41天在线挑战赛结果

Thomas Bartz-Beielstein, Inalbek Akiev, Lalo Mohamad

机构 * THK-AI Research Cluster(THK-AI研究集群)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过41天在线挑战赛验证,符合欧盟AI法案要求的spotforecast2-safe短期负荷预测流程,在德国输电电网聚合负荷预测中优于ENTSO-E基线,其本地模型性能可与超1亿参数的chronos-2等大模型媲美。

Comments Version 3. 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09700 2026-08-14 cs.LG cs.AI 版本更新 62%

Cueless EEG imagined speech for subject identification: dataset and benchmarks

无提示EEG想象言语用于受试者识别:数据集与基准测试

Ali Derakhshesh, Zahra Dehghanian, Reza Ebrahimpour, Hamid R. Rabiee

机构 * Department of Computer Engineering, Sharif University of Technology(沙斐大学计算机工程系) Center for Cognitive Science, Institute for Convergence Science and Technology (ICST)(融合科学与技术研究所认知科学中心) Sharif University of Technology(沙斐大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出无提示EEG想象言语范式,通过自然选择和想象语义词实现高准确率的受试者识别,展示了其在脑机接口中的应用潜力。

Journal ref IEEE Transactions on Biometrics, Behavior, and Identity Science ( Volume: 8, Issue: 2, March 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13337 2026-08-14 cs.LG 新提交 57%

Where You Measure Decides What You Measure: Position Selection in Ablation-Based SAE Evaluation

测量位置决定测量内容:基于消融的SAE评估中的位置选择

Valentin Noël

机构 * Devoteam(德孚替)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 研究发现基于消融的SAE评估中,测量位置的选择会影响结果,提出需统一测量位置的评估协议,修正方法仅需一行代码,且随语料库规模扩大问题更严重。

Comments 19 pages, 3 figures. Code and data: https://github.com/vcnoel/sae-artifact

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13197 2026-08-14 cs.LG 新提交 57%

Beyond Simulated Benchmarks: Evaluating Motion Representations for Fall Detection Under Real-World Data Scarcity

超越模拟基准:真实世界数据稀缺下跌倒检测的运动表示评估

Timilehin B. Aderinola, Ilaria D'Ascanio, Luca Palmerini, Lorenzo Chiari, Jochen Klenk, Clemens Becker, Brian Caulfield, Georgiana Ifrim

机构 * University College Dublin (UCD)(都柏林大学学院) University of Bologna(博洛尼亚大学) Robert Bosch Hospital(罗伯特博世医院) Heidelberg University Hospital(海德堡大学医院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文针对真实世界数据稀缺下的跌倒检测,系统评估了不同运动表示的性能,发现高参数模型在模拟数据表现好但泛化差,增强的符号表示泛化能力最优,为可部署跌倒检测提供了关键参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12776 2026-08-14 cs.CL 新提交 57%

ViTOED: A Dataset for Target-Oriented Emotion Detection on Vietnamese Social Media Texts

ViTOED:面向越南社交媒体文本的定向情感检测数据集

Chanh Vo, Son T. Luu, Ngan Luu-Thuy Nguyen

机构 * Faculty of Information Science and Engineering, University of Information Technology(信息科学与工程学院,信息科技大学) Vietnam National University, Ho Chi Minh City(越南国家大学胡志明市分校)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究构建了越南社交媒体定向情感检测数据集ViTOED,提出基于结构化情感图的基线方法并评估相关预训练模型,揭示了该任务的挑战及模型改进空间。

Comments Accepted for publication at 2026 International Conference on Multimedia Analysis and Pattern Recognition (MAPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏