arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2780 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2780 篇

2606.13815 2026-06-15 cs.AI cs.CL 新提交 62%

Poker Arena: Multi-Axis Profiling of Strategic Reasoning and Memory in LLMs

Poker Arena: 大型语言模型中策略推理与记忆的多轴剖析

Pratham Singla, Shivank Garg, Vihan Singh

机构 * Indian Institute of Technology Roorkee(印度理工学院罗尔基分校) Raeth AI

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 提出Poker Arena平台,通过三层记忆架构和九轴认知剖面分解策略推理,揭示标量排行榜系统性误排模型能力结构。

Comments 33 pages, ICML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12608 2026-06-12 cs.CL cs.LG 新提交 62%

Shopping Reasoning Bench: An Expert-Authored Benchmark for Multi-Turn Conversational Shopping Assistants

购物推理基准:面向多轮对话购物助手的专家编写基准

Shuxian Fan, Seonwoo Min, Youna Hu, Botao Xia, Jayakrishnan Unnikrishnan, Rowan Musselmann, Yifan Gao, Qingyu Yin, Priyanka Nigam, Bing Yin

机构 * Amazon(亚马逊)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出一个由零售专家编写的525个任务的多轮对话购物推理基准,包含10863个加权评分标准,评估9个模型显示通过率仅57-77%,多轮任务性能下降4-18分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11247 2026-06-11 cs.LG cs.AI cs.AR 新提交 62%

Physics-informed generative AI for semiconductor manufacturing: Enforcing hard physical constraints in generative models by construction

物理信息驱动的生成式AI在半导体制造中的应用:通过构造强制生成模型中的硬物理约束

Yaser Mike Banad, Sarah Sharif

机构 * School of Electrical and Computer Engineering, University of Oklahoma(俄克拉荷马大学电气与计算机工程学院) Center for Quantum Research and Technology, University of Oklahoma(俄克拉荷马大学量子研究与技术中心) Intelligent Neuromorphic and Quantum Understanding for Innovative Research and Engineering (INQUIRE) Laboratory(创新研究与工程智能神经形态与量子理解实验室) Material Science and Engineering Program, University of Oklahoma, Norman, OK 73019 USA(俄克拉荷马大学材料科学与工程项目,Norman, OK 73019 USA)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 针对半导体制造中生成模型必须满足硬物理约束的问题,本文提出通过构造集成物理信息(如物理信息扩散、PDE约束变分模型等)来强制约束,而非事后过滤,并给出四种集成模式和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11063 2026-06-10 cs.AI cs.LG 新提交 62%

CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs

CIAware-Bench: 评估前沿大语言模型的控制干预感知能力

Joachim Schaeffer, Thomas Jiralerspong, Alexander Panfilov, Guillaume Lajoie, Jonas Geiping, Yoshua Bengio, Roland S. Zimmermann

机构 * MATS Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Astra Fellowship ELLIS Institute Tübingen, MPI for Intelligent Systems & Tübingen AI Center LawZero Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出CIAware-Bench基准,通过四个任务域测试模型能否区分自身轨迹与被控制干预修改的轨迹,发现前沿模型在默认设置下感知能力低至中等,且因任务和模型对而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10530 2026-06-10 cs.LG cs.AI 新提交 62%

Machine Learning Methods for Studying Latent Neural Activity Dynamics

研究潜在神经活动动力学的机器学习方法

Shufeng Kong, Fumei Deng, Xinyi Dong, Caihua Liu, Weiwei Chen, Yingheng Wang, Daniel Cao, Azahara Oliva, Antonio Fernandez-Ruiz, Carla Gomes

机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件工程学院) Department of Computer Science, Cornell University(康奈尔大学计算机科学系) Department of Neurobiology and Behavior, Cornell University(康奈尔大学神经生物学与行为学系) Department of Ecology and Evolutionary Biology, Cornell University(康奈尔大学生态学与进化生物学系) School of Computer Science and Artificial Intelligence, Foshan University(佛山大学计算机科学与人工智能学院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 综述从状态空间模型到深度生成模型的潜在变量模型,涵盖单区域动力学、多区域通信和行为对齐建模,并讨论大规模神经基础模型及未来挑战。

Comments Accepted by IJCAI 2026 survey track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09470 2026-06-09 cs.CL cs.AI 新提交 62%

A Finetuned SpeechLLM for Joint Multi-Granular L2 Assessment and Natural-Language Rationales

一种用于联合多粒度L2评估和自然语言解释的微调SpeechLLM

Aditya Kamlesh Parikh, Cristian Tejedor-Garcia, Catia Cucchiarini, Helmer Strik

机构 * Centre for Language Studies, Radboud University(语言研究中心,拉德堡德大学)

专题命中 评测与基准 :preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 提出一种基于评分准则的SpeechLLM,通过混合训练目标联合预测句子级和词/音素级标签并生成自然语言解释,在SpeechOcean762上达到或超越单粒度模型。

Comments Accepted to Interspeech 2026. This publication is part of the project Responsible AI for Voice Diagnostics (RAIVD) with file number NGF.1607.22.013 of the research programme NGF AiNed Fellowship Grants, which is financed by the Dutch Research Council (NWO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08932 2026-06-09 cs.CL cs.AI cs.CE 新提交 62%

From Statute to Control Flow: Span-Grounded Deontic Trees for Defeasible Scope Parsing

从法规到控制流:基于跨度义务树的可废止范围解析

Jian Chen, Siyuan Li, Chucheng Wan, Zixuan Yuan

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-Sen University(中山大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 提出NormBench基准和跨度义务树(SG-DT)中间表示,用于诊断和缓解规则遵循模型中的静默范围遗漏(SSO)问题,揭示递归衰减和可审计性陷阱两种病理,并通过约束输出改善树结构保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08481 2026-06-09 cs.LG cs.AI cs.DB cs.SE 新提交 62%

PIPE-Cypher: Automatic Enterprise Benchmark Generation for Text-to-Cypher Systems

PIPE-Cypher:面向文本到Cypher系统的自动企业基准生成

Suraj Ranganath, Anish Raghavendra

机构 * Halıcıoğlu School of Data Science and Computing, University of California, San Diego(加利福尼亚大学圣迭戈分校哈勒乔卢数据科学与计算学院) Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 提出PIPE-Cypher流水线,利用本地大模型从企业属性图自动生成平衡的NL-to-Cypher基准,通过模式分析、逆向查询约束生成和执行验证等步骤,实现可重复的基准构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08056 2026-06-09 cs.CL cs.AI 新提交 62%

What's the Point? Spatial Grammar & Index Resolution for Sign Language Processing

要点何在?手语处理中的空间语法与索引解析

Oline Ranum, Simon Hadfield, Richard Bowden

机构 * Centre for Vision, Speech and Signal Processing, University of Surrey(萨里大学视觉、语音与信号处理中心)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 针对手语中占10-15%但被忽视的空间索引现象,提出索引检测与话语实体链接的分解框架,建立索引感知手语建模基线,并作为辅助专家提升冻结手语识别模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07141 2026-06-08 cs.LG cs.AI 新提交 62%

REMEDI: A Benchmark for Retention and Unlearning Evaluation in Multi-label Clinical Disease Inference

REMEDI:多标签临床疾病推断中的保留与遗忘评估基准

Anurag Sharma, Sai Teja Chunchu, Prasenjit Mitra, Sandipan Sikdar, Koustav Rudra

机构 * IIT Kharagpur(印度理工学院Kharagpur分校) Carnegie Mellon University(卡内基梅隆大学) L3S Research Center, Leibniz University Hannover(Leibniz汉诺威大学L3S研究中心)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出REMEDI基准,针对多标签临床疾病推断中的机器遗忘问题,利用MIMIC-III数据库评估现有方法在效用与遗忘性能间的权衡,并发现其不适用于多标签任务。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21561 2026-07-24 cs.LG q-bio.BM 新提交 61%

Graph Learning on Ensembles of Cyclic Peptides: An Investigation of Molecular Ensemble Modeling

环肽集合上的图学习:分子集合建模研究

Aaron Feller, Kris Deibler, Maxim Secor

专题命中 评测与基准 :foundation model(abstract,comments);分类 cs.LG

AI总结 研究针对分子构象集合预测性质的问题,提出EnsembleEGNN模型,先以EGNN层编码各构象,再用集合注意力块汇集表示,经多任务自监督预训练,在环肽数据集上取得良好效果,联合BERT编码器进一步提升预测性能。

Comments Accepted to Graph Foundation Models workshop at ICML '26. Contains 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18736 2026-08-20 cs.LG cs.CR cs.DC 新提交 57%

FedLNS: Leverage LayerNorm Signature Modeling to Mitigate Adversarial Manipulation in Federated LLMs

FedLNS:利用层归一化签名建模缓解联邦大语言模型中的对抗性操纵

Kai Li, Jong-Ik Park, Carlee Joe-Wong, Wei Ni, Falko Dressler

机构 * Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg(卢森堡大学安全、可靠性与跨学科研究中心(SnT)) Carnegie Mellon University(卡内基梅隆大学) Edith Cowan University(埃迪斯科文大学) TU Berlin(柏林工业大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 FedLNS是一种服务器端联邦学习框架,通过层归一化签名筛选恶意更新,在200个客户端、40%目标操纵下,对三类模型均实现优于基线的测试困惑度。

Comments 13 pages (main body), 36 pages (appendix), 3 figures, 98 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18336 2026-08-20 cs.AI cs.CY 新提交 57%

Measuring the Partial-Credit Gap: A Strict Benchmark on Vietnam's 2025 Convex Marking Scheme

测量部分学分差距:越南2025年凸评分制的严格基准

Nguyen Quoc Hung, Nguyen Dang Minh, Le Nhu Quynh, Tran Khanh Linh, Nguyen Kieu Linh

机构 * Posts and Telecommunications Institute of Technology(越南邮电技术学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究针对越南2025年凸评分制,构建THPT-Ladder基准,发现标准准确率指标会夸大模型在该评分制下的表现,不同错误分布会导致模型得分差异显著,影响模型能力评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17795 2026-08-19 cs.CL 新提交 57%

TraceSQL: Traceable Answerability Estimation for Reference-Free Text-to-SQL Verification

TraceSQL:无参考文本到SQL验证的可追踪答案性估计

Neelesh Kumar Shukla, Debasmita Panda, Srutanik Bhaduri, Aditya Banerjee, Viji Krishnamurthy

机构 * Oracle Corporation(甲骨文公司)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 针对无参考文本到SQL验证的可追踪性不足问题,提出基于67种诊断特征的轻量模型TraceSQL,在BIRD数据集上优于基线模型,可提供可追溯的预测证据。

Comments 9 pages main paper with 6 pages supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17561 2026-08-19 cs.CV cs.LG 新提交 57%

Leveraging existing sparse point annotations for benthic imagery dense segmentation

利用现有稀疏点标注进行底栖图像的密集分割

Cesar Borja, Breck A. McCollum, Jarret E. Byrnes, Kenneth Sebens, Ana C. Murillo

机构 * Universidad de Zaragoza(萨拉戈萨大学) Berklee College of Music(伯克利音乐学院) University of Washington(华盛顿大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本研究结合SAM2基础模型与底栖图像的稀疏专家点标注,提出自动筛选可靠点的机制以生成高质量伪真值掩码,训练细粒度分割模型,还引入新基准推进生态分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17519 2026-08-19 cs.CV cs.LG 新提交 57%

Looking Beyond the Scale: Do Surgical Skill Models Learn Transferable Representations Across Assessment Rubrics?

超越规模:手术技能模型是否能学习到跨评估准则的可迁移表征?

Hanna Hoffmann, Felix von Bechtolsheim, Stefanie Speidel, Rebecca Hisey

机构 * National Center for Tumor Diseases (NCT)(国家肿瘤疾病中心) DKFZ(德国癌症研究中心) Faculty of Medicine and University Hospital Carl Gustav Carus(卡尔·古斯塔夫·卡鲁斯医学院及大学医院) TUD Dresden University of Technology(德累斯顿工业大学) Helmholtz-Zentrum Dresden-Rossendorf (HZDR)(德累斯顿-罗森多夫亥姆霍兹中心) BMFTR Research Hub 6G-Life(BMFTR 6G生活研究中心) Deutsches Krebsforschungszentrum (DKFZ)(德国癌症研究中心) The Centre for Tactile Internet with Human-in-the-Loop (CeTI)(人在回路触觉互联网中心)

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 本文研究手术技能模型的跨评估准则可迁移性,发现JIGSAWS预训练骨干在LASANA上迁移可行但反向迁移失败,任务特定头部主导技能预测,视觉成分非唯一预测因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17426 2026-08-19 cs.CV cs.AI 新提交 57%

SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation

SemComp-Bench:视频生成中的语义任务完成基准

Keyu Tu, Zhuowei Chen, Mengqi Huang, Yuxin Wang, Jiahao Zhu, Zhendong Mao, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Sun Yat-sen University(中山大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究提出面向结果的视频生成任务语义任务完成,构建SemComp-Data数据集与SemComp-Bench基准,发现代表性视频生成模型在兼顾结果实现与参考图像语义基础上仍具挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17044 2026-08-19 cs.CV cs.AI 新提交 57%

The 10th AI City Challenge

第10届AI City挑战赛

Zheng Tang, Shuo Wang, David C. Anastasiu, Ming-Ching Chang, Anuj Sharma, Quan Kong, Munkhjargal Gochoo, Jun-Wei Hsieh, Tomasz Kornuta, Zhedong Zheng, Renran Tian, Judah Goldfeder, Fulgencio Navarro, Yuxing Wang, Yizhou Wang, Sameer Satish Pusegaonkar, Anqi Li, Nalin Dadhich, Ridham Kachhadiya, Dhanishtha Patil, Haoquan Liang, Jiajun Li, Han Zhang, Yilin Zhao, Zaid Pervaiz Bhat, Shuyu Yang, Ashutosh Kumar, Rong Wang, Rafael Martin Nieto, Peter Christiansen, Ahmed Abduljawad, Mohanrasu Shanmugam, Nadeem Shaik, Sujit Biswas, Xunlei Wu, Vidya Murali, Rama Chellappa

机构 * Santa Clara University(圣克拉拉大学) University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Iowa State University(爱荷华州立大学) Woven by Toyota(丰田编织公司) United Arab Emirates University(阿拉伯联合酋长国大学) National Yang Ming Chiao Tung University(国立阳明交通大学) University of Macau(澳门大学) North Carolina State University(北卡罗来纳州立大学) Columbia University(哥伦比亚大学) Milestone Systems(里程碑系统公司) Xi’an Jiaotong University(西安交通大学) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文总结了与ECCV 2026同期举办的第10届AI City挑战赛的设置、数据集、评估结果等,该赛事规模扩大,设多类赛道,成功系统结合基础模型与多种技术。

Comments Summary of the 10th AI City Challenge Workshop in conjunction with ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16852 2026-08-18 cs.AI 新提交 57%

What Do Compliance Detectors Read? An Audit of Activation Probes and Guard Models

合规检测器读取什么?激活探针与防护模型的审计

Saisab Sadhu, Aadit Sengupta, Vinay Kumar Sankarapu, Pratinav Seth

机构 * Lexsi Labs(雷克西实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究通过审计合规检测器发现其存在规则盲视问题,引入无需训练的ICS检测器,发布相关基准以推动规则盲视的进一步研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16661 2026-08-18 cs.CV cs.LG 新提交 57%

Turning spectra into images improves plant trait retrieval with 2D-CNNs

将光谱转换为图像可通过2D-CNN改进植物性状检索

Javier Lopatin, Teja Kattenborn, Eya Cherif, Sebastián Moreno

机构 * Adolfo Ibáñez University(阿道夫·伊瓦涅斯大学) University of Chile(智利大学) University of Freiburg(弗莱堡大学) Leipzig University(莱比锡大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 本研究将一维光谱转为二维图像,用EfficientNet-B0在GreenHyperSpectra数据集上实验,发现直接重塑为二维网格的方法提升了植物多性状预测精度,且2D光谱图像的表征优势是性能提升的关键。

Comments 38 pages, 14 figures, 11 tables. Supplementary material appended after the references. v2: adds a per-image vs global scaling ablation, expands the methods, and corrects several figures and captions

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16556 2026-08-18 cs.AI 新提交 57%

DeepInsight II: One Trace from Benchmark to Robot

DeepInsight II:从基准测试到机器人的单条轨迹

Siyi Li, Yuchen Kang, Wuliang Wang, Zhengjie Zhang, Jiangpin Liu, Jianhao Yao, Jie Chen

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 DeepInsight II量化具身层,复现基准结果、通过MotionBench实现仿真到真实机器人的原生迁移,并扩展轨迹定位至带修复动作的交接标签,提供从基准到机器人的经验连续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16203 2026-08-18 cs.SD cs.CL eess.AS 新提交 57%

INSPIRE: A Benchmark for Instruction-Aware Speech Retrieval

INSPIRE:指令感知语音检索基准

Chen-An Li, Hung-yi Lee

机构 * National Taiwan University(台湾大学) NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)(台湾大学人工智能卓越研究中心)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究针对现有语音检索系统无法适配多样用户意图的问题,构建首个指令感知语音检索基准INSPIRE,评估四类检索范式,发现当前无方法能稳健处理所有检索意图,凸显统一架构的必要性。

Comments Interspeech 2026 long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15407 2026-08-18 cs.CR cs.AI cs.NE 新提交 57%

Chameleon: An Adaptive AI-Driven Honeypot Architecture Using Threat-Calibrated Particle Swarm Optimization and Semantic Deception Rapidly-Exploring Random Trees

变色龙:一种采用威胁校准粒子群优化算法与语义欺骗快速探索随机树的自适应AI驱动蜜罐架构

Rohit Swami, Tushar Singh, Akash Warde, Sri Muthu

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 Chameleon是一种开源自适应AI蜜罐平台,通过BiLSTM分类器、Qwen3.5-0.8B模型及TC-PSO、S-RRT引擎,解决传统蜜罐与商业产品的缺陷,性能显著提升且成本大幅降低。

Comments 10 pages, 7 figures, 2 tables. Under consideration for journal publication. MIT-licensed code and datasets: https://github.com/RohitSwami33/Chameleon-cybersecurity-ml

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15224 2026-08-18 cs.LG 新提交 57%

Structuring Semantic Embeddings for Principle Evaluation: A Prototype-Guided Contrastive Learning Approach

用于原则评估的语义嵌入结构化:一种原型引导的对比学习方法

Che Shen, Junwei Su, Lingpeng Kong, Chuan Wu

机构 * The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 本文针对通用文本嵌入在任务区分上的不足,提出PGCL方法,通过多流结合的正则化模块生成任务适配表示,在三个代理任务数据集上均优于原始冻结嵌入,明确了方法适用边界并修订了理论分析。

Comments Accepted for publication in Transactions on Machine Learning Research (TMLR). 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14669 2026-08-18 cs.AI 新提交 57%

Beyond Correctness: Toward Automated Novelty Verification with Lean 4

超越正确性:基于 Lean 4 的自动化新颖性验证研究

Ayrton Porto

机构 * Universidad Nacional del Centro de la Provincia de Buenos Aires (UNICEN)(布宜诺斯艾利斯省国立中部大学(UNICEN))

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出 AViD Journal 流程,基于 Lean 4 从三维度验证数学定理新颖性,评估时发现编译不保证语义保真度等三个通用障碍。

Comments 20 pages. Preliminary version; a large-scale quantitative evaluation (N theorems x M models) is left to future work. Comments welcome. Code: https://github.com/ayrtonporto/avid-journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14663 2026-08-18 cs.LG stat.AP 新提交 57%

In-Context Learning to Assess Built Environment Impacts on Perceived Neighborhood Walkability Among Mobility-impaired Older Adults

基于上下文学习评估建成环境对行动受限老年人感知社区步行便利性的影响

Houhao Liang, Kresimir Friganovic, Joanne Kua, Noor Hafizah Ismail, Su Su, Bryan Yijia Tan, Navrag B. Singh, Panos Mavros

机构 * Future Health Technologies, Singapore-ETH Centre(未来健康技术中心,新加坡-ETH中心) Institute of Geriatrics and Active Ageing, Tan Tock Seng Hospital(陈笃生医院老年病学与 active 老龄化研究所) Geriatric Medicine, Khoo Teck Puat Hospital(邱德拔医院老年医学科) Department of Orthopedic Surgery, Woodlands Health Campus(伍德兰兹健康园区骨科)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本研究采用TabPFN的上下文学习方法,在小规模数据集上较传统模型更优,通过SHAP-IQ揭示高阶特征交互对行动受限老年人感知社区步行便利性的影响。

Comments 8 pages, 2 tables, 1 figure

Journal ref COSIT 2026 Poster Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15373 2026-08-18 cs.LG cs.NA math.NA 新提交 57%

Beyond Field Accuracy: Two-Axis Diagnosis of Inverse-PINN Parameter Error

超越场精度:逆物理信息神经网络参数误差的双轴诊断

Yifan Zhang, Qian Tao

机构 * School of Software Engineering, South China University of Technology(华南理工大学软件学院)

专题命中 评测与基准 :post-training(abstract);分类 cs.LG

AI总结 针对逆PINNs的参数误差问题,提出双轴后训练诊断方法,经三类合成PDE及耦合双参数达西检验验证,可有效分离有限样本分辨率与参数偏好,助力后续研究方向确定。

Comments Preprint with supplementary appendix. 26 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14228 2026-08-17 cs.LG 新提交 57%

AutoSchema: Live Schema Grounding for Agentic Text-to-Sparql over Heterogeneous Knowledge Graphs

AutoSchema:面向异构知识图谱的智能体文本转SPARQL的实时模式接地

Yiming Zhang, Koji Tsuda

机构 * The University of Tokyo(东京大学) National Institute for Materials Science(国立材料科学研究所) RIKEN Center for Advanced Intelligence Project(理化学研究所高级智能项目中心)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 提出无需训练的AutoSchema框架,用于异构知识图谱的智能体文本转SPARQL的实时模式接地,在多项生物医学KGQA等任务中优于TogoMCP,可支持未记录RDF图谱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14130 2026-08-17 cs.MM cs.AI cs.CV cs.HC 新提交 57%

AlignFace: Human-Aligned Face Similarity Metric with Interpretable Concept Relations

AlignFace:具有可解释概念关系的人类对齐人脸相似度度量

Ying Huang, Wencan Zhang, Brian Y. Lim

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本研究针对人脸生成模型评估中现有度量未实现认知对齐的问题,提出AlignFace度量,结合VLM、CA、CBM、GAM等技术,利用FACETS数据集,提升了与人类亚群感知的对齐度。

Comments 10 pages, 10 figures, 2 tables, ACM MM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14054 2026-08-17 cs.LG 新提交 57%

Model-agnostic Retrieval-Augmented Extended Forecasting for time series

模型无关的检索增强扩展预测用于时间序列

Juan Pablo Villa Serna, Rohan Asthana, Vasileios Belagiannis

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 该研究提出模型无关的RAEF方法,通过改进检索与聚合机制提升时间序列预测性能,其效果优于RAF,兼具高效性与竞争力,可替代微调用于时间序列预测的领域适配。

Comments 6 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏