Mapping Overlaps in Benchmarks through Perplexity in the Wild
通过在野 perplexity 映射重叠关系
机构 * Data Science Institute, University of Chicago(芝加哥大学数据科学研究所)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 通过分析LLM基准测试的perplexity,揭示了不同任务间的重叠结构及LLM能力差异。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
通过在野 perplexity 映射重叠关系
机构 * Data Science Institute, University of Chicago(芝加哥大学数据科学研究所)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 通过分析LLM基准测试的perplexity,揭示了不同任务间的重叠结构及LLM能力差异。
MICA:多智能体工业协调助手
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄大学) ; INSAIT ; Hunan University(湖南大学) ; Carl Zeiss Stiftung(卡尔蔡司基金会) ; University of Excellence(卓越大学) ; Helmholtz Association(海德堡协会) ; State of Baden-Württemberg(巴登-符腾堡州) ; German Research Foundation(德国研究基金会) ; National Natural Science Foundation of China(国家自然科学基金委员会) ; Hunan Provincial Research and Development Project(湖南省研发项目) ; State Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 MICA是一种基于感知和语音交互的多智能体系统,通过自适应步骤融合技术提升工业任务的执行效率和可靠性。
Comments Accepted to ICRA 2026. The source code will be made publicly available at https://github.com/Kratos-Wen/MICA
评估大型语言模型的金融智能:用LLM引擎基准测试SuperInvesting AI
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出AFIB基准测试,评估SuperInvesting等AI系统在金融分析中的性能,发现SuperInvesting在准确性、完整性和一致性方面表现最优。
Comments 12 pages, 6 Figures, 5 Tables
语言模型知道Theo有妻子吗?探究 proviso 问题
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文通过设计诊断数据集,探究语言模型在处理条件句预设问题时的推理能力,发现模型依赖浅层模式匹配而非深度语义分析。
自主LLM代理的记忆:机制、评估与新兴前沿
机构 * Hong Kong Research Institute of Technology(香港理工大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文探讨了自主LLM代理中记忆的机制、评估及未来发展方向,分析了五种核心机制及评估挑战,强调记忆对代理适应性和应用的重要性。
MAS-H2:一种用于整体云原生自动扩展的分层多智能体系统
机构 * University of Westminster(威斯敏斯特大学) ; University of York(约克大学)
专题命中 推理评测 :planning(abstract);分类 cs.LG
AI总结 MAS-H2通过分层多智能体系统实现云原生自动扩展的前瞻性管理,减少资源浪费和性能下降,提升系统稳定性与资源利用效率。
iGVLM:动态指令引导的视觉编码用于问题感知的多模态理解
机构 * School of Computer Science(计算机科学学院) ; Technology, Huazhong University of Science(科技,华中科技大学) ; Li Auto Inc.(Li汽车公司) ; Institute of AI for Industries, Chinese Academy of Sciences(产业人工智能研究所,中国科学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 iGVLM通过动态指令引导的视觉编码框架,提升多模态理解中对指令的敏感度,实现从通用感知到任务感知推理的平滑过渡。
构建未来的伦理AI框架:从哲学到实践
机构 * Graduate School of Global Studies(全球研究研究生院) ; Tokyo University of Foreign Studies(东京外国语大学) ; AI Product Development Division(人工智能产品开发部门) ; Money Forward, Inc.(Money Forward公司)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出了一种伦理设计控制架构,通过三重闸门机制整合后果论、义务论和美德伦理,为AI生命周期提供可执行的治理方案。
Journal ref AI Ethics 6, 150 (2026)
DrivingGen:自主驾驶中生成视频世界模型的综合性基准
机构 * University of Toronto(多伦多大学) ; CUHK MMLab(香港中文大学MMLab)
专题命中 推理评测 :planning(abstract);分类 cs.AI
AI总结 DrivingGen提出首个综合性基准,用于评估生成驾驶世界模型的视觉真实性、轨迹合理性、时间一致性和可控性,揭示通用与专用模型间的权衡。
Comments ICLR 2026 Poster; Project Website: https://drivinggen-bench.github.io/
面向人类的LLM-智能体系统用于检测异常数字资产交易
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 HCLA是一种面向人类的多智能体系统,用于通过自然语言交互提高数字资产交易异常检测的可解释性和透明度。
跨层分配注意力以减少多模态幻觉
机构 * Beijing University of Posts and Telecommunications, China(北京邮电大学) ; Nanyang Technological University, Singapore(南洋理工大学) ; Guangxi Transportation Science and Technology Group, China(广西交通科学和技术集团)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 通过跨层分配注意力减少多模态幻觉,提升推理一致性和视觉忠实性。
Comments Acceptted by CVPR2026
模型的视觉感知是否与人类视觉一致?探测LVLM表示与EEG信号之间的对应关系
专题命中 推理评测 :reasoning(abstract)
AI总结 本文通过EEG信号分析,揭示了LVLM的视觉表示与人类大脑的对应关系,发现中间层与EEG活动对齐,多模态架构提升大脑对齐性,且视觉表现强的模型EEG相似性更高。
为何大语言模型可以秘密超越嵌入相似性在信息检索中的表现
专题命中 推理评测 :reasoning(abstract)
AI总结 本文探讨了大语言模型在信息检索中通过推理超越传统嵌入相似性方法的潜力,并指出当前注释数据集难以准确评估其效果。
Comments 13 pages, 6 figures, 5 tables
用眼睛倾听:跨时空的自体视觉共指基准测试
机构 * Beijing Jiaotong University(北京交通大学) ; Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences (CASIA)(基础模型研究中心、自动化研究所、中国科学院(CASIA)) ; Tencent Robotics X(腾讯机器人X) ; Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST)(计算机科学与工程系、香港科学与技术大学(HKUST)) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出EcoG-Bench,通过严格测试语音-手势绑定,揭示多模态接口可能限制时间对齐线索的可观察性。
OrdinalBench: 一种用于诊断视觉-语言模型在序数理解通用性限制的基准数据集
机构 * Division of Frontier Informatics, Kyoto Sangyo University, Kyoto, Japan(前沿信息学系,京都精华大学,京都,日本)
专题命中 推理评测 :reasoning(abstract)
AI总结 OrdinalBench通过评估视觉-语言模型在序数理解上的表现,揭示其在大序数和复杂路径条件下的泛化能力不足问题。
Comments Accepted as a Short Paper at VISAPP 2026
VIVECaption:一种改进标题质量的分步方法
机构 * Adobe Inc.(Adobe公司)
专题命中 推理评测 :reasoning(abstract)
AI总结 VIVECaption通过双面方法改进标题质量,利用分层抽样和模型对齐策略提升图像-标题对齐效果,提供高质量训练数据解决方案。
TAPFormer: 通过帧和事件的瞬态异步融合实现鲁棒的任意点跟踪
机构 * National University of Defense Technology(国防科技大学) ; Hunan University(湖南大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 TAPFormer通过帧和事件的瞬态异步融合实现鲁棒的任意点跟踪,提升跟踪精度和鲁棒性。
测量音频对正确性的影响:面向大音频语言模型的音频贡献意识后训练
专题命中 推理评测 :chain-of-thought(abstract)
AI总结 本文提出AudioMCQ数据集和Audio-Contribution Filtering方法,通过弱到强和混合到强的后训练范式,提升大音频语言模型的音频贡献意识和性能。
InterMind:由大型语言模型赋能的医生-患者-家庭交互式抑郁症评估系统
专题命中 推理评测 :CoT(abstract)
AI总结 InterMind利用大型语言模型,通过医生、患者和家庭的互动提升抑郁症评估的精确性和效率。
Comments Accepted at ACM Multimedia 2025
评估多智能体LLM架构在罕见病诊断中的表现
专题命中 推理评测 :reasoning(abstract)
AI总结 本研究评估了多智能体LLM架构在罕见病诊断中的表现,发现分层结构略优于其他拓扑,而对抗模型性能显著下降,支持动态拓扑选择的重要性。
SIQA:迈向可靠的科学图像质量评估
机构 * TongJi University(同济大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 SIQA提出了一种多维框架,通过SIQA-U和SIQA-S评估科学图像的科学正确性和感知清晰度,揭示模型在评分一致性与科学理解上的差异。
隐形微调:通过自动生成的CoT打破RVLMs的对齐
机构 * Machine Intelligence Laboratory, Sichuan University(四川大学人工智能实验室) ; University of Wisconsin--Madison(威斯康星大学麦迪逊分校) ; Department of Automation, Tsinghua University(清华大学自动化系) ; Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心)
专题命中 其他推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本文提出隐形微调方法,通过分段干扰和自动生成输出,有效绕过RVLMs的安全对齐防御,实现更高的ASR性能同时保持推理能力。
Comments 15 pages, 7 figures
解构大音频-语言模型中的推理能力以实现模糊情绪预测
机构 * University of Auckland, New Zealand(奥克兰大学) ; The University of Melbourne, Australia(墨尔本大学) ; University of Birmingham, United Kingdom(伯明翰大学)
专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文提出了一种新的方法,通过将模糊情绪识别转化为分布推理问题,提升大音频-语言模型在模糊情绪预测中的推理能力。
Comments The paper was submitted to Interspeech for review
科学素养:生成式AI在科学知识与推理教学、学习和评估中的促进作用
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文探讨生成式AI在提升科学素养中的作用,分析其在教学、学习和评估中的应用挑战与解决方案。
基于图基础模型的路径感知图RAG中最小和充分推理子图检索
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文提出GFM-Retriever,通过图基础模型实现路径感知的子图检索,提升多跳问答任务的检索与生成性能。
CrystaL: MLLMs中视觉潜在特征的自发涌现
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 CrystaL通过显式对齐注意力模式和预测分布,实现视觉潜在特征的自发涌现,提升细粒度视觉理解和推理能力。
PonderLM-2: 在连续空间中通过潜在思想预训练语言模型
机构 * LUMIA Lab(LUMIA实验室) ; School of Artificial Intelligence(人工智能学院) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院) ; Sun Yat-sen University(中山大学)
专题命中 其他推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 PonderLM-2通过在预训练过程中引入潜在思想的连续空间优化,提升了语言模型的生成能力与下游任务表现。
通过对话摘要和人物信息增强Werewolf AI的一致性
机构 * The University of Electro-Communications(电通大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过对话摘要和人物信息提升Werewolf AI代理发言的一致性。
Comments Accepted to the 2nd International AIWolfDial Workshop at INLG 2024
黑暗三联征模型生物:对齐偏差:狭窄微调映射人类反社会行为
机构 * Brain & Creativity Institute, University of Southern California(大脑与创造力研究所,南加州大学) ; Department of Psychology, University of Southern California(心理学系,南加州大学) ; Interchange Forum for Reflecting on Intelligent Systems, University of Stuttgart(智能系统反思交流论坛,斯图加特大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文通过黑暗三联征框架,研究LLM中的对齐偏差问题,通过微调诱导反社会行为,揭示LLM中潜在的人格结构。
Comments 38 pages, 17 figures
SplitAgent: 一种隐私保护的企业-云代理协作分布式架构
专题命中 其他推理 :reasoning(abstract);分类 cs.AI
AI总结 SplitAgent通过语境感知的动态去敏化技术,实现企业与云代理间的隐私保护协作,提升任务准确率并减少隐私泄露。