arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4182 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 1022 篇

2606.18195 2026-06-26 cs.CL 新提交 57%

Learning from the Self-future: On-policy Self-distillation for dLLMs

从自我未来学习:面向扩散LLM的在线自蒸馏

Yifu Luo, Zeyu Chen, Haoyu Wang, Xinhao Hu, Yuxuan Zhang, Zhizhou Sha, Shiwei Liu

机构 * Tsinghua University(清华大学) Technical University of Munich(慕尼黑工业大学) Nanyang Technological University(南洋理工大学) University of British Columbia(不列颠哥伦比亚大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) ELLIS Institute Tubingen(ELLIS蒂宾根研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tubingen AI Center(蒂宾根人工智能中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出首个面向扩散大语言模型的在线自蒸馏框架d-OPSD,通过自我生成答案作为后缀条件实现从自我未来经验学习,并将监督从词元级转向步骤级,在推理基准上以约10%的优化步骤超越RLVR和SFT基线。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25491 2026-06-25 cs.CV cs.AI 新提交 57%

HG-Bench: A Benchmark for Multi-Page Handwritten Answer-Region Grounding in Automated Homework Assessment

HG-Bench: 自动作业批改中多页手写答案区域定位的基准

Chuangxin Zhao, Boyan Shi, Yanling Wang, Yijian LU, Canran Xiao, Jiali Chen, Jun Xia, Yan Wang, Ji Qi, Juanzi Li

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对自动作业批改中多页手写答案区域定位的缺失评估,提出HG-Bench基准,包含500个带层级标注的样本,并设计页面感知评估协议,揭示现有模型在步骤级定位上的能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25402 2026-06-25 cs.SE cs.AI 新提交 57%

LibEvoBench: Probing Temporal Knowledge Stratification in Code Generation Models

LibEvoBench:探测代码生成模型中的时间知识分层

Daniele Cipollone, Sergey Titov, Maliheh Izadi, Egor Bogomolov, Arie van Deursen

机构 * Faculty of EEMCS, Delft University of Technology, Delft, Netherlands(代尔夫特理工大学电子工程与信息科学学院) JetBrains Research, Amsterdam, Netherlands(JetBrains研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对LLM在代码生成中因训练数据时间混合导致API版本混淆的问题,提出多版本基准LibEvoBench和新指标SEUS,揭示模型对版本不敏感且仅靠文档可提升准确性。

Comments Accepted at the DL4Code workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25007 2026-06-25 cs.LG q-fin.ST 新提交 57%

Multi-Stream Temporal Fusion for Financial Fraud Detection

面向金融欺诈检测的多流时序融合

Mohammadamin Dashti Moghaddam, Nick Sciarrilli

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出多流欺诈Transformer(MSFT),通过独立编码交易、登录、风险等多事件流并融合表示,在千万用户数据集上AUROC达0.996,优于单流Transformer和XGBoost。

Comments 10 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18936 2026-06-25 cs.AI cs.CY 新提交 57%

SciRisk-Bench: A Risk-Dimension-Aware Benchmark for AI4Science Safety

SciRisk-Bench:面向AI4Science安全的风险维度感知基准

Linghao Feng, Yinqian Sun, Dongqi Liang, Sicheng Shen, Chenfei Yan, Yuxuan Peng, Yilin Zhao, Haibo Tong, Kai Li, FeiFei Zhao, Yi Zeng

机构 * Brain-inspired Cognitive Intelligence Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(脑启发认知智能实验室,自动化研究所,中国科学院,北京,中国) School of Future Technology, University of Chinese Academy of Sciences, China(未来技术学院,中国科学院大学,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, China(人工智能学院,中国科学院大学,中国) Zhongguancun Academy, China(中关村学院,中国) Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) Gaoling School of AI, Renmin University of China(甘露人工智能学院,中国人民大学) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院(北京-AISI)) School of Humanities, University of Chinese Academy of Sciences, China(人文学院,中国科学院大学,中国)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 提出SciRisk-Bench基准,从显式风险维度和科学学科两个角度评估AI4Science安全,覆盖7个学科、31个子学科和10个风险维度,实验揭示主流及科学大模型的安全薄弱环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24834 2026-06-24 cs.AI 新提交 57%

Accuracy and Satisfaction in Multi-Turn LLM Dialogues for NFR Assessment

多轮LLM对话中NFR评估的准确性与满意度

Ali Pourghasemi Fatideh, Wilder Baldwin, Maria Dhakal, Collin McMillan, Sepideh Ghanavati

机构 * University of Maine(缅因大学) University of Notre Dame(圣母大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究开发者在与LLM对话助手评估非功能需求(NFR)时的准确性和满意度,发现开发者倾向于同意LLM评估但准确性低,且长回复和过多信息提供轮次降低满意度,而主动交互提升满意度。

Comments 9 pages, 5 figures. Accepted to SIGDIAL 2026 (27th Annual Meeting of the Special Interest Group on Discourse and Dialogue)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24820 2026-06-24 cs.CL 新提交 57%

SHERLOC: Structured Diagnostic Localization for Code Repair Agents

SHERLOC: 代码修复智能体的结构化诊断定位

Hovhannes Tamoyan, Sean Narenthiran, Erik Arakelyan, Mira Mezini, Boris Ginsburg

机构 * NVIDIA(英伟达) Santa Clara, CA 95051, USA(美国加利福尼亚州圣克拉拉) TU Darmstadt(达姆施塔特工业大学) National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出SHERLOC框架,通过推理LLM与紧凑仓库工具及自恢复机制,实现无需微调的结构化诊断定位,在SWE-Bench上达到最优定位精度,并提升修复率、降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24797 2026-06-24 cs.CV cs.AI 新提交 57%

EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence

EG-VQA: 基于接地时间证据的可验证视频问答基准

Linpeng Huang, Weixing Chen, Zexin Chen, Yang Liu, Liang Lin

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Shenzhen University(深圳大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出EG-VQA基准,通过细粒度时间证据标注和EG-F1指标,揭示视频大模型在答案正确性与证据定位之间的差距,并引入EG-Reasoner模型弥合这一差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24346 2026-06-24 cs.IR cs.CL 新提交 57%

PETRA: Transforming Web Text for Petroleum-Engineering Domain Adaptation

PETRA: 将网络文本转化为石油工程领域适应的数据集

Kirill Dubovikov, Omar El Mansouri, Hachem Madmoun, Yanda Li, Sandeep Kumar, Aya El Mir, Supriyo Ghosh, Writabrata Bhattacharya, Adrian Garcia-Garcia, Onkar Pandit, Sunil Kumar Sahu, Federico Castanedo, Larry Murray, Martin Takac, Salem Lahlou

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院) Inception AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对石油工程检索中领域标签稀缺的问题,提出PETRA数据集和流程,通过噪声网络数据构建领域语料和合成监督信号,显著提升检索与重排序性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24145 2026-06-24 cs.AI 新提交 57%

T2D-Bench: Evidence-Gated Evaluation of LLM Outputs for Type 2 Diabetes Using a Multi-Layer Clinical-Lifestyle Knowledge Graph

T2D-Bench:基于多层临床-生活方式知识图谱的2型糖尿病LLM输出证据门控评估

Saba A. Farahani, Hung Cao, Ramesh Jain, Amir M. Rahmani

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 提出T2D-Bench基准,通过多层知识图谱和证据门控机制,检测LLM输出中未满足指南约束的临床遗漏,并在2型糖尿病诊断、用药安全等场景中实现可测量纠正。

Comments 7 pages, 2 figures, 2 tables. Accepted as a poster at AMIA 2026 Annual Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24066 2026-06-24 cs.SD cs.CL eess.AS 新提交 57%

VieSpeaker: A Large-Scale Vietnamese Speaker Recognition Dataset Beyond Visual Dependency

VieSpeaker:超越视觉依赖的大规模越南语说话人识别数据集

Viet Hoang Pham, Tran Trung Nguyen, Bao Thu Ho, Phuong Tuan Dat, Thi Thu Trang Nguyen

机构 * Hanoi University of Science and Technology(河内科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出无需面部线索的数据集构建流程,利用文本元数据和大型语言模型推理说话人身份,构建包含4715名说话人约902小时语音的越南语数据集VieSpeaker,实验证明其提升模型鲁棒性和泛化能力。

Comments 5 pages, 1 figure, 6 tables, Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13189 2026-06-24 cs.CL 新提交 57%

SICI: A Semantic-Pragmatic Complexity Index Reveals Regime Shifts in LLM Stance Detection

SICI:一种揭示LLM立场检测中相变的语义-语用复杂度指数

Fuqiang Niu, Bowen Zhang

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出SICI指数,从七维语义-语用复杂度诊断立场检测难度,揭示LLM错误随复杂度增加从过度归因到集中弃权的相变规律,且干预方法仅沿归因-弃权轴移动而非消除瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23459 2026-06-23 cs.CL 新提交 57%

TriggerBench: Investigating Prospective Memory for Large Language Models

TriggerBench: 探究大型语言模型的前瞻记忆

Tianhua Zhang, Xinjiang Wang, Qianxi Zhang, Qi Chen, Kun Li, Yaoqi Chen, Dingdong Wang, Helen Meng, Yan Lu

机构 * The Chinese University of Hong Kong(香港中文大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出TriggerBench基准,系统评估LLM的前瞻记忆能力,发现其存在精度-召回权衡、注意力脆弱性,且比回溯记忆更难,可作为推理能力的指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23243 2026-06-23 cs.LG cs.SD 新提交 57%

Unlocking In-Context Learning in Audio-Language Models from Decentralized Medical Audio

从分散的医疗音频中解锁音频-语言模型的上下文学习

Ran Piao, Tsai-Ning Wang, Martijn den Dekker, Linda Moonen, Hareld Kemps, Yuan Lu, Aaqib Saeed

机构 * Eindhoven University of Technology(埃因霍温理工大学) Erasmus MC(伊拉斯姆斯医学中心) Rijnstate Hospital(莱茵州医院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出联邦自上下文学习(FSC)框架,通过无监督聚类构建伪标签片段,结合渐进式三阶段流水线,在联邦医院客户端实现少样本临床音频诊断,准确率达71.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23205 2026-06-23 cs.CY cs.AI cs.IR 新提交 57%

The Correct Answer Trap: Pedagogically-Grounded Detection and Feedback for Hidden Misconceptions

正确答案陷阱:基于教学法的隐藏误解检测与反馈

Moiz Imran, Sahan Bulathwela

机构 * Department of Computer Science, University College London, The United Kingdom(伦敦大学学院计算机科学系,英国) Centre for Artificial Intelligence, University College London, The United Kingdom(伦敦大学学院人工智能中心,英国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对学生通过错误推理得到正确答案时隐藏的误解,提出检测与反馈方法,利用分类器和推理模型检测,并设计分级评估与检测-验证-升级流程以减少误报。

Comments Accepted at the AIED PEAF 2026: Workshop on Pedagogical Evaluation of Automated Feedback, June 28, 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23175 2026-06-23 cs.LG 新提交 57%

Position: Correct Answer, Wrong Mechanism -- When AI Scientists Defend General Claims Their Own Data Contradicts

立场:正确答案,错误机制——当AI科学家用自身数据反驳其通用主张时

Steven Young Eulig

机构 * Department of Physics and Laboratory for Particle Physics and Cosmology (LPPC), Harvard University(哈佛大学物理系与粒子物理与宇宙学实验室(LPPC))

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文通过编码代理在Geant4模拟中重新发现已知粒子识别可观测量的实验,指出仅以最终结果评估AI科学家系统不足,提出需分别衡量任务结果、机制保真度和认知诚实性,并发现正确答案但错误机制(CAWM)现象。

Comments 8 pages body plus 12 pages references and appendix, non-archival upload for ICML 2026 AI for Science workshop, selected as spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22936 2026-06-23 cs.AI 新提交 57%

When Agents Commit Too Soon: Diagnosing Premature Commitment in LLM Agents

当智能体过早承诺:诊断LLM智能体中的过早承诺问题

Aman Mehta

机构 * Snowflake AI Research

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出表征承诺作为跨运行隐藏状态收敛的指标,用于诊断长程LLM智能体过早承诺问题,并在多个模型和数据集上验证其预测轨迹一致性的能力。

Comments 22 pages, 16 figures Primary: cs.AI Secondary: cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22792 2026-06-23 cs.AI 新提交 57%

The Origins of Stochasticity: Comprehensive Investigations on Uncertainty Quantification for Large Language Models

随机性的起源:大型语言模型不确定性量化的综合研究

Xiang-Jun Ou, Shuang Liang, Xin-Yu Hu, Rong-Hao Huang, Jing Wang, Shao-Qun Zhang

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) School of Intelligent Science and Technology(智能科学与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出细粒度不确定性分类法,将LLM不确定性归因于输入、参数、标记和解码过程,并评估21种UQ方法,发现基于共识的方法(Deg和EigV)表现最佳,且模型规模与不确定性负相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22470 2026-06-23 cs.AI 新提交 57%

PRIME: Evaluating Prompt Resolution Under Incompatible Instructions in LLMs

PRIME: 评估大语言模型在不兼容指令下的提示解决能力

Tehreem Javed, Shumaim Fatimah, Masooma Bakhtiari, Gibrail Islam, Mehwish Fatima

机构 * School of Electrical Engineering Computer Science (SEECS), National University of Sciences

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出PRIME框架,通过生成校准冲突(响应长度、输出格式、推理)并采用确定性行为分类法,分析大语言模型处理冲突指令的行为,发现冲突类型比模型规模对行为影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21147 2026-06-23 cs.SD cs.AI 新提交 57%

AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?

AOR-Bench: 大型音频语言模型是否会过度拒绝伪有害查询?

Jiaxi Yang, Chaewan Chun, Jason Lucas, Yuchen Yang, Dongwon Lee

机构 * Penn State University(宾夕法尼亚州立大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 提出首个针对大型音频语言模型过度拒绝问题的基准AOR-Bench,包含3000个伪有害音频样本,评估12个模型发现过度拒绝普遍存在,并探索了两种轻量缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20570 2026-06-23 cs.NI cs.AI cs.DC cs.MA 新提交 57%

Infrastructure for the Agentic Web: Gap Analysis and Architecture from the Agentverse Platform

代理网络的基础设施:来自Agentverse平台的差距分析与架构

Robin Dey, Panyanon Viradecha

机构 * OpenHub Research(开放 hub 研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过实证审计Agentverse平台,识别出8类62项缺失能力,提出七层代理云栈参考架构,并规划了从存储到经济原语的五条关键演进路径,为2030年实现Web4代理云提供技术路线。

Comments 28 pages, 11 tables, 1 figure. Preprint, not peer-reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09013 2026-06-23 cs.CL 新提交 57%

Beyond Averages: Evaluating LLMs on Human Survey Replication at the Distributional Level

超越平均值:在分布层面评估LLM对人类调查的复现能力

Jeonghyeon Moon, Jiwon Kim, Yeheum Lah, Yoonju Han, Yuncheol Kang

机构 * Ewha Womans University(梨花女子大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过非公开的韩国方便面购买实验,在分布层面评估LLM复现人类调查响应的能力,发现均值匹配的模型可能产生更偏离人类的分布,且结构化角色和多模态输入提升对齐度,而推理提示则降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20517 2026-06-19 cs.AI cs.PL 新提交 57%

Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages

Multi-LCB: 将 LiveCodeBench 扩展到多种编程语言

Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko Pavel, Ivan Lopatin, Alexey Kutalev, Dmitrii Babaev

机构 * GigaCode Yandex School of Data Analysis, Applied AI Institute(Yandex数据分析学院,应用人工智能研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出 Multi-LCB 基准,将 LiveCodeBench 的 Python 任务扩展到 12 种编程语言,评估 LLM 跨语言代码生成能力,发现 Python 过拟合和语言特定污染等问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19847 2026-06-19 cs.CL 新提交 57%

AtomMem: Building Simple and Effective Memory System for LLM Agents via Atomic Facts

AtomMem: 通过原子事实构建简单有效的LLM智能体记忆系统

Yanyu Yao, Shangze Li, Zhi Zheng, Hui Zheng, Qi Liu, Tong Xu, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室) Anhui University(安徽大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对现有记忆系统存储粗粒度、更新不稳定的问题,提出AtomMem,通过事实执行器提取高价值原子事实作为高效记忆表示,并组织为层次化事件结构和时间档案,实现价值密集存储和稳定演化,在LoCoMo基准上取得最优性能。

Comments 19 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19704 2026-06-19 cs.AI 新提交 57%

Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents

超越静态排行榜:LLM智能体评估的预测有效性

Dhaval C. Patel, Kaoutar El Maghraoui, Shuxin Lin, Yusheng Li, Tianjun Feng, Chun-Yi Tsai, Yihan Sun, Wei Alexander Xin, Akshat Bhandari, Tanisha Rathod, Aaron Fan, Sanskruti Vijay Shejwal, Tomas Pasiecznik, Sagar Chethan Kumar, Tanmay Agarwal, Rohith Kanathur, Sam Colman, Amaan Sheikh, Dev Bahl, Ann Li, Krish Veera, Alimurtaza Mustafa Merchant, Shambhawi Baswaraj Bhure, Sajal Kumar Goyla, Chengrui Li, Kirthana Natarajan, Rui Li, Thomas Ajai, Rujing Li, Vivek G. Iyer, Sanjaii Vijayakumar, Yitong Bai, Ayal Yakobe, Darief Maes, Yassine Jebbouri, Tianyang Xu, Thai Quoc On, Vera Mazeeva, Winston Li, Yuval Shemla, Yeshitha Bhuvanesh, Rushin Bhatt, Siddharth Chethan Gowda, Alisha Vinod, Caroline Cahill, Shriya Aishani Rachakonda, Yunfeng Chen, Aryaman Agrawal, Aman Upganlawar, Mao Le Jonathan Ang, Yubin Sally Go, Madhav Rajkondawar, Yang-Jung Chen, Trisha Maturi, Ananya Kapoor, Andrew Li, Shrey Arora, Mana Abbaszadeh, Shen Li, Charles Xu, Byeolah Kwon

机构 * IBM

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过14项并行研究,论证聚合分数排行榜无法泛化到分布外场景,提出基于预测有效性的排名配置方法,并设计可证伪的分布外评估标准。

Comments 17 pages, 2 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19552 2026-06-19 cs.CL 新提交 57%

LaViSA: A Language and Vision Structural Ambiguity Benchmark

LaViSA:语言与视觉结构歧义基准

Lee Sangmyeong, Shun Inadumi, Koichiro Yoshino

机构 * Nara Institute of Science and Technology(奈良先端科学技术大学院大学) Guardian Robot Project RIKEN(RIKEN守护机器人项目) The University of Osaka(大阪大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出LaViSA基准,通过七类歧义句及对应图像评估视觉语言模型利用视觉场景解决结构歧义的能力,实验显示现有模型虽能部分利用视觉信息,但在特定歧义类型和细微语义区分上仍有局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19382 2026-06-19 cs.SE cs.AI 新提交 57%

DynAMO:Dynamic Asset Management Orchestration via Topological Multi-Agent Scheduling

DynAMO:基于拓扑多智能体调度的动态资产管理编排

Kanishk Kushwaha, Vikrant Vinod Bansode, Harsh Vardhan, Dhaval C. Patel

机构 * Gati Shakti Vishwavidyalaya(加蒂·沙克蒂大学) IBM Research(IBM研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出DynAMO引擎,采用先规划后执行架构生成可验证工作流图,支持顺序与并行执行,通过动态识别独立任务提升效率,在工业基准上实现1.6倍延迟降低,并保持正确性与安全性。

Comments 11 pages, 2 figures, 7 tables, 4 algorithms. Evaluated on the AssetOpsBench industrial benchmark. Code: https://github.com/kushwaha001/DynAMO

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19364 2026-06-19 cs.LG 新提交 57%

Closing the Social-Semantic Gap: SPSD for Edge-Based Prompt Compression in Cloud LLM Inference

缩小社会-语义差距:SPSD用于云LLM推理中的边缘端提示压缩

Abhinit Sen, Ajeet Kumar, Manaranjan Pradhan

机构 * Indian School of Business(印度管理学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 针对云LLM推理中提示词预填充阶段能耗高的问题,提出SPSD边缘端管道,利用4比特量化小语言模型压缩用户提示,在保持响应质量非劣效的前提下,平均节省99.9个输入token,每调用净节能70-270 uWh。

Comments 19 pages, 7 tables, 1 figure, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18257 2026-06-18 cs.HC cs.AI 新提交 57%

From Memorization to Creation: Evaluating the Cognitive Depth of LLM-Generated Educational Questions

从记忆到创造:评估LLM生成的教育问题的认知深度

Xiaolong Wang, Zhe Zhao, Song Lai, Chaoli Zhang, Zijie Geng, Yu Tong, Ye Wei, Qingsong Wen

机构 * City University of Hong Kong(香港城市大学) Zhejiang Normal University(浙江师范大学) Squirrel Ai Learning University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 通过布鲁姆认知分类学评估六种LLM生成问题的认知层次,提出细粒度提示策略减少重复性并提升高阶认知比例,引入认知转移强度和类别漂移指标,揭示链式思维提示的可解释性。

Comments Accepted by KDD 2026

Journal ref KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18192 2026-06-18 cs.AI 新提交 57%

The Stanford EDGAR Filings Dataset: Reconstructing U.S. Corporate and Financial Disclosures into Layout-Faithful and Token-Efficient Pretraining Data

斯坦福EDGAR文件数据集:将美国公司及财务披露重建为布局忠实且令牌高效的预训练数据

Nick Bettencourt, Xiaowei Ding, Kay Giesecke

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Nanjing University(南京大学) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 为解决长上下文文档稀缺问题,提出SEFD数据集,将SEC文件重建为布局忠实的MultiMarkdown格式,用于金融语言建模与评估,具有令牌高效、与Common Crawl重叠率低于0.1%的特点。

Comments Preprint. Includes appendix, tables, and figures

详情

展开后加载摘要…

URL PDF HTML 收藏