arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-06 至 2026-08-06 共收录 35 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 35 篇

2604.21396 2026-08-06 cs.CV cs.AI 95%

VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought

VG-CoT:通过 grounded Chain-of-Thought 实现可信的视觉推理

Byeonggeuk Lim, Kyeonghyun Kim, JungMin Yun, YoungBin Kim

机构 * Graduate School of Advanced Imaging Science, Multimedia & Film, Chung-Ang University(高级影像科学、多媒体与电影研究生院, Chung-Ang 大学) Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学)

专题命中 推理评测 :CoT(title,title_cn);chain-of-thought(title,title_cn);reasoning(title,abstract);分类 cs.AI

AI总结 本文提出 VG-CoT 数据集,通过自动化三阶段流程将推理步骤与图像真实视觉证据联系起来,提升大视觉-语言模型的可信度和推理能力。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04735 2026-08-06 cs.AI 新提交 89%

Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings

思维链监控在隐含影响场景中可能不可靠

Agatha Duzan, Asa Cooper Stickland

机构 * EPFL(洛桑联邦理工学院) UK AI Security Institute(英国人工智能安全研究院)

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI

AI总结 该研究引入首个基准对比显式与隐含影响场景下思维链监控的可检测性,发现显式场景下检测率为60%-94%,隐含场景下下降41-46个百分点,善意部署选择还会进一步降低检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04524 2026-08-06 cs.CL cs.LG 新提交 86%

ODRA: Synthesizing Cognitive Behavioral Therapy Sessions with Structured Chain-Of-Thought and Dynamic Patient Resistance

ODRA:结合结构化思维链与动态患者阻抗的认知行为治疗会话合成

Javier Rodriguez-Juan, Hiba Arnaout, Jose Garcia-Rodriguez, David Tomás, Iryna Gurevych

机构 * University of Alicante(阿利坎特大学) Technische Universität Darmstadt(达姆施塔特工业大学) Hessian Center for AI (hessian.AI)(黑森人工智能中心)

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本研究提出ODRA框架,结合结构化思维链与动态患者阻抗建模合成CBT会话,解决现有方法的顺从性问题,其生成的会话及微调数据集可提升下游治疗性能。

Comments 39 pages, 23 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14591 2026-08-06 cs.SD cs.AI 版本更新 85%

AudioDER: A Deduplication-Enhanced Reasoning Dataset for Post-Training Large Audio-Language Models

AudioDER: 一种用于后训练大型音频语言模型的去重增强推理数据集

Hui Geng, Yi Su, Zijian Gao, Tianjiao Wan, Qisheng Xu, Jiaxin Chen, Hengzhu Liu, Kele Xu

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Shanghai Jiaotong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract_cn);分类 cs.AI

AI总结 针对现有音频-语言数据集冗余导致后训练效果下降的问题,提出基于声学相似性去重的数据构建流程,生成包含191k样本的推理导向数据集AudioDER,显著提升LALM在多个音频推理基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04434 2026-08-06 cs.CV 新提交 82%

OmniRouting: A Semantic-Coupled Multimodal Benchmark for Constraint-Aware Spatial Reasoning in PCB Routing

OmniRouting:面向PCB布线中约束感知空间推理的语义耦合多模态基准

Taiting Lu, Kaiyuan Lin, Ziwei Dong, Sisong Bei, Haolin Ye, Yuxin Tian, Runze Liu, Mingjia Wang, Jingying Zeng, Hongxing Pan, Kai Zhang, Haoyu Wang, Guoliang Shi, Ling Ma, Yifan Yang, Jiaying Lu, Qi He, Yi-Chao Chen, Sung-Liang Chen, Yincheng Jin, Mahanth Gowda

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

AI总结 本研究针对LLMs在PCB布线推理上的能力缺口,构建了OmniRouting基准,含1681个工业级PCB设计及四项任务,发现现有LMMs存在显著局限并计划开源相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04591 2026-08-06 cs.CL cs.AI 新提交 81%

When Absence Is Evidence: Evaluating Completeness-Sensitive Negative Reasoning in Large Language Models

当缺失即证据:评估大语言模型中对完整性敏感的负向推理能力

Byoungjae Min, Kennedy Edemacu, Sae-Hong Cho, Yoonhyuk Choi, Beakcheol Jang, Jong Wook Kim

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大语言模型的完整性敏感负向推理能力,构建CROWN-QA评估基准,发现模型存在过度闭合等问题,提示无法持续解决错误,且部分覆盖不对称性在真实文档中依然存在。

Comments 19 pages, 2 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04519 2026-08-06 cs.AI cs.CL 新提交 81%

Leak-Resistant Unlearning: A New Benchmark for Evaluating Multi-Hop Reasoning Consistency and Recovery Robustness

防泄露遗忘:评估多跳推理一致性与恢复鲁棒性的新基准

Haoting Qian, Qingjie Zhang, Zhicong Huang, Cheng Hong, Han Qiu

机构 * Tsinghua University(清华大学) Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出新基准unlearning评估LLM遗忘的鲁棒性,实验发现现有遗忘方法易受多跳推理路径和恢复攻击影响,还探究了遗忘质量、鲁棒性与模型效用的权衡。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00513 2026-08-06 cs.LG cs.AI cs.CV cs.IR 版本更新 81%

MOON3.0: Reasoning-aware Multimodal Representation Learning for E-commerce Product Understanding

MOON3.0: 基于推理的多模态表示学习用于电商产品理解

Junxian Wu, Chenghan Fu, Zhanheng Nie, Daoze Zhang, Bowen Wan, Wanxian Guan, Chuan Yu, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 MOON3.0通过多头模态融合、联合对比与强化学习框架及细粒度残差增强模块,提升电商产品细粒度属性建模能力,并在大规模多模态电商基准MBe3.0上实现零样本最优性能。

Comments Accepted by the 34th ACM International Conference on Multimedia (ACM MM), 2026. 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03321 2026-08-06 cs.LG cs.AI 版本更新 81%

HERO: Hierarchical Evidential Reasoning Optimization for Radiology Report Generation via Reason-then-Summarize

对齐发现与诊断:一种自洽的强化学习框架用于可信的放射学报告

Kun Zhao, Guodong Liu, Hui Ji, Siyuan Dai, Pan Wang, Jifeng Song, Chenghua Lin, Liang Zhan, Haoteng Tang

机构 * University of Pittsburgh(匹兹堡大学) University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷分校) The University of Manchester(曼彻斯特大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种自洽的强化学习框架,用于生成可信的放射学报告,通过优化生成过程和减少幻觉,提升了临床效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04726 2026-08-06 cs.AI cs.CV 新提交 79%

When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning

当提示词成为像素:面向多模态推理的提示词-区域定位

Yongxin Wang, Ruizhe Zhou, Yueling Tang, Yingying Zhu, Xuemin Zhao, Xiaojun Chang, Xiaodan Liang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型在视觉化任务语义场景下的准确率下降问题,提出提示词-区域定位方法,有效提升了基准测试准确率且无需OCR或区域元数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04719 2026-08-06 cs.AI 新提交 79%

Diagnosing Tool-Selection Reasoning in LLM Agents with Canary Tools

用金丝雀工具诊断大语言模型智能体的工具选择推理

Atul Anand, Sourav Chattaraj

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究引入金丝雀工具诊断LLM智能体的工具选择推理,通过多维度分类法评估8个模型,发现模型能力提升会降低易感性,分类法具能力分层性,且发布了相关框架与数据。

Comments 10 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04567 2026-08-06 cs.CL 新提交 79%

STRIVE: Probing Reasoning Limits in Graded Plausibility Generation and Evaluation

STRIVE:探究分级合理性生成与评估中的推理极限

Bhiman Kumar Baghel, Anna Chrabaszcz, Tessa Warren, Michael Walsh Dickey, Haley C. Dresang, Xiang Lorraine Li

机构 * University of Pittsburgh(匹兹堡大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 STRIVE是基于LLM的框架,可联合生成评估跨越合理性类别与难度的受控事件集,实验中其优化后高质量事件集生成率达75.0%,为心理语言学研究减少手动工作量。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15574 2026-08-06 cs.CV 版本更新 78%

MI-CXR: A Benchmark for Longitudinal Reasoning over Multi-Interval Chest X-rays

MI-CXR:多区间胸部X光片纵向推理基准

Sunghwan Steve Cho, Yunseok Han, Jaeyoung Do

机构 * AIDAS Laboratory(AIDAS实验室) Seoul National University(首尔国立大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 MI-CXR基准旨在评估多visit胸部X光片的纵向推理能力,通过五选一问题和三个互补任务家族,揭示现有视觉语言模型在时间维度上的局限性。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02027 2026-08-06 cs.AI cs.ET 版本更新 74%

Zero-shot reasoning for simulating scholarly peer-review

模拟学术同行评审的零样本推理

Khalid M. Saqr

机构 * College of Engineering and Technology(工程与技术学院) Arab Academy for Science, Technology, and Maritime Transport(阿拉伯科学、技术与海运学院)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 本研究构建同行评审模拟基准 xPeer,对比其与人类评审的特征差异,发现 xPeer 报告针对性等更优,人类报告显式推理等更强,成果存档于 Zenodo。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04670 2026-08-06 cs.CL cs.AI 新提交 73%

Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark

易完成,难选择:探究大型语言模型在ProverbIT基准上的性能

Enrico Mensa, Lorenzo Zane, Calogero Jerik Scozzaro, Matteo Delsanto, Tommaso Milani, Daniele Paolo Radicioni

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究构建了意大利谚语基准ProverbIT,评估13个前沿LLMs的谚语处理能力,发现LLMs虽能完成谚语任务,但在无正确答案的选择题中性能骤降,暴露其依赖记忆而非深层语义理解的局限。

Journal ref Proceedings of the Eleventh Italian Conference on Computational Linguistics (CLiC-it 2025), pages 722-734

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04311 2026-08-06 cs.CL 新提交 70%

Pun Intended: Multi-Agent Translation of Wordplay with Contrastive Learning and Phonetic-Semantic Embeddings

并非双关:基于对比学习与音义嵌入的多智能体文字游戏翻译

Russell Taylor, Benjamin Herbert, Michael Sana

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究结合大型语言模型与语言约束,提出三种双关语翻译方法,其多智能体系统在CLEF JOKER 2025竞赛中获专家评估第一,可改善文字游戏翻译效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29025 2026-08-06 cs.CV 版本更新 67%

Evaluation-Verification Reward for Consistent Multi-Reference Image Editing

用于一致多参考图像编辑的评估-验证奖励

Yingmao Miao, Pengfei Zhang, Xiaochen Lv, Meng Yu, Lei Sun, Xiangxiang Chu, Chao Shen, Chenhao Lin

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba(高德,阿里巴巴) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);verifier(abstract)

AI总结 针对多参考图像编辑的视觉一致性与奖励模型缺失问题,提出多维度评估-验证奖励EVR,实现无需架构改动的现成编辑器RL微调,性能优于Qwen-Image-Edit并达到或超NanoBanana。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04317 2026-08-06 cs.CR cs.AI cs.LG cs.MA 新提交 62%

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)

三叉戟:如何突破深度强化学习网络防御(智能体式)

Ryozo Masukawa, Ian Bryant, Armita Kazeminajafabadi, Sanggeon Yun, Hyunwoo Oh, SungHeon Jeong, Nathaniel D. Bastian, Mahdi Imani, Mohsen Imani

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对DRL网络防御对自适应威胁鲁棒性不足的问题,提出Trident智能体式LLM红队框架,通过含三类组件的设计,发现现有防御存在根本性脆弱性,大幅降低蓝方防御性能并揭示新兴行为。

Comments code: https://anonymous.4open.science/r/Trident-A934

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04075 2026-08-06 cs.LG cs.AI 新提交 62%

Spatiotemporal Graph Transformer for Traffic Intelligence in Edge Computing

面向边缘计算中交通智能的时空图Transformer

Laha Ale, Letian Lin, Na Cao, Zheng Ma, Peng Yu

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算与人工智能学院) SWJTU-Leeds Joint School, Southwest Jiaotong University(西南交通大学-利兹学院) State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(北京邮电大学网络与交换技术国家重点实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对边缘计算中流量预测的非平稳长程建模难题,提出时空图Transformer框架,经真实蜂窝网络数据集验证,其性能优于GCN-RNN等基线模型,可支撑主动资源管理。

Comments 12 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28545 2026-08-06 cs.CL cs.AI cs.SE 版本更新 62%

ORCA-bench: How Ready Are Language Model Agents for Oncall?

ORCA-bench:语言模型智能体的值班待命准备程度如何?

Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz Dwivedi

机构 * Cornell Tech(康奈尔科技学院) Traversal Columbia University(哥伦比亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究推出ORCA-bench基准,评估编码智能体在生产级值班待命场景下的根本原因分析能力,发现现有前沿智能体表现不佳,凸显其距离安全胜任生产可靠性工作仍有较大差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02228 2026-08-06 cs.LG cs.CL 版本更新 62%

Unforgettable Generalization in Language Models

语言模型的不可遗忘泛化

Eric Zhang, Leshem Choshen, Jacob Andreas

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究探究语言模型通过随机标签微调遗忘技能时的行为差异,发现遗忘泛化程度与初始预测置信度和训练数据表示变异性相关,且遗忘为浅层,凸显技能移除的难度与不可预测性。

Comments 18 pages, 9 figures, published in First Conference on Language Modeling 2024

Journal ref First Conference on Language Modeling (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05095 2026-08-06 cs.AI 新提交 57%

Hierarchical Graph Memory for LLM Agents with Path-level Localization and Rewrite

面向具备路径级定位与重写能力的大语言模型智能体的分层图记忆框架HiGram

Xiawei Yue, Boran Wang, Xiaoqing Zhang, Shuxin Zheng, Ziwei Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出具备路径级定位与重写能力的分层图记忆框架HiGram,解决扁平图记忆的无关信息多、重写效率低问题,在相关基准上提升了答案质量、令牌效率及冲突场景下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05030 2026-08-06 cs.AI 新提交 57%

From Score Matrices to Football-Aware Match-State Simulation: An Auditable LLM Harness for Exact-Score Reranking

从得分矩阵到足球感知的比赛状态模拟:用于精确得分重排序的可审计大语言模型(LLM)框架

Shaopeng Liang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出可审计混合架构,结合动态统计模型与LLM实现足球得分重排序,经迭代优化后在英超150场比赛时序测试中提升了精确得分准确率与候选覆盖度,明确了该方法的改进及局限。

Comments 9 pages, 1 figure, 5 tables. Interim chronological benchmark on the first 150 matches of the 2025-26 English Premier League

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05004 2026-08-06 cs.CL 新提交 57%

DelusionEval: Measuring Delusion-Linked Behaviors in AI Chatbots

DelusionEval:评估AI聊天机器人中与妄想相关的行为

Jared Moore, Andrea Mock, Yifan Mai, Jacy Reese Anthis, Ryan Louie, William Agnew, Ashish Mehta, Kevin Klyman, Percy Liang, Nick Haber, Eric Lin, Desmond C. Ong

机构 * Stanford University(斯坦福大学) University of Chicago(芝加哥大学) Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究开发DelusionEval评估协议,发现LLM表现出与妄想相关行为的倾向与模型规模等无可靠关联,扩展上下文会提升此类行为发生率,所有模型家族均存在相关风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04939 2026-08-06 cs.CL 新提交 57%

Reading Between the Frames: Interpreting Implicit and Non-literal Meaning in Social Media Videos

帧间解读:社交媒体视频中隐含与非字面意义的理解

Yang Wang, Yanan Ma, Yiqi Liu, Zi Yan Chang, Chi-Li Chen, Chia-Yi Hsiao, Tyler Loakman, Aline Villavicencio, Chenghao Xiao, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) Durham University(杜伦大学) University of Sheffield(谢菲尔德大学) University of Exeter(埃克塞特大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出DrivelHub+基准,评估视频-语言模型推断社交媒体视频隐含意义的能力,从解释和表征两方面开展实验,衡量模型多模态感知与语用理解的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04746 2026-08-06 cs.CL cs.IR 新提交 57%

Caching for the Future: Scrub Jay Episodic Memory Principles for Agent Memory Systems

面向未来的缓存:用于智能体记忆系统的灌丛鸦情景记忆原理

Kartikey Singh Bhandari, Aarya Wadhwani, Dhruv Kumar, Pratik Narang

机构 * Birla Institute of Technology and Science, Pilani(比拉理工学院皮拉尼分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究借鉴灌丛鸦情景记忆原理,提出ScrubJay-MEM智能体记忆系统,通过类型条件时间衰减优化记忆管理,在TGT和MemoryAgentBench任务上取得优于现有方法的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04505 2026-08-06 cs.CL 新提交 57%

K-EXAONE 2.0 Technical Report

K-EXAONE 2.0 技术报告

Eunbi Choi, Kibong Choi, Sehyun Chun, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Ahra Jo, Hyunjik Jo, Yeonsik Jo, Minhyeok Jung, Doyoung Kim, Heegyu Kim, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Byungoh Ko, Changhun Lee, Dohaeng Lee, Haeju Lee, Jinsik Lee, Kyungmin Lee, Minwoo Lee, Wonkee Lee, Sangha Park, Sungjune Park, Kwangrok Ryoo, Kijung Seo, Minju Seo, Yongwoo Song, Sejong Yang, Heuiyeen Yeen, Stanley Jungkyu Choi, Yemuk Choi, Yongchan Chun, Jiwon Ham, Dasol Hong, Sujeong Im, Kijeong Jeon, Gerrard Jeongwon Jo, Hyeongjun Jo, Yujin Jo, Jiyeon Jung, Naeun Kang, Daeseong Kim, Euisoon Kim, Hayeon Kim, Hyosang Kim, Myoungshin Kim, Unsol Kim, Youchul Kim, Chaeeun Lee, ChaeYoon Lee, Edward Hwayoung Lee, Honglak Lee, Hwansoo Lee, Minkyung Lee, Sangeun Lee, Solji Lim, Woohyung Lim, Chanwoo Moon, Jueun Mun, Jimin Park, Seojeong Park, Yongmin Park, Hyerin Seo, Donghyeon Shin, Donghyun Son, Eunyong Son, Kaehyun Um, Sihoon Yang, Chang En Yea, Sihyuk Yi, Kyungjae Yoo, Chansik Yoon

机构 * LG AI Research(LG AI研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该报告介绍LG AI Research开发的K-EXAONE 2.0,这是一款7500亿参数的MoE多语言基础模型,经升级前代模型而来,支持25.6万token上下文,在多类评估中表现优异,以Apache 2.0许可发布,助力AI生态发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04260 2026-08-06 cs.CL 新提交 57%

Towards End-to-End Multilingual Metaphor Processing: Integrating Detection, Translation, and Evaluation

面向端到端多语言隐喻处理:整合检测、翻译与评估

Jiahui Liang, Lifeng Han

机构 * Leiden University(莱顿大学) Leiden University Medical Centre(莱顿大学医学中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究拟开发端到端多语言隐喻处理框架,整合隐喻检测、面向隐喻的翻译评估及联合建模,结合语言学理论与大语言模型,以提升多语言NLP系统处理比喻语言的能力。

Comments Scientific report on PhD thesis plans and milestones achieved (current progress)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04032 2026-08-06 cs.AR cs.AI cs.MA cs.SE 新提交 57%

EDATracer: An Agentic Framework for Large-Scale EDA Artifact Analysis

EDATracer:用于大规模EDA工件分析的智能体框架

Phat Tieu, Sayanti Jana, Matthew DeLorenzo, Jiawen Wu, Narendran Srinivasan, Srinivas Shakkottai, Jiang Hu, Jeyavijayan Rajendran

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出EDATracer框架,将EDA工件组织为知识图谱搭配语义向量索引,构建含2787个开源芯片设计的18.9GB数据集及90题基准,使LLM智能体跨工件检索证据,准确率优于Cursor、Claude Code且token用量更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21597 2026-08-06 cs.AI 版本更新 57%

Risk Is Not the Target: A Monotonic Framework for Evaluating Wildfire Operational Risk Signals

风险不是目标:评估野火运行风险信号的单调框架

Nicolas Caron, Christophe Guyeux, Hassan Noura, Maxime Coulmeau, Benjamin Aynes

机构 * Météo-France(法国气象局) INRAE(法国国家农业、食品与环境研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究提出用单调评估框架衡量野火风险系统预测分数与运行负荷关系,比较DFE、GRU模型及FARS三种方法,发现DFE单调性最佳,GRU局部强但风险水平分布不佳,FARS有局限性,好风险模型应能解释运行动态。

Comments Accepted in 2026 IEEE 50th Annual Computers, Software, and Applications Conference (COMPSAC)

详情

展开后加载摘要…

URL PDF HTML 收藏