arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-16 至 2026-07-16 共收录 37 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3 篇

2606.05711 2026-07-16 cs.CL 版本更新 77%

Beyond tokens: a unified framework for latent communication in LLM-based multi-agent systems

超越Token:基于LLM的多智能体系统中潜在通信的统一框架

Yingzhuo Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL

AI总结 提出一个三维统一框架(通信内容、发送-接收对齐、信息融合方式),系统分类2024-2026年间18种潜在通信方法,识别五种设计模式并揭示开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07836 2026-07-16 cs.AI 版本更新 57%

Infinity-Parser2 Technical Report

Infinity-Parser2技术报告

Zuming Huang, Jun Huang, Kexuan Ren, Baode Wang, Weizhen Li, Jianming Feng, Yu Wang, Yichen Yao, Shijun Lin, Yige Tang, Cheng Peng, Weidi Xu, Wei Chu, Yinghui Xu, Yuan Qi

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 针对文档解析语料库稀缺问题,Infinity-Parser2结合可控数据合成与多任务强化学习。贡献包括构建合成引擎及开源语料库,引入多任务奖励系统,发布Infinity-Parser2-Flash和Infinity-Parser2-Pro两个变体,后者在多项任务中达先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14477 2026-07-16 cs.LG 版本更新 57%

Test-Time Learning with an Evolving Library

测试时学习与进化库

Weijia Xu, Alessandro Sordoni, Chandan Singh, Zelalem Gero, Michel Galley, Xingdi Yuan, Jianfeng Gao

机构 * Microsoft Research(微软研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 EvoLib通过维护知识库实现大语言模型在不同实例间积累和进化知识,无需参数更新或外部监督,提升数学推理、代码生成等任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2602.12811 2026-07-16 cs.CL cs.AI q-bio.NC 版本更新 62%

Left-right asymmetry in predicting brain activity from LLMs' representations emerges with their formal linguistic competence

在LLM表示中预测脑活动的左右不对称性随着其正式语言能力的出现而出现

Laurent Bonnasse-Gahot, Christophe Pallier

机构 * Centre d’Analyse et de Mathématique Sociales CNRS, EHESS, Paris, France(分析与数学社会中心 CNRS,EHESS,巴黎,法国) Cognitive Neuroimaging Unit CNRS, INSERM, CEA, Neurospin Center, 91191 Gif-sur-Yvette, France(认知神经成像单元 CNRS,INSERM,CEA,Neurospin中心,法国91191 Gif-sur-Yvette)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究发现LLM的正式语言能力与大脑预测活动的左右不对称性同步发展,且与算术或世界知识任务无关。

Journal ref Neurobiology of Language 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19593 2026-07-16 cs.AI cs.MA 版本更新 57%

A Survey on Hypergame Theory: Modelling Misaligned Perceptions and Nested Beliefs for Multi-Agent Systems

关于超博弈理论的综述:为多智能体系统建模错位感知与嵌套信念

Vince Trencsenyi, Agnieszka Mensfelt, Kostas Stathis

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文综述了超博弈理论在多智能体系统中的应用,分析了其建模错位感知与嵌套信念的能力及现有研究中的趋势与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 2 篇

2601.02023 2026-07-16 cs.CL cs.AI 版本更新 76%

Not All Needles Are Found: How Fact Distribution and Don't Make It Up Prompts Shape Retrieval, Reasoning, and Hallucination in Long-Context LLMs

并非所有线索都能被发现:事实分布和“不要编造”提示如何影响长上下文语言模型中的检索、推理和幻觉

Amirali Ebrahimzadeh, Seyyed M. Salili

机构 * Department of Electrical Engineering & Computer Science University of Michigan(电气工程与计算机科学系 密歇根大学)

专题命中 逻辑推理 :reasoning(title);分类 cs.CL、cs.AI

AI总结 研究大语言模型中事实分布和反幻觉提示对检索、推理及幻觉的影响,通过扩展基准评估多个模型,识别出分布崩溃和安全代价两种失败模式,发现许多失败源于无效上下文利用,强调特定模型稳健性和上下文管理的重要性。

Comments 16 pages, 8 figures, 2 tables. Accepted at the FAGEN Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11334 2026-07-16 cs.AI 版本更新 74%

Verifier-Guided Twelve-Tone Composition: A Generate-Verify-Repair Harness for Symbolic Music Generation

验证器引导的十二音作曲:用于符号音乐生成的生成-验证-修复框架

Congren Dai, Danni Zhao, Enyang Liu, Michael Ching Yam, Zhancheng Guo, Siyi Gu, Wentao Yang, Bo Dai, Xiaobing Li, Maosong Sun

专题命中 逻辑推理 :verifier(title);分类 cs.AI

AI总结 研究针对大语言模型生成退化十二音乐谱的问题,提出神经符号框架,通过生成-验证-修复-追踪循环提升事件局部一致性,经实验该框架提高了交付率和检查通过率,专家盲评显示其生成的作品在多方面更受青睐。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 8 篇

2603.00546 2026-07-16 cs.AI cs.CV 版本更新 81%

Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation

通过能力导向的基准和MCTS驱动的数据生成推进多模态评判模型

Zeyu Chen, Huanjin Yao, Ziwang Zhao, Min Yang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

专题命中 规划推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出M-JudgeBench和Judge-MCTS框架,通过能力导向的基准和MCTS驱动的数据生成提升多模态评判模型的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11811 2026-07-16 cs.RO cs.AI cs.CV 版本更新 79%

RADAR: Closed-Loop Robotic Data Generation via Semantic Planning and Autonomous Causal Environment Reset

RADAR: 通过语义规划和自主因果环境重置实现闭环机器人数据生成

Yongzhong Wang, Keyu Zhu, Yong Zhong, Liqiong Wang, Jinyu Yang, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Spatialtemporal AI(时空人工智能)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 RADAR通过语义规划和自主因果环境重置实现闭环机器人数据生成,具备高适应性和可扩展性,在仿真和现实部署中均表现出卓越的性能。

Comments 8 pages, 4 figures. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project page: https://radar-iros.netlify.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05396 2026-07-16 cs.CL cs.SE 版本更新 70%

FairCoder: Probing LLM Bias in High-Stakes Decision Making via Coding Tasks

FairCoder:通过编码任务探究高风险决策中语言模型的偏差

Yongkang Du, Jen-tse Huang, Jieyu Zhao, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学) University of Southern California(南加州大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 研究通过FairCoder基准将决策制定设为编码任务,探究LLMs在多领域的偏差,针对现有指标不足提出FairScore指标,经实验揭示了此前未充分探索的偏差模式,凸显LLMs作决策代理的风险并提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18685 2026-07-16 cs.CV cs.RO 版本更新 67%

Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents

超越描述:为具身智能体进行细粒度动作的认知基准测试

Dayong Liu, Chao Xu, Weihong Chen, Suyu Zhang, Juncheng Wang, Jiankang Deng, Baigui Sun, Yang Liu

机构 * Zhejiang University(浙江大学) Wolf 1069 b(沃尔夫1069b) Sany Group(三一集团) The Hong Kong Polytechnic University(香港理工大学) Imperial College London(帝国理工学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出CFG-Bench基准测试,旨在评估具身智能体在物理交互中的细粒度动作能力,揭示现有MLLMs在高层次推理中的不足,并通过监督微调提升其性能。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01531 2026-07-16 cs.AI cs.LG 版本更新 62%

OPINE-World: Programmatic World Modeling with Ontology-error-Prioritized Interactive Exploration for ARC-AGI-3

OPINE-World:基于本体错误优先的交互式探索的程序化世界建模

David Courtis, Wenhao Li, Scott Sanner

机构 * University of Toronto(多伦多大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出OPINE-World,一种在线交互学习面向对象的程序化世界模型的LLM智能体,通过本体错误度量引导探索,在ARC-AGI-3基准上无需逐游戏训练即解决20/25个游戏,动作效率达78.4。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11722 2026-07-16 cs.CL 版本更新 57%

STEP: Career-Path Recommendation via Temporal and Educational Trajectory Modeling

STEP:通过时间和教育轨迹建模进行职业路径推荐

Iman Johary, Guillaume Bied, Alexandru C. Mara, Tijl De Bie

机构 * AIDA-IDLab, Ghent University(AIDA-ID实验室,根特大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 研究利用大语言模型从简历获取职业轨迹数据,提出STEP职业路径推荐系统,通过集成时间衰减GRU、FiLM及注意力序列池化预测下一份工作,引入ROUTE改进职业表示,在多数据集评估中优于基准,还公开了数据集和代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16944 2026-07-16 cs.AI cs.HC 版本更新 57%

A Causal Model of Theory of Mind in Conflict for Artificial Intelligence

冲突情境下心智理论的人工智能因果模型

Nikolos Gurney

机构 * Institute for Creative Technologies, University of Southern California(南加州大学创意技术研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出结构因果模型,将心智理论视为由情境和主体条件激活的机制,通过三条因果路径决定何时进行心智化,提升AI社会推理的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06223 2026-07-16 cs.AI 版本更新 57%

From Reward-Hack Activations to Agentic Risk States: Context-Calibrated Mechanistic Monitoring in LLM Agents

从奖励黑客激活到智能体风险状态:LLM智能体中的上下文校准机制监控

Patrick Wilhelm, Odej Kao

机构 * University of Cambridge(剑桥大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过分析ReAct风格智能体在Gameable ALFWorld和WebShop环境中的奖励黑客行为,提出结合激活状态、熵和决策上下文的上下文校准监控方法,以更准确评估智能体风险。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 3 篇

2607.12503 2026-07-16 cs.CV 版本更新 78%

DynTrace: Tracking Dynamic Object Evidence for 4D Spatio-Temporal Reasoning in MLLMs

DynTrace:用于多模态大语言模型中4D时空推理的动态对象证据跟踪

Rongxin Gao, Yuzhi Huang, Dongxuan Liu, Chu Li, Zhenye Wang, Jie Wu, Shuzhao Xie, Jingyan Jiang, Xinghao Ding, Xiaotong Tu, Yue Huang

机构 * Xiamen University(厦门大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) China University of Mining and Technology(中国矿业大学) Shenzhen Technology University(深圳技术大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 研究针对多模态大语言模型在连续动态场景感知中跟踪动态对象证据的局限,提出DynTrace框架,含DTV和DT-Token两个互补组件,能为模型提供基于几何视觉先验和结构化时空轨迹的动态对象证据,在多个基准测试中达先进水平。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27745 2026-07-16 cs.CV 版本更新 50%

Panoramic Scene Understanding: A Survey from Distortion-Aware Engineering to Sphere-Native Modeling

全景场景分析:从畸变感知工程到球面原生基础建模的综述

Qinfeng Zhu, Lei Fan

机构 * University of Liverpool(利物浦大学) Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文综述全景场景分析从投影适应、畸变感知工程到球面原生建模的演进,指出当前方法无法同时实现严格球面等变性和重用预训练基础模型权重,并揭示评估协议中的五个系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21268 2026-07-16 cs.CV 版本更新 50%

Vision Transformers and Convolutional Neural Networks for Land Use Scene Classification

视觉Transformer与卷积神经网络在土地利用场景分类中的应用

Arun D. Kulkarni

机构 * Computer Science Department, University of Texas at Tyler(德克萨斯理工大学计算机科学系)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文比较了视觉Transformer和CNN在遥感土地利用场景分类中的性能,发现CNN在有限训练样本和局部纹理特征强的场景中表现稳健,而ViT在数据充足时能更好地捕捉全局空间关系,但计算成本更高。

Comments 11 pages

Journal ref International Journal of Advanced Computer Science and Applications, vol. 17, no. 7, 2026,

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 2 篇

2510.11686 2026-07-16 cs.LG cs.AI 版本更新 73%

Representation-Based Exploration for Language Models: From Test-Time to Post-Training

基于表示的语言模型探索:从测试时到训练后

Jens Tuyls, Dylan J. Foster, Akshay Krishnamurthy, Jordan T. Ash

机构 * Princeton University(普林斯顿大学) Microsoft Research(微软研究院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究语言模型中强化学习探索新行为的价值,提出基于预训练模型隐藏状态的表示奖励探索方法,在推理时和训练后都显著提升了模型性能,如验证效率和测试时样本效率,为发现新行为提供实用途径。

Comments Accepted at ICLR 2026. Website and code: https://rep-exp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12963 2026-07-16 cs.CL 版本更新 57%

The Illusion of Robustness: Aggregate Accuracy Hides Prediction Flips under Task-Irrelevant Context

稳健性的错觉:聚合准确率掩盖了与任务无关的上下文下的预测翻转

Yanzhe Zhang, Sanmi Koyejo, Diyi Yang

机构 * Georgia Tech(佐治亚理工学院) Stanford University(斯坦福大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL

AI总结 研究大语言模型在含无关上下文环境中的表现,发现聚合准确率掩盖了单个示例预测的不稳定性,如随机伪词会改变部分预测,且此不稳定性受多种因素调节,揭示了尾部风险,推动对模型进行单个示例可靠性评估。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 复杂问题求解 3 篇

2601.20379 2026-07-16 cs.AI 版本更新 79%

Policy of Thoughts: Scaling Test-Time Training for LLM Reasoning via Online Policy Evolution

思维策略:通过在线策略进化扩展大语言模型推理的测试时训练

Zhengbo Jiao, Hongyu Xian, Qinglong Wang, Yunpu Ma, Zhebo Wang, Zifan Zhang, Dezhang Kong, Meng Han

机构 * Binjiang Institute, Zhejiang University(浙江大学滨江学院) Shanghai University of Finance and Economics(上海财经大学) South China Normal University(华南师范大学) LMU Munich(慕尼黑大学) Wuhan University(武汉大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对大语言模型复杂推理难题,提出思维策略(PoT)框架,通过高效探索机制生成候选解,用组相对策略优化更新LoRA适配器,实现推理策略实时进化,显著提升模型性能。

Comments Under Review, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10002 2026-07-16 cs.AI 版本更新 57%

Interaction Protocol Shapes Moral Judgment in Multi-Agent Debate

辩论动态与价值对齐在大语言模型辩论中

Pratik S. Sachdeva, Tom van Nuenen

机构 * D-Lab University of California, Berkeley(D-Lab 加州大学伯克利分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究通过LLM辩论探讨多轮设置中模型的辩论动态与价值对齐,发现不同模型在同步和轮转结构下的行为差异及价值倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12349 2026-07-16 cs.CR cs.AI cs.SE 版本更新 57%

Mind the Gap: Action Rebinding Attacks against Android GUI Agents

零权限操纵:我们能否信任由大型多模态模型驱动的GUI代理?

Yi Qian, Kunwei Qian, Xingbang He, Ligeng Chen, Jikang Zhang, Tiantai Zhang, Haiyang Wei, Linzhang Wang, Hao Wu, Bing Mao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Hornor Device Co., Ltd(Hornor设备有限公司) Institute of Dataspace, Hefei Comprehensive National Science Center(数据空间研究所,合肥综合性国家科学中心)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究揭示了由大型多模态模型驱动的GUI代理在Android中存在视觉原子性假设的漏洞,通过零权限攻击实现对代理执行的重新绑定,并利用意图对齐策略绕过验证门,展示了代理-操作系统集成中的安全缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 推理评测 10 篇

2603.16307 2026-07-16 cs.AI 版本更新 83%

NeSy-Route: A Neuro-Symbolic Benchmark for Constrained Route Planning in Remote Sensing

NeSy-Route:一种用于遥感约束路径规划的神经符号基准

Ming Yang, Zhi Zhou, Shi-Yu Tian, Kun-Yang Yu, Lan-Zhe Guo, Yu-Feng Li

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学) School of Artifical Intelligence, Nanjing University, China(人工智能学院,南京大学) School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学)

专题命中 推理评测 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 NeSy-Route是一个大规模神经符号基准,用于评估遥感中的约束路径规划能力,通过自动化数据生成框架和三级评估协议,全面测试多模态大语言模型的感知、推理和规划能力。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24902 2026-07-16 cs.CL cs.AI cs.LG 版本更新 82%

When Reasoning Hurts: Source-Aware Evaluation of Frontier LLMs for Clinical SOAP Note Generation

当推理有害:面向临床SOAP笔记生成的前沿LLM源感知评估

Faizan Faisal

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过源感知基准测试,评估推理增强型LLM在临床SOAP笔记生成中的表现,发现推理能力反而降低GPT-5.4的质量,而相同源RAG带来模型依赖的小幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11192 2026-07-16 cs.CV 版本更新 79%

GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents

GDP.pdf:针对专业PDF文档的基础多模态推理基准测试

Suhaas Garre, Emily Ritchie, Sushant Mehta, Edwin Chen

机构 * Surge AI

专题命中 推理评测 :reasoning(title,abstract)

AI总结 该研究针对专业PDF文档构建多模态推理基准测试GDP.pdf,由专业人员编写问题-文档对,通过严格筛选保留问题,有详细评分标准和能力分类。评估七个前沿模型,发现多数错误源于特定模式,公开了完整基准测试。

Comments 9 pages. v2: results updated to July 2026 leaderboard (17 models). Accepted at the 2nd Workshop on Knowledge-Intensive Multimodal Reasoning (KnowledgeMR) at CVPR 2026 (non-archival), under the former title "PDFParse: A Benchmark for Grounded Multimodal Reasoning over Professional PDF Documents". Dataset: https://huggingface.co/datasets/surgeai/GDP.pdf ; Code: https://github.com/surge-ai/gdp-pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12818 2026-07-16 cs.CV 版本更新 78%

Breaking Déjà Vu: Independent Auditing of Visual Place Recognition through Vision-Language Reasoning

打破似曾相识:通过视觉语言推理对视觉场所识别进行独立审计

Sania Waheed, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan

机构 * School of Electronics and Computer Science, University of Southampton(南安普顿大学电子与计算机科学学院) School of Electrical Engineering and Computer Science, Queensland University of Technology(昆士兰科技大学电气工程与计算机科学学院) School of Computer Science and Electronic Engineering, University of Essex(埃塞克斯大学计算机科学与电子工程学院)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 研究针对视觉场所识别中图像匹配阈值在环境变化下不可靠的问题,引入视觉场所识别审计框架,利用视觉语言模型通过联合推理评估检索匹配,经实验验证该方法有效提升召回率并降低误接受率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17868 2026-07-16 cs.SE 版本更新 78%

UniCode: Augmenting Evaluation for Code Reasoning

UniCode: 增强代码推理的评估

Xinyue Zheng, Haowei Lin, Shaofei Cai, Yaodong Yang, Zilong Zheng, Yitao Liang

专题命中 推理评测 :reasoning(title,abstract)

AI总结 UniCode通过多维增强和自动化测试生成框架,揭示了大语言模型在代码推理中的性能下降问题,强调模型对捷径的依赖而非真正的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11715 2026-07-16 cs.CL 版本更新 70%

JobHop v2: A Large-Scale Career Trajectory Dataset from Unstructured Resumes

JobHop v2:一个来自非结构化简历的大规模职业轨迹数据集

Iman Johary, Guillaume Bied, Alexandru C. Mara, Tijl De Bie

机构 * AIDA-IDLab, Department of Electronics and Information Systems, Ghent University, Ghent, Belgium(AIDA-ID实验室,电子与信息系统系,根特大学,根特,比利时) AIDA-IDLab, Department of Electronics(AIDA-ID实验室,电子系) Information Systems, Ghent University, Ghent, Belgium(信息系统,根特大学,根特,比利时)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 该研究提出JobHop v2数据集,通过端到端大语言模型从大量简历中提取职业轨迹。它扩大了覆盖范围与注释丰富度,引入新提取管道、模式及评估协议,最好提取器接近注释者间一致性上限,数据集和代码公开助力职业轨迹研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11263 2026-07-16 cs.AI cs.LG 版本更新 62%

Bringing Back Rule Induction to Fluid Intelligence Research? An Initial Validation of the ARC-AGI Benchmark in Humans

将规则归纳带回流体智力研究?人类中ARC-AGI基准的初步验证

Jasmin Thelen, Oliver Wilhelm

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究围绕流体智力测量的两种观点,以含100名参与者的研究初步验证ARC-AGI基准用于人类流体智力测量的有效性,发现其与图形流体智力显著相关,为相关研究提供支持并建议嵌入人工智能基准以促进评估与合作。

详情

展开后加载摘要…

URL PDF HTML 收藏