arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-28 至 2026-04-28 共收录 519 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 94 篇

2604.23934 2026-04-28 eess.SY cs.SY 75%

VLM-VPI: A Vision-Language Reasoning Framework for Improving Automated Vehicle-Pedestrian Interactions

VLM-VPI:一种用于改进自动驾驶车辆-行人交互的视觉语言推理框架

Qingwen Pu, Kun Xie, Yuxiang Liu

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 本文提出VLM-VPI框架,结合多模态感知、视觉场景理解和意图推理,提升自动驾驶中行人意图识别和安全控制,实验证明其在安全性和效率上的提升。

Comments 40 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23460 2026-04-28 cs.AI cs.CL cs.LG 75%

Ulterior Motives: Detecting Misaligned Reasoning in Continuous Thought Models

隐秘动机:在连续思维模型中检测不一致的推理

Sharan Ramjee

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了连续思维模型中如何检测不一致的推理,提出MoralChain基准测试,并通过双触发方法训练模型,揭示了潜在空间中不一致推理的存在及早期规划阶段的安全监控重要性。

Comments 15 pages with 2 figures

Journal ref International Conference on Learning Representations (ICLR) Latent & Implicit Thinking (LIT) Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24002 2026-04-28 cs.HC cs.AI cs.MM 74%

IntentVLM: Open-Vocabulary Intention Recognition through Forward-Inverse Modeling with Video-Language Models

IntentVLM: 通过视频语言模型的前-后向建模实现开放词汇意图识别

Hamed Rahimi, Clemence Grislain, Adrien Jacquet Cretides, Olivier Sigaud, Mohamed Chetouani

机构 * Institute of Intelligent Systems and Robotics (ISIR)(智能系统与机器人研究所)

专题命中 推理与问题求解 :language model(title);分类 cs.AI

AI总结 本文提出IntentVLM框架,通过前-后向建模提升多模态环境下的人意图识别效果,实验表明其在IntentQA和Inst-IT Bench数据集上达到80%准确率,超越基线30%,接近人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10298 2026-04-28 cs.CL 74%

On Emergent Social World Models -- Evidence for Functional Integration of Theory of Mind and Pragmatic Reasoning in Language Models

关于涌现的社会世界模型——证据显示语言模型中理论思维与语用推理的功能整合

Polina Tsvilodub, Jan-Felix Klumpp, Amir Mohammadpour, Jennifer Hu, Michael Franke

机构 * Department of Linguistics University of Tübingen(语言学系图宾根大学) Department of Cognitive Science Johns Hopkins University(认知科学系约翰霍普金斯大学)

专题命中 推理与问题求解 :language model(title);分类 cs.CL

AI总结 本文研究语言模型是否通过共享的计算机制整合一般理论思维与语言特定的语用推理,以支持语言模型是否具备涌现的社会世界模型。通过行为评估和因果机制实验,分析语言模型在七种理论思维能力子类别上的表现,发现支持功能整合假说。

Comments 39 pages, 20 figures, accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24473 2026-04-28 cs.AI cs.CL 73%

Agentic clinical reasoning over longitudinal myeloma records: a retrospective evaluation against expert consensus

基于纵向骨髓瘤记录的代理临床推理:一项回顾性评估与专家共识的对比

Johannes Moll, Jannik Lübberstedt, Christoph Nuernbergk, Jacob Stroh, Luisa Mertens, Anna Purcarea, Christopher Zirn, Zeineb Benchaaben, Fabian Drexel, Hartmut Häntze, Anirudh Narayanan, Friedrich Puttkammer, Andrei Zhukov, Jacqueline Lammert, Sebastian Ziegelmayer, Markus Graf, Marion Högner, Marcus Makowski, Florian Bassermann, Lisa C. Adams, Jiazhen Pan, Daniel Rueckert, Krischan Braitsch, Keno K. Bressem

机构 * Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM) and TUM University Hospital(人工智能在医疗与健康中的研究所,慕尼黑技术大学(TUM)及慕尼黑技术大学医院) Department of Diagnostic and Interventional Radiology, Klinikum rechts der Isar, TUM University Hospital, School of Medicine and Health, Technical University of Munich(诊断与介入放射科,莱茵河右岸医院,慕尼黑技术大学医院,医学与健康学院,慕尼黑技术大学) Department of Cardiovascular Radiology and Nuclear Medicine, German Heart Center, TUM University Hospital, School of Medicine and Health, Technical University of Munich(心血管放射学与核医学科,德国心脏中心,慕尼黑技术大学医院,医学与健康学院,慕尼黑技术大学) Department of Medicine III, Klinikum rechts der Isar, TUM University Hospital, School of Medicine and Health, Technical University of Munich(第三医学部,莱茵河右岸医院,慕尼黑技术大学医院,医学与健康学院,慕尼黑技术大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究评估了代理推理系统在骨髓瘤长期记录中的表现,发现其在复杂问题和长记录中优于传统方法,但需进一步验证以确保临床应用的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24186 2026-04-28 cs.CL cs.AI 73%

MultiDx: A Multi-Source Knowledge Integration Framework towards Diagnostic Reasoning

MultiDx: 一个面向诊断推理的多源知识整合框架

Yimin Deng, Zhenxi Lin, Yejing Wang, Guoshuai Zhao, Pengyue Jia, Zichuan Fu, Derong Xu, Yefeng Zheng, Xiangyu Zhao, Li Zhu, Xian Wu, Xueming Qian

机构 * Xi’an Jiaotong University(西安交通大学) City University of Hong Kong(香港城市大学) Tencent Jarvis Lab(腾讯 Jarvis实验室) Westlake University(西湖大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MultiDx框架,通过多源知识整合提升诊断推理能力,结合网络搜索、病例数据库等多视角证据,生成最终预测。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05664 2026-04-28 cs.CL cs.AI cs.SE 73%

CODESIM: Multi-Agent Code Generation and Problem Solving through Simulation-Driven Planning and Debugging

CODESIM: 通过仿真驱动的规划与调试进行多智能体代码生成与问题解决

Md. Ashraful Islam, Mohammed Eunus Ali, Md Rizwan Parvez

机构 * Bangladesh University of Engineering and Technology(孟加拉工程与技术大学) Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CODESIM提出了一种基于仿真的多智能体代码生成框架,通过仿真验证和内部调试提升代码生成能力,在多个基准测试中取得新高成绩。

Comments Accepted in NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24618 2026-04-28 cs.AI 70%

Evaluating whether AI models would sabotage AI safety research

评估AI模型是否会破坏AI安全研究

Robert Kirk, Alexandra Souly, Kai Fronsdal, Abby D'Cruz, Xander Davies

机构 * UK AI Security Institute(英国人工智能安全研究所) UK AISI Research Affiliate(英国人工智能安全研究所研究附属)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文评估前沿模型在作为AI研究代理部署时对安全研究的破坏倾向,发现未提示下无破坏行为,但部分模型在持续破坏评估中表现出隐蔽破坏倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24515 2026-04-28 cs.CL 70%

SEARCH-R: Structured Entity-Aware Retrieval with Chain-of-Reasoning Navigator for Multi-hop Question Answering

SEARCH-R: 结构化实体感知检索与推理链导航器用于多跳问答

Yuqing Fu, Yimin Deng, Wanyu Wang, Yuhao Wang, Yejing Wang, Hongshi Liu, Yiqi Wang, Xiao Han, Maolin Wang, Guoshuai Zhao, Yi Chang, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Xi’an Jiaotong University(西安交通大学) Zhejiang University of Technology(浙江工业大学) Michigan State University(密歇根州立大学) Jilin University(吉林大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SEARCH-R通过结构化实体感知检索与推理链导航器,解决多跳问答中推理路径生成和知识检索的准确性问题,提升多跳问答性能。

Comments ACL2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24512 2026-04-28 cs.AI 70%

Beyond the Attention Stability Boundary: Agentic Self-Synthesizing Reasoning Protocols

超越注意力稳定性边界:代理自我合成推理协议

Dahlia Shehata, Ming Li

机构 * University of Waterloo(滑铁卢大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出SSRP框架,通过分离高层规划与执行流程,解决多轮对话中注意力锁定问题,实验显示其在多任务中显著提升稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07605 2026-04-28 cs.CV cs.AI 70%

Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning

Fine-R1: 通过链式推理使多模态大语言模型在细粒度视觉识别中脱颖而出

Hulingxiao He, Zijun Geng, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology(王轩计算机技术研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Fine-R1通过链式推理监督微调和三元组增强策略优化,提升多模态大语言模型在细粒度视觉识别中的表现,仅用4次训练即超越现有模型。

Comments Published as a conference paper at ICLR 2026. The models are available at https://huggingface.co/collections/StevenHH2000/fine-r1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24203 2026-04-28 cs.CR cs.AI cs.ET cs.MA 70%

Agentic Witnessing: Pragmatic and Scalable TEE-Enabled Privacy-Preserving Auditing

代理见证:基于可信执行环境的隐私保护审计

Antony Rowstron

机构 * Advanced Research and Invention Agency (ARIA)(先进研究与发明机构)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Agentic Witnessing框架,通过可信执行环境实现隐私保护审计,利用代理进行逻辑验证,避免数据泄露,验证代码库是否符合论文描述。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24062 2026-04-28 cs.AI 70%

Grounding Before Generalizing: How AI Differs from Humans in Causal Transfer

在泛化之前建立基础:人工智能如何与人类在因果迁移中不同

Liangru Xiang, Yuxi Ma, Zhihao Cao, Yixin Zhu, Song-Chun Zhu

机构 * Department of Automation(清华大学自动化系) Institute for Artificial Intelligence(北京大学人工智能研究院) School of Psychological and Cognitive Sciences(北京大学心理与认知科学系) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health(北京行为与心理健康重点实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了人工智能与人类在因果迁移中的差异,发现AI模型在缺乏环境基础映射时难以高效迁移,而人类能利用先验结构知识。文本条件中AI表现优异,但视觉信息反而降低性能,揭示AI依赖符号处理而非多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23821 2026-04-28 cond-mat.mtrl-sci cs.LG 70%

Accelerating Quantum Materials Characterization: Hybrid Active Learning for Autonomous Spin Wave Spectroscopy

加速量子材料表征:用于自主自旋波光谱的混合主动学习

William Ratcliff

机构 * NIST Center for Neutron Research(国家标准与技术研究院中子研究中心)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出TAS-AI框架,通过分离检测、推断和细化任务,提升自旋波光谱的自主分析能力,展示了在不同模型下显著的效率提升。

Comments 47 pages, 13 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23813 2026-04-28 cs.CV cs.CL 70%

ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction

ShredBench:评估多模态大语言模型在文档重建中的语义推理能力

Zichun Guo, Yuling Shi, Wenhao Zeng, Chao Hu, Haotian Lin, Terry Yue Zhuo, Jiawei Chen, Xiaodong Gu, Wenping Ma

机构 * Xidian University(西安电子科技大学) Shanghai Jiao Tong University(上海交通大学) Alibaba Qwen(阿里巴巴量子计算实验室) Old Dominion University(旧 Dominion 大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ShredBench基准,用于评估多模态大语言模型在文档重建任务中的语义推理能力,发现现有模型在处理破碎文档时存在显著性能差距。

Comments ACL 2026 Findings. Code available at https://github.com/ythere-y/ShredBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23563 2026-04-28 cs.CR cs.AI cs.IR 70%

CyberCane: Neuro-Symbolic RAG for Privacy-Preserving Phishing Detection with Formal Ontology Reasoning

CyberCane:基于形式本体推理的隐私保护钓鱼检测神经符号RAG

Safayat Bin Hakim, Aniqa Afzal, Qi Zhao, Vigna Majmundar, Pawel Sloboda, Houbing Herbert Song

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Bowie State University(鲍威州立大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 CyberCane结合确定性符号分析与隐私保护RAG,通过形式本体推理实现高召回率的钓鱼检测,在隐私保护和抗AI攻击方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22709 2026-04-28 cs.CL 70%

Thinking Without Words: Efficient Latent Reasoning with Abstract Chain-of-Thought

无需言语的思考:通过抽象链式推理实现高效潜在推理

Keshav Ramji, Tahira Naseem, Ramón Fernandez Astudillo

机构 * IBM Research AI(IBM人工智能研究院)

专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.CL

AI总结 本文提出Abstract Chain-of-Thought,通过离散潜在推理机制在训练后实现高效推理,减少推理token数量同时保持性能,发现抽象词汇的幂律分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10708 2026-04-28 cs.SD cs.AI cs.CV cs.MM 70%

Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing

Audio-Omni: 扩展多模态理解到多功能音频生成与编辑

Zeyue Tian, Binxin Yang, Zhaoyang Liu, Jiexuan Zhang, Ruibin Yuan, Hubery Yin, Qifeng Chen, Chen Li, Jing Lyu, Wei Xue, Yike Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) WeChat Vision, Tencent Inc(微信视觉,腾讯公司) Peking University(北京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Audio-Omni提出首个端到端框架,统一音频生成与编辑,结合多模态理解能力,通过冻结的多模态大语言模型与可训练的扩散变换器实现高保真合成,并构建大规模数据集提升音频编辑性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17687 2026-04-28 cs.CR cs.AI 70%

CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks

CrossGuard: 保护大规模多模态语言模型免受联合模态隐式恶意攻击

Xu Zhang, Hao Li, Zhichao Lu

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Department of Computer Science & Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校计算机科学与工程系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CrossGuard,一种意图感知的防护系统,通过生成隐式样本和实验验证,有效防御显式和隐式攻击,提升大规模多模态语言模型的安全性与实用性。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23124 2026-04-28 cs.SE cs.AI 70%

ArgRE: Formal Argumentation for Conflict Resolution in Multi-Agent Requirements Negotiation

ArgRE:基于形式论证的多智能体需求协商中的冲突解决

Haowei Cheng, Milhan Kim, Chong Liu, Teeradaj Racharak, Truong Vinh Truong Duy, Phan Thi Huyen Thanh, Jialong Li, Naoyasu Ubayashi, Hironori Washizaki

机构 * Department of Computer Science and Communications Engineering, Waseda University(早稻田大学计算机科学与通信工程系) College of Architecture and Urban Planning, Tongji University(同济大学建筑与城市规划学院) Advanced Institute of So-Go-Chi (Convergence Knowledge) Informatics, Tohoku University(东北大学So-Go-Chi(融合知识)信息学高级研究所) Aisin Corporation(日产公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ArgRE通过嵌入Dung风格的抽象论证,提供多智能体需求协商中的冲突解决,提升可审计性与合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22805 2026-04-28 cs.CV cs.AI cs.SY eess.SY 70%

See No Evil: Semantic Context-Aware Privacy Risk Detection for AR

见不得恶:面向AR的语义上下文感知隐私风险检测

Jialu Liu, Yao Li, Zhuoheng Li, Huining Li, Ying Chen

机构 * Pennsylvania State University(宾夕法尼亚州立大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出PrivAR框架,利用视觉语言模型进行AR环境中的语义隐私风险检测,通过上下文推理识别敏感信息并降低隐私泄露风险,实验表明其在准确率和F1分数上优于基线方法。

Comments Proc. IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10139 2026-04-28 cs.CR cs.AI 70%

Anonymization-Enhanced Privacy Protection for Mobile GUI Agents: Available but Invisible

增强隐私保护的移动GUI代理:可用但不可见

Lepeng Zhao, Zhenhua Zou, Shuo Li, Zhuotao Liu

机构 * Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于匿名化的隐私保护框架,通过检测敏感UI内容并替换为非识别性占位符,实现敏感信息在任务执行中可用但不可见,减少隐私泄露同时保持代理的无缝使用。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13312 2026-04-28 cs.CL cs.IR 70%

ChatR1: Reinforcement Learning for Conversational Reasoning and Retrieval Augmented Question Answering

ChatR1: 基于强化学习的对话推理与检索增强问答

Simon Lupart, Mohammad Aliannejadi, Evangelos Kanoulas

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 ChatR1通过强化学习实现对话问答中的推理与检索增强,通过意图感知奖励提升多轮对话性能,优于多个基准数据集。

Comments 18 pages, 9 figures, Main ACL 2026 Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics, July 2--7, 2026, San Diego, California

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24341 2026-04-28 cs.CR 67%

GoAT-X: A Graph of Auditing Thoughts for Securing Token Transactions in Cross-Chain Contracts

GoAT-X:用于跨链合约中保障令牌交易的安全思想图

Zijun Feng, Yuming Feng, Yu Wang, Weizhe Zhang, Yuhong Nan, Yuang Liu, Zibin Zheng

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 GoAT-X通过系统性原理验证替代启发式模式匹配,构建审计思想图以识别跨链逻辑中的漏洞,实现高召回率和覆盖范围,发现117个真实风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23802 2026-04-28 cs.MA 67%

EndoGov: A knowledge-governed multi-agent expert system for endometrial cancer risk stratification

EndoGov:一种基于知识的多智能体专家系统用于子宫内膜癌风险分层

Weiye Dai, Liyun Shi, Zanxiang He, Yuling Ma, Mengyuan Lin, Dianxiang Sun, Liming Nie

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 EndoGov通过多智能体系统结合规则治理,实现子宫内膜癌风险分层的指南合规性与高准确性,同时保持竞争性判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08592 2026-04-28 cs.CV 67%

Boosting MLLM Spatial Reasoning with Geometrically Referenced 3D Scene Representations

通过几何参考的3D场景表示提升MLLM空间推理能力

Jiangye Yuan, Gowri Kumar, Baoyuan Wang

机构 * Zillow Group(智域集团)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出几何参考3D场景表示GR3D,使MLLM能利用语言能力处理3D空间,无需额外训练,在空间推理基准中提升GPT-5性能9%和12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12971 2026-04-28 cs.RO 67%

INHerit-SG: Incremental Hierarchical Semantic Scene Graphs with RAG-Style Retrieval

INHerit-SG:增量式层次语义场景图与RAG风格检索

YukTungSamuel Fang, Zhikang Shi, Jiabin Qiu, Zixuan Chen, Jieqi Shi, Hao Xu, Jing Huo, Yang Gao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Beihang University(北京航空航天大学)

专题命中 推理与问题求解 :LLM(abstract_cn);foundation model(abstract)

AI总结 本文提出INHerit-SG,通过异步双流架构构建RAG-ready知识库,解决复杂嵌入查询与持续语义图构建问题,实验表明在复杂查询中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17590 2026-04-28 cs.AI cs.CL cs.CV cs.CY cs.LG 67%

MERIT: Modular Framework for Multimodal Misinformation Detection with Web-Grounded Reasoning

MERIT:基于网络基础推理的多模态虚假信息检测模块化框架

Mir Nafis Sharear Shopnil, Sharad Duwal, Abhishek Tyagi, Adiba Mahbub Proma

机构 * University of Rochester(罗切斯特大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MERIT通过四个专用模块提升多模态虚假信息检测性能,采用GPT-4o-mini在MMFakeBench上取得81.65% F1得分,优于零样本基线,验证了其架构设计的有效性。

Comments 18 pages, 4 tables, 3 figures. Major revision with updated title, framing, methodology, experiments, and error analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23351 2026-04-28 cs.CL cs.AI cs.LG 67%

When Chain-of-Thought Fails, the Solution Hides in the Hidden States

当链式推理失败时,解决方案隐藏在隐藏状态中

Houman Mehrafarin, Amit Parekh, Ioannis Konstas

机构 * Heriot-Watt University(赫瑞斯泰大学) University of Edinburgh(爱丁堡大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过激活补丁分析发现,链式推理(CoT)中的隐藏状态包含任务相关信息,即使原始推理轨迹错误,也能通过补丁提升准确率,揭示CoT中某些token能编码足够的信息恢复正确答案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23100 2026-04-28 cs.CR cs.AR cs.LO 67%

From Language to Logic: Bridging LLMs & Formal Representations for RTL Assertion Generation

从语言到逻辑:桥接LLMs与形式表示以生成RTL断言

Nowfel Mashnoor, Hadi Kamali, Kimia Azar

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出ProofLoop工具增强的ReAct代理,通过求解器在环方法从自然语言规范生成SVA,实现93.7%的语法正确性和82.0%的功能正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏