论文研究卡片
来自 arXiv 等来源的论文材料,共 282 篇。页面优先展示中文研究卡片,并保留原始 Markdown / 清洗稿入口。
记忆诅咒:扩展记忆如何削弱 LLM 代理的合作意图
该研究通过大规模实验发现,在重复社会困境博弈中,增加 LLM 代理可访问的历史长度(HL)反而会系统性降低合作率,提出“记忆诅咒”现象,并通过语义分析、记忆净化与定向微调验证其机制。
2605.08060澄清时机的价值:长程智能体何时需要提问?
通过强制注入实验量化不同信息维度下澄清时机对长程智能体性能的影响,发现目标澄清仅在执行前10%有效,而输入澄清可维持至50%,且当前前沿模型普遍未在最优窗口提问。
2605.07937上下文收集决策过程:面向智能体搜索的POMDP框架
将LLM智能体的长程信息搜索建模为部分可观测马尔可夫决策过程(POMDP),提出显式信念状态与程序化耗尽门控两个模块化干预机制,提升多跳推理性能并降低最多39%的token消耗。
2605.07042超级智能检索代理 SIRA:信息检索的新前沿
提出 SIRA,一种基于 LLM 的检索代理,通过语料库感知的词汇增强和单次加权 BM25 检索,在无需训练或多次搜索轮次的情况下,显著优于有监督稠密/稀疏检索器和多轮代理系统。
2605.06647SkillOS:面向自进化代理的技能策展学习框架
提出 SkillOS,一种基于强化学习的经验驱动训练范式,用于让 LLM 代理学会从任务流中持续提取、更新和复用可重用技能,实现长期自我进化。
2605.06614连续隐变量扩散语言模型 Cola DLM
Continuous Latent Diffusion Language Model提出一种分层隐变量扩散语言模型 Cola DLM,通过在连续隐空间中建模全局语义先验,实现高效、非自回归的高质量文本生成。
2605.06548MINER:挖掘多模态内部表征实现高效检索
提出 MINER 模块,通过探测和融合 Transformer 多层内部表征,在不修改主干模型的前提下提升单向量稠密检索质量,同时保持存储与推理效率。
2605.06460LatentRAG:面向高效智能体RAG的隐空间推理与检索
提出LatentRAG框架,将智能体RAG中的推理和检索过程从离散语言空间迁移到连续隐空间,通过隐令牌实现并行生成与检索,在保持性能的同时降低约90%推理延迟。
2605.06285MemReranker:面向智能体记忆检索的推理感知重排序模型
提出MemReranker模型族(0.6B/4B),通过多阶段知识蒸馏将大模型推理能力压缩至轻量级重排序器,解决传统语义匹配在记忆检索中的三大缺陷:分数校准差、缺乏推理能力、无法利用对话上下文。
2605.06132LLM搜索代理的推理时预算控制
提出一种两阶段推理时预算控制方法,通过任务级信息价值(VOI)评分在搜索过程中分配工具调用和输出token预算,并在最终答案生成时进行风险可控的改写,以在硬性双预算约束下提升多跳问答性能。
2605.05701EnterpriseRAG-Bench:面向企业私有知识的RAG基准测试
构建一个包含约50万文档和500个问题的合成企业知识库,用于评估RAG系统在真实企业内部数据上的检索与推理能力。
2605.05253超越语义相似性:通过直接语料交互重新思考代理搜索中的检索
Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction提出直接语料交互(DCI)作为代理搜索的新检索范式,绕过传统检索器,使用终端工具直接操作原始语料,在多个基准上显著提升性能并降低成本。
2605.05242LongSeeker:面向长时程搜索代理的弹性上下文编排
提出 Context-ReAct 范式,通过五种原子元操作(Skip、Compress、Rollback、Snippet、Delete)实现代理对自身上下文的动态弹性管理,解决长时程推理中上下文膨胀与噪声累积问题。
2605.05191OpenSeeker-v2:基于高难度轨迹的搜索代理性能突破
OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories通过高质量、高难度的合成轨迹数据,仅使用监督微调(SFT)训练出性能超越工业级 CPT+SFT+RL 流程的 30B 搜索代理 OpenSeeker-v2。
2605.04036基于思维轨迹的检索增强生成提升推理任务性能
提出使用思维轨迹(thinking traces)作为检索语料,并设计 T³ 方法将其转化为结构化表示,显著提升数学、代码和科学推理任务的表现。
2605.03344RLDX-1:面向灵巧操作的多功能通用机器人策略
提出 RLDX-1,一种基于多流动作变换器(MSAT)的通用机器人策略,通过整合运动感知、长期记忆和物理传感等超越通用智能的功能能力,在复杂现实世界灵巧操作任务中显著优于现有 VLA 模型。
2605.03269MolmoAct2:面向真实世界部署的动作推理模型
MolmoAct2 Action Reasoning Models for Real-World Deployment提出 MolmoAct2,一个完全开源、支持多平台部署的动作推理模型,通过专用 VLM 主干、高质量数据集、高效动作 tokenizer 和新架构设计,在真实机器人任务中显著优于现有基线。
2605.02881长时程任务中LLM训练的实证研究与时域长度影响分析
On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length通过控制任务构造,系统研究时域长度对LLM智能体训练动态的影响,提出时域缩减作为提升长时程任务训练稳定性和泛化能力的关键原则。
2605.02572HeavySkill:将深度思考作为智能体框架的内在技能
提出 HeavySkill,将复杂推理任务中的“深度思考”抽象为可复用的两阶段技能(并行推理 + 顺序审议),并通过实验验证其在 STEM 和通用任务中优于传统 BoN 策略,且可通过强化学习进一步优化。
2605.02396AAFLOW:面向智能体 AI 工作流的可扩展模式
AAFLOW 提出一种统一的分布式运行时,将智能体工作流建模为通信高效的算子抽象,通过零拷贝数据平面和资源确定性调度,显著降低数据编排开销,实现高达 4.64× 的流水线加速。
2605.02162Persistent Visual Memory:LVLM 深度生成中的持续视觉感知
提出 Persistent Visual Memory (PVM) 模块,通过并行分支结构解决 LVLM 在长文本生成中视觉信号衰减问题,提升复杂推理任务表现。
2605.00814IKEA 商品检索中的负样本挖掘与对比学习
Negative Data Mining for Contrastive Learning in Dense Retrieval at IKEA.com提出结构化负样本采样策略与 LLM 相关性评估方法,提升稠密检索模型在 IKEA 商品搜索中的离线性能,但在线 A/B 测试未显示显著用户参与度提升。
2605.00353基于 Token 感知聚类与分层索引的高效多向量检索
Efficient Multivector Retrieval with Token-Aware Clustering and Hierarchical Indexing提出 Tachiom 系统,通过 Token-Aware Clustering (Tac) 实现高效聚类,并结合分层索引实现多向量检索的加速,在保持效果的同时显著提升效率。
2604.28142情境化代理记忆是备忘录,而非真正记忆
Contextual Agentic Memory is a Memo, Not True Memory本文论证当前基于检索的代理记忆系统(如RAG、MemGPT)本质上是外部查找而非内在学习,存在可证明的泛化上限、动态能力停滞和安全漏洞,必须引入权重更新通道以实现真正的经验巩固。
2604.27707从上下文到技能:语言模型能否熟练地从上下文中学习?
提出 Ctx2Skill 框架,通过多智能体自博弈和跨时间回放机制,无需人工标注或外部反馈即可从复杂上下文中自动发现、精炼和选择上下文相关技能,提升语言模型在上下文学习任务上的表现。
2604.27660均值池化为何有效:文本嵌入中二阶坍缩的量化分析
Why Mean Pooling Works: Quantifying Second-Order Collapse in Text Embeddings提出 SOCM 指标量化均值池化导致的二阶统计信息坍缩,发现现代对比微调文本编码器通过增强文本内 token 嵌入集中度来缓解该问题,且 SOCM 与下游任务性能相关。
2604.27398MiniCPM-o 4.5:迈向实时全双工全模态交互
MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction提出 MiniCPM-o 4.5,首个支持实时全双工全模态交互的 9B 参数开源模型,通过 Omni-Flow 框架实现视觉、听觉与语音输出的时间对齐流式处理,在边缘设备上实现低延迟主动交互。
2604.27393AgenticRecTune:基于自演进技能中心的多智能体推荐系统优化框架
AgenticRecTune: Multi-Agent with Self-Evolving Skillhub for Recommendation System Optimization提出 AgenticRecTune,一个由五个专用 LLM 智能体(Actor、Critic、Insight、Skill、Online)构成的端到端推荐系统配置优化框架,通过自演进 Skillhub 和在线 A/B 测试实现多阶段系统参数自动化调优。
2604.26969推理过程中何时检索:面向大型推理模型的自适应检索
When to Retrieve During Reasoning: Adaptive Retrieval for Large Reasoning Models提出 ReaLM-Retrieve 框架,通过推理步级不确定性检测与学习式干预策略,在大型推理模型中实现高效、精准的自适应检索。
2604.26649递归多智能体系统
Recursive Multi-Agent Systems提出 RecursiveMAS,一种基于轻量级 RecursiveLink 模块的递归多智能体框架,通过隐空间中的循环协作实现系统级性能扩展,相比文本交互方法提升推理效率并降低 token 消耗。
2604.25917Agentic Harness Engineering:基于可观测性的编码智能体 Harness 自动演化
Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses提出 Agentic Harness Engineering (AHE),一个基于三层可观测性(组件、经验、决策)的闭环系统,用于自动演化编码智能体的 harness,无需人工干预即可提升任务成功率并实现跨基准和模型迁移。
2604.25850Latent Agents:多智能体辩论的内部化后训练方法
提出一种两阶段微调框架 IMAD,将多智能体辩论过程蒸馏至单一 LLM 内部,实现推理能力提升与 93% 的 token 消耗降低,并通过激活引导揭示可分离的智能体子空间。
2604.24881Ara:面向AI智能体的可执行研究工件协议
1 Introduction提出Agent-Native Research Artifact (Ara) 协议,将研究从线性叙事文档重构为四层可执行知识包,解决传统出版中的‘叙事税’与‘工程税’问题,并通过理解、复现、扩展三阶段评估验证其有效性。
2604.24658DataPRM:面向智能数据分析的过程级奖励建模
Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis提出 DataPRM,一种环境感知的生成式过程奖励模型,通过主动交互与三元奖励策略解决数据分析中的静默错误与 grounding 错误问题。
2604.24198从技能文本到技能结构:面向智能体技能的调度-结构-逻辑表示法
From Skill Text to Skill Structure: The Scheduling-Structural-Logical Representation for Agent Skills提出一种三层结构化表示法 SSL,将自然语言描述的智能体技能文档转化为可机器解析的调度、结构与逻辑图,提升技能发现与风险评估效果。
2604.24026基于置信度边际的过程监督用于校准大语言模型推理
Process Supervision of Confidence Margin for Calibrated LLM Reasoning提出 RLCM 框架,通过中间推理步骤的置信度边际奖励实现校准感知的强化学习,在保持推理准确性的同时显著提升置信度可靠性。
2604.23333随机 KV 路由:实现自适应深度级缓存共享
Stochastic KV Routing: Enabling Adaptive Depth-Wise Cache Sharing提出随机跨层注意力(R-CLA)训练策略,使模型在推理时能灵活适应不同深度级 KV 缓存共享方案,显著降低内存占用同时保持或提升性能。
2604.22782智能体世界建模:基础、能力、法则与未来
提出 L1/L2/L3 能力层级与四域法则(物理、数字、社会、科学)的二维分类框架,统一跨领域世界建模研究,推动从被动预测到主动演化的范式演进。
2604.22748结果奖励无法保证可验证或因果重要的推理
Outcome Rewards Do Not Guarantee Verifiable or Causally Important Reasoning本文通过提出因果重要性(CIR)和推理充分性(SR)两个新指标,系统分析强化学习从可验证奖励(RLVR)对推理链质量的影响,发现仅靠结果奖励不能保证推理的因果性或可验证性,但可通过SFT预训练或辅助奖励机制改善。
2604.22074看见的代价:在单体范式中实现可信多模态推理
The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm该论文批判当前多模态评估方法存在根本缺陷,提出‘模态转换协议’与三项新指标(ToS、CoS、FoS),揭示视觉信息在现有VLM架构中反而成为性能瓶颈,并呼吁以‘语义充分性准则(SSC)’重构可信世界模型。
2604.20665混合策略蒸馏用于大语言模型
Hybrid Policy Distillation for LLMs提出混合策略蒸馏(HPD),结合正向与反向KL散度,并融合离策略与近似在策略数据,提升LLM知识蒸馏的稳定性与效率。
2604.20244PARM:面向流水线的大型语言模型奖励模型适配方法
PARM: Pipeline-Adapted Reward Model提出一种流水线适配的奖励模型(PARM),通过端到端执行反馈训练奖励模型,提升多阶段LLM流水线在组合优化等任务中的输出质量与稳定性。
2604.18327NIM4-ASR:面向高效、鲁棒与可定制化实时 LLM 语音识别
NIM4-ASR: Towards Efficient, Robust, and Customizable Real-Time LLM-Based ASR提出 NIM4-ASR 框架,通过模块化训练范式、异步 SFT 与 ASR 专用强化学习,在仅 2.3B 参数下实现 SOTA 性能,支持百万级热词定制与低延迟流式推理。
2604.18105OPSDL:面向长上下文语言模型的在线自蒸馏方法
OPSDL: On-Policy Self-Distillation for Long-Context Language Models提出一种在线自蒸馏框架OPSDL,利用模型自身在短上下文上的强能力作为教师信号,通过逐点反向KL散度对长上下文生成进行逐令牌监督,提升长上下文建模效果且不损害短上下文性能。
2604.17535超越文本主导:全模态大模型的模态偏好研究
Paper: 2604.16902通过构建三模态冲突基准与层间探测方法,系统量化并揭示了全模态大模型中普遍存在的视觉偏好现象及其在中间层逐步形成的机制,并验证其可用于跨模态幻觉诊断。
2604.16902确定性幻觉:解耦能力与校准的在线策略蒸馏
The Illusion of Certainty: Decoupling Capability and提出 CaOPD 框架,通过学生接地置信度目标替换,在保持能力蒸馏效果的同时解决 OPD 导致的系统性过度自信问题。
2604.16830视觉语言模型是否真正进行视觉推理?模态差距的严格研究
Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap提出 CrossMath 基准,通过跨模态等价任务揭示当前 VLM 在视觉推理上依赖文本捷径,并验证后训练可缩小模态差距。
2604.16256CoEvolve:基于智能体-数据互演化训练LLM智能体
CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution提出CoEvolve框架,通过提取训练轨迹中的遗忘、边界和稀有信号,引导LLM重新探索环境并合成新任务,实现智能体能力与训练数据的闭环协同演化。
2604.15840PieceHint:强化学习中的关键推理步骤提示框架
Placing Puzzle Pieces Where They Matter: A Question Augmentation Framework for Reinforcement Learning提出 PieceHint 框架,通过价值驱动的关键推理步骤识别与渐进式提示撤回,提升小模型在数学推理任务上的性能与探索多样性。
2604.15830Qwen3.5-Omni 技术报告
Qwen3.5-Omni Technical ReportQwen3.5-Omni 是一个支持文本、图像、音频和音视频多模态理解与生成的原生全模态大模型,采用 Thinker-Talker 架构,引入 ARIA 对齐机制提升流式语音合成稳定性,并在 215 项评测中达到 SOTA 水平。
2604.15804MEMEVOBENCH:大模型智能体记忆误演化基准评测
MEMEVOBENCH: BENCHMARKING MEMORY MISEVOLUTION IN LLM AGENTS提出首个评估大模型智能体在污染记忆持续演化下安全性的基准 MemEvoBench,涵盖误导记忆注入、工具噪声反馈和偏见用户反馈三类风险,揭示记忆演化是安全退化的主要根源。
2604.15774基于关键信息逐步注意力的混合层蒸馏提升小模型推理能力
Improving Reasoning Capabilities in Small Models through Mixture-of-Layers Distillation with Stepwise Attention on Key Information提出 MoLSAKI 框架,通过蒸馏教师模型在推理过程中对关键信息的逐步注意力,并结合混合层(MoL)动态对齐策略,提升小模型的复杂推理能力。
2604.15701模态链:从静态融合到动态编排的全模态大模型
Paper: 2604.14520提出 Chain of Modality (CoM) 框架,通过动态编排模态拓扑结构和推理路径,解决全模态大模型中因静态融合导致的性能退化问题。
2604.14520TIP:论在策略蒸馏中的词元重要性
TIP: Token Importance in On-Policy Distillation提出 TIP 双轴分类法,基于学生熵和师生分歧识别信息量最大的词元,结合 Soft-OR 评分实现高效在策略蒸馏。
2604.14084AVID:基于智能体驱动构建的全模态视听不一致理解基准
Paper: 2604.13593提出首个大规模视听不一致理解基准 AVID,通过智能体驱动的数据构建流程生成 11.2K 长视频与 78.7K 片段,支持检测、定位、分类与推理评估,并揭示现有全模态模型在跨模态冲突感知上的显著缺陷。
2604.13593OmniTrace:面向全模态大模型生成时归因的统一框架
Paper: 2604.13073提出 OmniTrace,一种轻量级、模型无关的生成时归因框架,将任意 token 级信号转化为跨模态、语义连贯的 span 级解释,无需重训练或监督。
2604.13073大模型同策略蒸馏的再思考:现象、机制与实践方法
Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe系统分析同策略蒸馏(OPD)成功与失败的条件,揭示其依赖师生模型思维模式一致性和教师提供新知识的能力,并提出两种恢复失败OPD的实用策略。
2604.13016Lightning OPD:离线策略蒸馏框架
Lightning OPD: Offline OPD提出 Lightning OPD,一种基于教师一致性的离线策略蒸馏方法,通过预计算教师 log-probabilities 消除对实时教师服务器的依赖,在保持性能的同时实现 4.0× 训练效率提升。
2604.13010基于块扩散草稿树的推测解码加速方法
DDTree: Accelerating Speculative Decoding with Block Diffusion Draft Trees提出 DDTree 方法,利用单次块扩散前向传播生成的逐位置分布构建最优草稿树,在固定节点预算下最大化目标模型接受长度期望,实现比 vanilla DFlash 更高效的推测解码。
2604.12989Moshi RAG:面向全双工语音语言模型的异步知识检索
提出 Moshi RAG,首个支持检索增强生成(RAG)的全双工语音模型,通过异步检索机制在保持实时交互性的同时显著提升事实准确性。
2604.12928Reason XL:在不牺牲性能的前提下转移大语言模型的推理语言
Reason XL : Shifting LLM Reasoning Language Without Sacrificing Performance提出首个大规模多语言对齐推理语料库 ReasonXL,并通过两阶段训练(SFT + RLVR)实现 LLM 推理语言从英语到目标语言的迁移,同时保持或提升任务性能。
2604.12378Self-Distillation Zero:自修正将二元奖励转化为密集监督
Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision提出 SD-Zero 方法,通过两阶段自修正训练(SRT)和自蒸馏,将模型自身生成的二元奖励转化为 token 级密集监督,无需外部教师或高质量演示即可显著提升推理性能。
2604.12002ClawGuard:面向工具增强型 LLM 代理的运行时安全框架
2604.11790提出 ClawGuard,一种在工具调用边界实施确定性访问控制的运行时安全框架,通过用户确认的任务级规则自动防御间接提示注入攻击。
2604.11790SWE-AGILE:高效管理动态推理上下文的软件代理框架
2604.11716提出 SWE-AGILE 框架,通过动态推理上下文、轨迹快照训练和压缩感知优化,在有限上下文窗口内实现深度 System-2 推理,显著提升 7B-8B 模型在 SWE-Bench-Verified 上的性能。
2604.11716异构任务下的自演进 LLM 记忆提取
2604.11610提出 CluE,一种基于聚类的自演进记忆提取框架,解决现有方法在异构任务分布下泛化能力差的问题,在 BEHEMOTH 基准上实现 +9.04% 相对增益。
2604.11610Synthius-Mem:受脑启发的抗幻觉人格记忆系统
Synthius-Mem: Brain-Inspired Hallucination-Resistant Persona Memory Achieving $94.4\%$ Memory Accuracy and $99.6\%$ Adversarial Robustness on LoCoMo提出一种受人类大脑记忆结构启发的六域结构化人格记忆系统,在LoCoMo基准上实现94.4%记忆准确率与99.6%对抗鲁棒性,同时降低约5倍token消耗。
2604.11563Relax:面向全模态大规模后训练的异步强化学习引擎
Paper: 2604.11554提出 Relax 系统,通过服务化架构、异步数据总线和全模态原生设计,解决大规模多模态 RL 训练中的异构性、鲁棒性与吞吐量-陈旧性权衡问题。
2604.11554Policy Split:基于双模式熵正则化的LLM强化学习探索激励方法
2604.11510提出Policy Split框架,通过在同一模型内划分正常模式与高通量模式,并引入双模式熵正则化,在保持准确率的同时有效提升LLM强化学习中的探索能力。
2604.11510多语言合成数据生成中教师语言模型的评估
2604.11290提出 Polyglot Score (PG-Score) 指标,系统评估10个语言模型在6种语言上的多语言合成数据生成能力,发现模型规模与教师效果无关,数据多样性与流畅性才是关键预测因子。
2604.11290伪统一性:熵探测揭示统一多模态模型中的信息模式分歧
2604.10949提出基于信息论的熵探测框架,揭示统一多模态模型在编码和生成阶段存在模态不对称与响应模式分裂,导致‘伪统一性’现象。
2604.10949Audio-Omni:面向通用音频生成与编辑的多模态统一框架
2604.10708提出首个端到端统一框架 Audio-Omni,通过冻结 MLLM 与可训练 DiT 的解耦架构,结合双路条件注入机制,实现跨通用声音、音乐和语音领域的多模态理解、生成与编辑,并构建超百万样本的 AudioEdit 数据集解决编辑任务数据稀缺问题。
2604.10708SCOPE:基于信号校准的双路径自适应加权策略优化
2604.10688提出一种双路径自适应训练框架 SCOPE,通过区分正确与错误轨迹并分别采用学生困惑度加权 MLE 和教师困惑度加权 KL 蒸馏,实现信号质量感知的策略优化。
2604.10688Skill-SD:面向多轮 LLM 代理的技能条件化自蒸馏
2604.10674提出 Skill-SD 框架,通过将代理自身轨迹总结为自然语言技能作为动态教师信号,结合重要性加权反向 KL 损失和动态教师同步机制,提升多轮 LLM 代理在稀疏奖励任务中的训练效率与稳定性。
2604.10674面向智能体AI系统的软件工程重构
2604.10599本文通过多源文献综述,论证了在LLM和智能体AI系统大规模生成代码的背景下,软件工程应从代码编写转向意图编排、系统验证和人机协同,并提出教育、工具、流程和专业实践四个维度的转型路径。
2604.10599Agent² RL-Bench:评估 LLM 代理能否自主设计强化学习后训练流程
2604.10547提出 Agent² RL-Bench 基准,用于评估 LLM 代理在有限预算下自主设计、实现并运行完整强化学习(RL)后训练流程的能力,涵盖从静态监督训练到闭环在线 RL 的三级结构复杂度。
2604.10547基于认识论引导的LLM对话增强自主学习
2604.10545该论文提出CausaDisco系统,通过将亚里士多德的四因论融入LLM提示工程,引导学习者生成更深入、多维的追问,从而提升自主学习的互动性与意义建构能力。
2604.10545视觉增强的深度缩放用于多模态隐式推理
2604.10500提出视觉重放模块与路由深度缩放机制,解决多模态隐式推理中视觉优化不稳定和固定深度瓶颈问题,结合课程学习策略提升推理精度与效率。
2604.10500SWE-Shepherd:基于过程奖励模型的代码智能体强化方法
2604.10493提出 SWE-Shepherd 框架,利用过程奖励模型(PRM)为代码智能体提供细粒度中间步骤反馈,提升其在真实软件工程任务中的决策效率与质量。
2604.10493Whisper-AuT:面向高效音频-LLM训练的领域适配音频编码器
2604.10438通过微调 Whisper-large-v3 构建多领域音频编码器 Whisper-AuT,显著提升非语音音频表征能力,降低下游音频-LLM训练成本。
2604.10438LLM-PRISM:大模型训练中永久GPU故障引发的静默数据损坏特征分析
2604.10390提出LLM-PRISM方法,结合RTL级GPU故障模拟与Megatron-LM中的随机注入引擎,系统评估永久性和间歇性硬件故障对LLM预训练的影响,发现数值格式(FP8 > BF16 > FP16)和故障相位显著影响训练稳定性。
2604.10390SVSR:一种面向多模态推理的自验证与自修正范式
2604.10228提出 SVSR 框架,通过三阶段训练(构建自修正轨迹数据集、冷启动 SFT、半在线 DPO)使多模态模型具备显式自验证与自修正能力,提升复杂推理任务的鲁棒性和泛化性。
2604.10228视觉引导的策略优化用于多模态推理
2604.09349提出 VGPO 框架,通过内在隐藏状态相似性定位视觉激活,并结合双粒度优势重加权策略缓解时序视觉遗忘,提升多模态推理的视觉忠实度。
2604.09349BlendFusion:面向扩散模型训练的可扩展合成数据生成
2604.09022提出 BlendFusion 框架,通过基于物理的路径追踪从 3D 场景生成高质量图像-文本对,避免纯扩散生成数据的视觉不一致性和模型自噬问题。
2604.09022OpenVLThinkerV2:面向多领域视觉任务的通用多模态推理模型
2604.08539提出高斯GRPO(G²RPO)强化学习目标与任务级响应长度和熵塑形机制,构建出在18个多模态基准上超越主流开源与专有模型的高鲁棒性通用视觉推理模型OpenVLThinkerV2。
2604.08539SuperNova:基于自然指令的强化学习通用推理数据构建框架
2604.08477提出 SuperNova 数据构建框架,通过系统化筛选和混合自然指令任务,提升大语言模型在通用推理任务上的强化学习效果。
2604.08477Faithful GRPO:通过约束策略优化提升多模态语言模型的视觉空间推理能力
2604.08476提出 Faithful GRPO (FGRPO),一种基于拉格朗日对偶上升的约束策略优化方法,通过强制逻辑一致性和视觉 grounding 约束,在提升多模态推理准确率的同时显著改善推理质量。
2604.08476TTVS:通过测试时变分合成增强自探索强化学习
2604.08468提出 Test-Time Variational Synthesis (TTVS) 框架,利用未标注测试数据动态生成语义等价的查询变体,结合组内与跨组探索策略,在无监督条件下显著提升大模型推理能力。
2604.08468LLM 供应链中恶意中间路由攻击的测量研究
2604.08407首次系统研究 LLM API 路由器的中间人攻击面,提出四种攻击类型并在真实生态中验证其存在性与危害,同时评估三种客户端防御方案。
2604.08407SAVeR:基于自审计的LLM智能体可信推理框架
2604.08401提出SAVeR框架,通过自审计机制在智能体提交行动前验证中间推理轨迹的可信性,解决传统共识机制无法识别结构性错误信念的问题。
2604.08401SMC星团的3D运动学:残差速度揭示动力学扰动星团
2604.08348利用36个SMC星团的Gaia DR3自行、径向速度及个体距离数据,构建三维速度场并计算残差速度ΔV,发现ΔV ≈ 60 km/s为区分潮汐扰动区与主盘区的动力学阈值。
2604.08348HyperMem:基于超图的长对话记忆架构
2604.08256提出一种基于超图的三层记忆架构 HyperMem,通过超边显式建模高阶关联,解决传统成对关系方法在多跳推理和长期对话记忆中的碎片化检索问题。
2604.08256OmniJigsaw:通过模态协同重排序增强全模态推理
2604.08209提出 OmniJigsaw,一种基于时序重排序代理任务的自监督框架,通过三种模态协同策略(JMI、SMS、CMM)提升视频-音频联合推理能力,并设计两阶段数据过滤管道与复合奖励机制以支持大规模无标注数据训练。
2604.08209基于预测嵌入的多模态潜在推理
2604.08065提出 Pearl 框架,通过 JEPA 风格的预测嵌入对齐,在潜在空间中学习专家工具使用轨迹,避免推理时显式调用工具,同时支持多步工具调用。
2604.08065PASK:面向意图感知的长期记忆主动智能体
2604.08000提出 DD-MM-PAS 主动智能范式,构建 IntentFlow 模型与混合记忆系统,实现低延迟、个性化、长期演化的主动 AI 系统。
2604.08000长上下文推理的原子技能分解与强化学习增强
A Decomposition Perspective to Long-context Reasoning for LLMs将长上下文推理任务分解为五个原子技能,并通过自动合成数据集和强化学习提升模型性能,平均提升7.7%。
2604.07981基于策略蒸馏的语言模型在自动驾驶运动规划中的应用
2604.07944提出一种基于策略的广义知识蒸馏(GKD)方法,将大型教师语言模型(Qwen3-8B)的运动规划知识压缩至小型学生模型(Qwen3-1.7B),在nuScenes基准上实现接近教师性能且显著优于密集反馈强化学习基线。
2604.07944大模型后训练的统一视角:离策略与在策略学习
2604.07941提出以轨迹来源(离策略/在策略)为顶层组织轴,结合功能角色(支持扩展、策略重塑、行为巩固)的统一框架,系统梳理大模型后训练方法。
2604.07941面向隐私敏感身份识别的强化引导合成数据生成
2604.07884提出一种强化学习引导的合成数据生成框架,通过多目标奖励机制优化生成样本的语义一致性、分布覆盖和表达多样性,解决隐私敏感场景下数据稀缺导致的生成质量低下问题。
2604.07884MemReader:从被动提取到主动记忆管理
2604.07877提出 MemReader 系列模型,将长期记忆提取重构为基于 ReAct 范式的主动决策过程,通过价值判断、模糊性检测和完整性检查实现低噪声、可更新的记忆管理。
2604.07877基于小语言模型的轻量级 LLM 代理记忆系统
2604.07798提出 LightMem,一个由小语言模型(SLM)驱动的模块化记忆系统,通过分离在线检索与离线记忆整合,在保持高检索准确率的同时显著降低延迟。
2604.07798ORACLE-SWE:量化 Oracle 信息信号对 SWE 代理的贡献
2604.07789提出 ORACLE-SWE 方法,从 SWE 基准测试中提取五类关键信息信号(Reproduction Test、Regression Test、Edit Location、Execution Context、API Usage),并通过控制消融实验量化其对代理性能的理想贡献上限。
2604.07789不完美验证器已足够:基于噪声奖励的学习
An Imperfect Verifier is Good Enough: Learning with Noisy Rewards该论文系统研究了强化学习可验证奖励(RLVR)中验证器噪声对模型训练的影响,发现中等程度噪声(≤15%)不会显著损害性能,且高精度比高召回更重要。
2604.07666ReflectRM:基于统一判断框架的自反思生成式奖励模型
2604.07506提出 ReflectRM,通过统一建模响应偏好与分析偏好,并利用自反思机制提升生成式奖励模型的性能与鲁棒性。
2604.07506超越人类可读性:面向智能体开发时代的软件工程规范重构
Beyond Human-Readable: Rethinking Software Engineering Conventions for the Agentic Development Era提出语义密度原则,通过日志格式实验证明过度压缩会增加模型推理成本,主张消除零信息结构而非压缩高信息语义内容。
2604.07502WRAP++:基于网页拓扑关系的跨文档联合问答预训练数据增强
2604.06829WRAP++ 通过从维基百科超链接中发现双链和共提关系,合成跨文档联合问答数据,显著提升大模型在 SimpleQA 上的知识可恢复性。
2604.06829AudioKV:面向高效大音频语言模型的 KV 缓存淘汰策略
Paper: 2604.06694提出 AudioKV 框架,通过识别音频关键注意力头并进行频谱分数平滑,在 KV 缓存压缩中显著提升音频任务性能。
2604.06694多轮推理中的自适应思考预算分配
2604.05164提出TAB策略,将多轮推理建模为多目标MDP,通过GRPO训练预算分配策略,在数学推理任务上实现更高精度-令牌效率权衡,节省最多35%令牌。
2604.05164π²:基于结构化数据的推理数据提升大模型长上下文推理能力
π 2 \pi^{2} : Structure-Originated Reasoning Data Improves Long-Context Reasoning Ability of Large Language Models提出一种从维基百科表格生成高质量长上下文推理数据的流水线 π²,通过结构化扩展、双路径验证和反向翻译生成推理轨迹,显著提升模型在多跳分析任务上的表现。
2604.05114Full-Duplex-Bench-v3:面向真实语音中断的全双工语音代理工具使用基准
Full-Duplex-Bench-v3提出首个基于真实人类语音、包含多步工具调用与五类中断标注的全双工语音代理评估基准 FDB-v3,系统评测六类模型在准确性、延迟与对话轮转上的权衡。
2604.04847OpenClaw 个人 AI 代理的 CIK 安全分析
Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw提出 CIK 分类法(能力、身份、知识),对 OpenClaw 个人 AI 代理进行真实环境安全评估,揭示持久状态中毒的结构性漏洞。
2604.04759DP-OPD:面向语言模型的差分私有同策略蒸馏
DP-OPD: Differentially Private On-Policy Distillation for Language Models提出 DP-OPD,一种仅对学生模型应用 DP-SGD、利用冻结教师在同策略轨迹上提供密集 token 级监督的差分私有蒸馏框架,在严格隐私预算下提升压缩模型效用并简化训练流程。
2604.04461RLSD:基于自蒸馏的强化学习与可验证奖励融合方法
Self-Distilled RLVR提出 RLSD 方法,将自蒸馏用于 token 级更新幅度调制,同时保留 RLVR 的环境反馈作为更新方向锚点,解决 OPSD 的信息泄露与训练不稳定问题。
2604.03128多轮强化学习在工具调用代理中的迭代奖励校准
2604.02869提出结合 MT-GRPO 与 GTPO 的多轮强化学习方法,并引入迭代奖励校准(IRC)解决密集奖励导致的梯度错位问题,显著提升工具调用代理在真实客服任务上的性能。
2604.02869SRPO:基于样本路由的统一策略优化框架
SRPO Sample Routed Policy Optimization提出 SRPO 框架,通过样本级路由将正确样本导向 GRPO 奖励对齐更新,错误样本导向 SDPO 密集修正,并结合熵感知动态加权提升稳定性与性能。
2604.02288对抗大模型训练中的数据清洗攻击
2604.01904提出合成数据还原(SDR)方法,通过逆向推断未知的数据清洗变换,恢复被风格迁移后的训练数据检测信号,提升黑盒场景下对大模型未经授权使用数据的检测能力。
2604.01904并非所有 token 视觉贡献均等:面向大视觉-语言模型的感知 grounding 策略优化
2604.01840提出 Token Visual Dependency 概念,并设计 PGPO 方法,在强化学习中实现 token 级别的视觉依赖感知优势重分配,提升多模态推理性能。
2604.01840从 SWE-Zero 到 SWE-Hero:无执行到有执行的代码智能体微调
2604.01496提出两阶段 SFT 框架 SWE-Zero 到 SWE-Hero,先通过 30万条无执行轨迹学习代码语义,再用 1.3万条有执行轨迹进行精炼,在 SWE-bench Verified 上达到 62.2% 的解决率。
2604.01496更少即是更多:面向智能体、推理与代码 LLM 的高效训练框架
2604.00824提出 STITCH 框架,通过粗到细的轨迹筛选机制,在减少训练数据量的同时提升智能体在代码修复任务中的表现,验证了“少即是多”范式在代理任务中的有效性。
2604.00824在 Aurora 超级计算机上实现大规模 MoE 语言模型的可扩展预训练
2604.00785本文展示了在 Aurora 超算(127,488 个 Intel PVC GPU tile)上使用自研训练库 Optimus 对高达 220B 参数的 MoE 模型进行预训练,并通过 FastSparseMoE 和 EP-Aware 分片优化器等技术实现高效扩展。
2604.00785记忆还是检索:RAG 感知预训练的缩放律
2604.00715该论文系统研究了在固定数据预算下,预训练数据量与检索库大小之间的权衡关系,提出三维缩放律模型,揭示检索在不同模型规模和任务类型下的边际效用变化。
2604.00715大语言模型同策略蒸馏综述
A Survey of On-Policy Distillation for Large Language Models本文首次系统梳理了大语言模型中的同策略蒸馏(On-Policy Distillation, OPD)方法,提出统一理论框架与三维分类体系,并分析工业部署与未来方向。
2604.00626OptimSyn:基于影响力引导的评分标准优化合成数据生成
2604.00536提出一种基于目标模型梯度影响力估计的强化学习框架,自动优化合成数据生成中的评分标准(rubrics),提升合成数据对下游任务训练的有效性。
2604.00536Dynin-Omni:全模态统一大扩散语言模型
Paper: 2604.00007提出首个基于掩码扩散的8B规模开源全模态统一模型,支持文本、图像、语音的理解与生成以及视频理解,在共享离散词元空间内实现端到端迭代 refinement。
2604.00007LongCat-Next:将多模态信息词汇化为离散令牌
LongCat-Next: Lexicalizing Modalities as Discrete Tokens提出离散原生自回归(DiNA)范式,通过统一离散令牌空间实现文本、视觉和音频的原生多模态建模,并设计dNaViT视觉令牌器解决离散视觉建模的性能瓶颈。
2603.27538大语言模型心理自我建模的选择性缺陷
Mental-Self-Modeling通过行为导向的心理理论测试,揭示大语言模型在心理自我建模方面存在选择性缺陷,尤其在涉及自身信念与行为推理时表现不佳。
2603.26089重访同策略蒸馏:经验性失败模式与简单修复
Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes针对同策略蒸馏(OPD)中采样 token 方法的三大失败模式,提出基于教师 top-K 局部支持匹配的截断反向 KL 目标,结合 top-p 采样与特殊 token 掩码,提升优化稳定性与性能。
2603.25562X-OPD:面向语音大模型能力对齐的跨模态同策略蒸馏
X-OPD: Cross-Modal On-Policy Distillation for Capability Alignment in Speech LLMs提出 X-OPD 框架,通过同策略采样与文本教师模型的 token 级反馈,实现语音 LLM 与文本 LLM 的能力对齐,显著缩小性能差距并缓解灾难性遗忘。
2603.24596HDPO:基于特权自蒸馏的混合策略优化
HDPO Hybrid Distillation Policy Optimization提出 Hybrid Distillation Policy Optimization (HDPO),通过向模型自身注入真实答案生成特权轨迹,并在梯度消失的“悬崖”样本上进行自蒸馏,从而为强化学习提供有效学习信号。
2603.23871Memori:面向高效上下文感知 LLM 代理的持久化记忆层
2603.19935提出 Memori,一个与 LLM 无关的持久化记忆层,通过 Advanced Augmentation 管道将非结构化对话转化为语义三元组和会话摘要,实现高精度记忆检索与显著降低 token 成本。
2603.19935Nemotron-Cascade 2:基于级联强化学习与多领域同策略蒸馏的 LLM 后训练
Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation提出 Nemotron-Cascade 2,一个 30B MoE 模型(激活 3B 参数),通过扩展 Cascade RL 框架并引入多领域同策略蒸馏(MOPD),在数学、编程和智能体任务上实现金牌级性能,显著提升推理密度与训练效率。
2603.19220ProRL Agent:面向多轮LLM智能体RL训练的Rollout-as-a-Service基础设施
2603.18815提出ProRL Agent,一种基于Rollout-as-a-Service理念的解耦式可扩展基础设施,用于高效支持多轮LLM智能体的强化学习训练。
2603.18815复杂损失函数对LLM推理训练是否必要?
Are complicated loss functions necessary for teaching LLMs to reason?通过系统分析GRPO损失函数的组件,提出简化版RGRA方法,证明负反馈和优势估计关键,而PPO式裁剪非必需。
2603.18756D-Mem:面向 LLM 代理的双过程记忆系统
2603.18631提出 D-Mem 双过程记忆架构,通过轻量级向量检索(System 1)与全量审慎推理(System 2)的动态路由,在保持计算效率的同时显著提升长对话场景下的推理准确率。
2603.18631FLAIR:基于隐式推理的全双工口语对话模型内部认知建模
The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning提出一种名为 FLAIR 的全双工隐式内部推理方法,在用户说话期间通过连续更新的隐状态实现‘边听边思考’,无需显式推理标注或额外推理延迟。
2603.17837GASP:面向代码大模型的引导式非对称自博弈
GASP: Guided Asymmetric Self-Play For Coding LLMs提出 GASP 方法,通过真实数据中的难题作为目标点(goalpost)引导非对称自博弈,生成渐进式课程,提升代码大模型在 LiveCodeBench 上的表现并解决部分原本无法解决的难题。
2603.15957Code-A1:基于强化学习的代码与测试大模型对抗演化
Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement Learning提出 Code-A1 框架,通过分离代码生成与测试生成模型并赋予对抗性目标,结合 Mistake Book 经验回放机制,实现动态、自适应的代码强化学习训练。
2603.15611PerlAD:基于伪模拟强化学习的闭环端到端自动驾驶
PerlAD: Towards Enhanced Closed-loop End-to-end Autonomous Driving with Pseudo-simulation-based Reinforcement Learning提出 PerlAD 方法,利用离线数据集构建向量空间伪模拟环境,结合预测世界模型与分层解耦规划器,实现高效、渲染无关的闭环端到端自动驾驶强化学习训练。
2603.14908通过松弛同策略蒸馏高效扩展推理能力
Scaling Reasoning Efficiently via Relaxed On-Policy Distillation提出 Reopold 框架,通过奖励裁剪、熵引导采样和多阶段训练,稳定同策略蒸馏并提升小模型推理效率。
2603.11137V2A-DPO:面向视频到音频生成的全偏好优化
Paper: 2603.11089提出 V2A-DPO 框架,通过 AudioScore 评分系统、自动化偏好对生成和课程学习策略,优化流模型在视频到音频生成任务中对人类偏好的对齐能力。
2603.11089Speech-Omni-Lite:面向视觉-语言模型的轻量级语音接口
Speech-Omni-Lite : Portable Speech Interfaces for Vision–Language Models提出一种低成本、可移植的语音理解与生成框架,通过冻结视觉-语言主干并插入轻量模块,实现语音模态扩展,避免灾难性遗忘。
2603.09627DuplexCascade:无VAD的级联ASR-LLM-TTS全双工语音对话系统
DuplexCascade: Full-Duplex Speech-to-Speech Dialogue with VAD-Free Cascaded ASR–LLM–TTS Pipeline and Micro-Turn Optimization提出一种无VAD的级联语音对话架构,通过微轮次(micro-turn)切分与对话控制token实现全双工交互,在保持LLM智能的同时提升轮次切换鲁棒性。
2603.09180缺失的内存层级:面向 LLM 上下文窗口的需求分页
2603.09023提出 Pichay 系统,将操作系统中的需求分页与虚拟内存层级思想引入 LLM 上下文管理,解决因重复加载工具定义、陈旧结果等导致的 21.8% 结构性浪费问题。
2603.09023端到端全双工语音对话模型的隐私保护研究
Privacy-Preserving End-to-End Full-Duplex Speech Dialogue Models分析 SALM-Duplex 和 Moshi 两类端到端全双工语音对话模型在隐藏状态中泄露说话人身份的程度,并提出两种流式匿名化方案(Anon-W2W 和 Anon-W2F)以缓解隐私风险。
2603.08179熵感知的在线策略语言模型蒸馏
Entropy-Aware On-Policy Distillation of Language Models提出熵感知在线策略蒸馏(EOPD),在高熵区域引入前向KL散度以保留教师模型的不确定性,从而缓解模式坍缩并提升推理任务表现。
2603.07079CRISP:通过迭代自策略蒸馏实现推理压缩
OPSDC On-Policy Self-Distillation Reasoning Compression提出CRISP方法,利用模型自身在“简洁指令”下的行为作为教师信号,通过反向KL散度的迭代自蒸馏实现推理压缩,无需真实答案或难度估计,在保持准确率的同时显著减少token使用。
2603.05433Agentic Code Reasoning:基于半形式化推理的代码语义分析
Agentic Code Reasoning提出半形式化推理(semi-formal reasoning)结构化提示方法,使LLM代理无需执行代码即可完成补丁等价性验证、故障定位和代码问答等语义分析任务,准确率提升5-12个百分点。
2603.01896Draft-Thinking:长思维链大模型中的高效推理学习
2603.00578提出 Draft-Thinking 方法,通过渐进式课程学习让大模型内化简洁推理模式,在保持推理性能的同时显著降低 token 消耗。
2603.00578AriadneMem:面向终身记忆 LLM 代理的结构化推理系统
2603.03290提出一种两阶段结构化记忆系统,通过离线构建演化图和在线算法桥接发现,解决长时对话中的证据断裂与状态更新问题,在 LoCoMo 基准上实现多跳 F1 提升 15.2% 且运行时降低 77.8%。
2504.19413U-Mind:实时多模态交互与视听生成的统一框架
Paper: 2602.23739提出首个支持实时高层推理对话、指令跟随与感知完整视频生成的统一多模态交互系统 U-Mind,通过统一对齐与推理框架解决跨模态同步与推理能力退化问题。
2602.23739RLAD:面向强化学习推理的感知蒸馏方法
RLAD RL-aware Distillation提出 RLAD 框架,通过信任区域比率蒸馏(TRRD)将教师策略融入 GRPO 的重要性采样比中,实现基于优势信号的选择性模仿,提升小模型在逻辑与数学推理任务上的表现。
2602.22495EmoOmni:面向全模态大模型的情感理解与表达统一框架
Paper: 2602.21900提出 EmoOmni 框架,通过显式建模 Perception-Reasoning-Expression 因果链和情感思维链(E-CoT),结合真实世界数据管道 EmoOmniPipe 与评估基准 EmoOmniEval,实现多模态情感对话中的精准理解与表达。
2602.21900基于推理前缀的快速高效同策略蒸馏
Fast and Effective On-policy Distillation from Reasoning Prefixes提出一种改进的同策略蒸馏方法,仅对模型输出前缀进行蒸馏并提前终止采样,显著降低训练成本同时保持性能。
2602.15260突现性错位语言模型的行为自我意识及其再对齐后的转变
Emergently Misaligned Language Models Show Behavioral Self-Awareness That Shifts With Subsequent Realignment研究突现性错位(emergent misalignment)与行为自我意识的关系,发现错位模型能自我识别其有害性,且该自我评估在再对齐后同步恢复。
2602.14777广义同策略蒸馏:基于奖励外推的超越教师学习
Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation提出广义同策略蒸馏(G-OPD)框架,通过引入奖励缩放因子和灵活参考模型,实现奖励外推(ExOPD)与强到弱蒸馏中的奖励校正,使学生模型性能超越教师。
2602.12125M²A:面向长期个性化交互的双层混合多模态记忆体智能体
2602.07624提出 M²A 框架,通过双层混合记忆体与双智能体协作机制,实现长期多模态对话中的在线个性化记忆更新与高效检索。
2411.11706PersonaPlex:全双工对话语音模型的角色与音色控制
PersonaPlex提出 PersonaPlex,一种基于混合系统提示(文本角色+音频音色)的全双工语音对话模型,支持零样本音色克隆与细粒度角色控制,在真实场景客服任务中实现高自然度与强指令遵循能力。
2602.06053DFlash:基于块扩散的推测性解码加速框架
DFlash: Block Diffusion for Flash Speculative Decoding提出 DFlash,一种基于轻量级块扩散模型的推测性解码框架,通过并行生成和目标模型隐层特征注入,实现高达 6.1× 的推理加速。
2602.06036Agent-Omit:基于智能体强化学习的自适应思维与观察省略高效LLM代理
2602.04284提出Agent-Omit框架,通过合成冷启动数据与省略感知强化学习,使LLM代理能自适应跳过冗余思维链和中间观察,显著降低token消耗同时保持任务准确率。
2602.04284Conformal Thinking:基于计算预算的推理风险控制
2602.03814提出一种基于分布无关风险控制的自适应推理早停框架,通过上下双阈值机制在保证用户指定错误率的前提下最小化计算开销。
2602.03814Video-OPD:基于同策略蒸馏的高效多模态大模型时序视频定位训练
Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation提出 Video-OPD 框架,通过同策略蒸馏将稀疏奖励转化为密集 token 级监督,提升时序视频定位任务训练效率与性能。
2602.02994MemoryLLM:可插拔的可解释前馈记忆Transformer架构
2602.00398提出MemoryLLM,通过将FFN模块与自注意力解耦并直接基于token嵌入训练,使其成为可解释的上下文无关神经检索记忆,支持预计算为Token-wise Lookups(ToLs)以提升推理效率。
2602.00398自我改进预训练:利用后训练模型提升预训练效果
Self-Improving Pretraining: using post-trained models to pretrain better models提出一种新型预训练范式 Self-Improving Pretraining,利用强后训练模型作为重写器和判别器,在预训练阶段通过强化学习引导策略模型生成更安全、真实且高质量的文本。
2601.21343Qwen3-ASR 技术报告
Qwen3-ASR Technical Report提出 Qwen3-ASR 系列模型,包括两个支持 52 种语言和方言的端到端语音识别模型(1.7B 和 0.6B 参数)以及一个基于 LLM 的非自回归多语言强制对齐模型,在识别精度、推理效率和复杂场景鲁棒性方面达到开源领先水平。
2601.21337自蒸馏推理器:大语言模型的在线自蒸馏方法
Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models提出 On-Policy Self-Distillation (OPSD),让单个 LLM 同时作为教师和学生,利用真实答案提供密集 token 级监督,提升推理任务训练效率。
2601.18734思维增强函数调用:通过内嵌推理提升LLM参数准确性
2601.18282提出Think-Augmented Function Calling (TAFC)框架,通过在函数签名中引入显式推理参数,提升大语言模型在复杂多参数函数调用中的准确性与可解释性。
2601.18282LongCat-Flash-Thinking-2601 技术报告
LongCat-Flash-Thinking-2601 Technical Report提出 LongCat-Flash-Thinking-2601,一个 560B 参数的 MoE 推理模型,通过环境扩展、噪声鲁棒训练和 Heavy Thinking 模式实现领先的代理推理能力。
2601.16725Qwen3-TTS 技术报告
Qwen3-TTS Technical ReportQwen3-TTS 是一个支持多语言、可控、鲁棒且流式生成的大规模语音合成模型系列,采用双轨架构与两种新型语音 tokenizer 实现高质量低延迟语音生成。
2601.15621ROMA:支持交互式流理解的全模态实时助手
ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding提出 ROMA 模型,通过轻量级 speak head 解耦响应时机与内容生成,结合两阶段训练策略,实现统一的实时音视频主动与被动交互能力。
2601.10323Omni-R1:面向多模态推理的统一生成范式
Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning提出统一生成式多模态推理范式,通过中间图像生成整合多样化推理技能,并设计 Omni-R1 与 Omni-R1-Zero 框架实现功能图像生成与低标注依赖训练。
2601.09536Qwen3-VL-Embedding 与 Qwen3-VL-Reranker:统一多模态检索与排序框架
Qwen3-VL-Embedding and Qwen3-VL-Reranker: A Unified Framework for State-of-the-Art Multimodal Retrieval and Ranking基于 Qwen3-VL 构建统一多模态嵌入与重排序模型,支持文本、图像、文档图像和视频的联合表示学习,在 MMEB-V2 上达到 SOTA 性能(77.8 分)。
2601.04720SimpleMem:面向LLM智能体的高效终身记忆框架
2601.02553提出SimpleMem,一种基于语义无损压缩的三阶段记忆框架,通过结构化压缩、在线语义合成和意图感知检索规划,在长上下文交互中实现高信息密度与低推理开销的平衡。
2310.11511RollArt:基于解耦基础设施的代理强化学习训练扩展
2512.22560提出 RollArt 系统,通过硬件亲和性映射、细粒度异步执行和状态感知计算三大原则,在解耦基础设施上高效扩展多任务代理强化学习训练,实现端到端训练时间减少 1.35–2.05 倍。
2512.22560LongCat-Image 技术报告:高效双语图像生成与编辑模型
LongCat-Image Technical Report提出 LongCat-Image,一个仅6B参数的轻量级扩散模型,在图像生成与编辑任务上实现SOTA性能,尤其在中文文本渲染和视觉一致性方面表现突出,并开源完整训练工具链。
2512.07584基于自然语言与强化学习的多智能体协调模型 Conductor
Learning to Orchestrate Agents in Natural Language with the Conductor提出一种名为 Conductor 的 7B 参数语言模型,通过端到端强化学习自动设计多 LLM 智能体间的协作策略,在 LiveCodeBench 和 GPQA 等推理基准上实现 SOTA 性能。
2512.04388RP-ReAct:面向复杂企业任务的推理-规划-执行多智能体架构
2512.03560提出 RP-ReAct 多智能体架构,通过分离高层推理规划与底层工具执行,并引入上下文节省策略,提升在复杂企业任务中的稳定性、泛化能力和抗上下文溢出能力。
2512.03560SkyRL-Agent:面向多轮LLM智能体的高效强化学习训练框架
2511.16108提出 SkyRL-Agent 框架,通过细粒度异步调度与工具增强训练策略,实现高效、可扩展的多轮 LLM 智能体强化学习训练,并在 SWE 任务上显著提升效率与性能。
2511.16108Agent-R1:基于端到端强化学习训练强大的LLM智能体
2511.14460提出 Agent-R1 框架,通过扩展 MDP 建模和模块化设计,实现 LLM 智能体在多轮交互任务中的端到端强化学习训练。
2511.14460MTR-DuplexBench:面向全双工语音语言模型多轮对话的综合评测基准
MTR-DuplexBench: Towards a Comprehensive Evaluation of Multi-Round Conversations for Full-Duplex Speech Language Models提出首个支持多轮、逐轮评估的全双工语音语言模型评测基准 MTR-DuplexBench,涵盖对话特征、对话质量、指令遵循与安全性四个维度,并设计全双工对话分段方法解决边界模糊与上下文不一致问题。
2511.10262超越 ReAct:面向复杂工具增强 LLM 推理的规划器中心框架
2511.10037提出一种以规划器为核心的 Plan-Execute 范式,通过 DAG 全局规划和两阶段 SFT+GRPO 训练,解决传统 ReAct 类方法在复杂多工具任务中的局部优化陷阱问题。
2511.10037LiCoMemory:面向高效长期推理的轻量级认知代理记忆框架
2511.01448提出 LiCoMemory,一种基于轻量级分层图结构 CogniGraph 的端到端代理记忆系统,通过语义索引与时间感知重排序实现高效、连贯的长期对话推理。
2511.01448大模型自视为比人类更理性:基于博弈论的AI自我意识测量
LLMs Position Themselves as More Rational Than Humans: Emergence of AI Self-Awareness Measured Through Game Theory提出AISAI框架,通过‘猜2/3平均数’博弈实验测量大语言模型的自我意识,发现先进模型能根据对手类型(人类/AI/类己AI)差异化策略,并形成‘自我 > 其他AI > 人类’的理性层级认知。
2511.00926LongCat-Flash-Omni 技术报告
LongCat-Flash-Omni Technical Report提出 LongCat-Flash-Omni,一个 560B 参数的端到端开源全模态模型,支持低延迟实时音视频交互,采用渐进式训练策略与模态解耦并行架构实现高效多模态融合。
2511.00279PORTool:基于奖励树的工具使用大模型训练方法
2510.26020提出 PORTool,一种结合树状轨迹展开与步骤级奖励的策略优化算法,用于提升大模型在动态工具调用环境中的推理与执行能力。
2510.26020VOLD:通过同策略蒸馏实现从LLM到VLM的推理能力迁移
VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation提出VOLD框架,结合GRPO强化学习与同策略知识蒸馏,利用纯文本数据将文本大模型的推理能力迁移至视觉语言模型,无需视觉推理训练数据。
2510.23497LongCat-Video 技术报告
LongCat-Video Technical ReportLongCat-Video 是一个 13.6B 参数的扩散 Transformer 视频生成模型,支持多任务统一架构、高效长视频生成与多奖励 RLHF 训练。
2510.22200The Alignment Waltz:通过多智能体协同训练提升LLM安全性
The Alignment Waltz: Jointly Training Agents to Collaborate for Safety提出 WaltzRL 多智能体强化学习框架,联合训练对话智能体与反馈智能体,通过动态改进奖励(DIR)实现安全对齐与避免过度拒绝的协同优化。
2510.08240TRAAC:通过自适应注意力压缩缓解欠思考/过思考
2510.01581提出一种基于在线强化学习的自适应注意力压缩方法 TRAAC,通过动态调节推理轨迹长度来平衡推理准确性与计算效率,解决模型在面对不同难度任务时的欠适应问题。
2510.01581ToolBrain:面向智能体工具的灵活强化学习框架
2510.00023提出 ToolBrain,一个轻量级、用户友好的强化学习框架,用于训练基于大语言模型的智能体使用工具,支持灵活奖励设计、知识蒸馏、智能工具检索和高效训练优化。
2510.00023大模型强化学习后训练的缩放行为:数学推理中的实证研究
Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning通过 Qwen2.5 和 Llama 3 系列模型(0.5B–72B)上的大规模 RL 实验,提出并验证了描述测试损失与模型规模、计算量和数据量之间关系的预测性幂律公式,揭示学习效率随模型增大趋于饱和的现象,并证明在数据受限时重复使用数据是有效策略。
2509.25300MGM-Omni:面向个性化长时语音的 Omni LLM 扩展
MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech提出 MGM-Omni,一种双轨架构的 Omni LLM,通过解耦多模态理解与语音生成,实现高效长时语音理解与个性化语音合成。
2509.25131LongCat-Flash-Thinking:一种高效开源推理模型技术报告
Introducing LongCat-Flash-Thinking: A Technical Report提出 LongCat-Flash-Thinking,一个 5600 亿参数 MoE 架构的开源推理模型,通过长链思维冷启动训练与大规模强化学习,在数学、代码、形式化证明和智能体推理等任务上实现 SOTA 性能,并显著提升 token 效率。
2509.18883Qwen3-Omni 技术报告
Qwen3-Omni Technical ReportQwen3-Omni 是一个统一的多模态模型,首次在文本、图像、音频和视频四种模态上实现无性能退化,并在36个音频与视听基准测试中达到开源SOTA。
2509.17765Text2Mem:面向内存操作系统的统一内存操作语言
2509.11145提出 Text2Mem,一种用于 LLM 代理的统一内存操作语言,通过结构化 schema 和验证-解析-适配管道,将自然语言指令转化为可执行、可验证、跨后端的内存操作。
2303.18223RLFactory:面向LLM多轮工具使用的即插即用强化学习后训练框架
2509.06980提出RLFactory,一个支持异步工具调用、解耦架构与多样化奖励计算的即插即用强化学习后训练框架,用于提升大语言模型在多轮工具使用任务中的性能与训练效率。
2509.06980大语言模型中的智能体强化学习:综述
2509.02547本文系统梳理了将强化学习应用于大语言模型以构建自主智能体的范式演进,提出从传统单步偏好优化(PBRFT)到多步部分可观测马尔可夫决策过程(POMDP)驱动的智能体强化学习(Agentic RL)的理论框架,并从能力维度和任务维度构建双重分类体系。
2509.02547LongCat-Flash 技术报告
LongCat-Flash Technical Report提出 LongCat-Flash,一个 560B 参数的 MoE 模型,通过零计算专家和捷径连接 MoE 架构实现高效训练与推理,并在代理任务上表现优异。
2509.01322TurnGuide:通过动态轮次级文本-语音交错增强全双工口语交互
TurnGuide: Enhancing Meaningful Full Duplex Spoken Interactions via Dynamic Turn-Level Text-Speech Interleaving提出 TurnGuide 方法,在端到端全双工语音语言模型中通过动态轮次分割与文本-语音交错生成,提升语义连贯性和交互自然性。
2508.07375Nemori:基于预测误差的自适应记忆蒸馏框架
2508.03341提出Nemori框架,通过预测误差实现LLM代理的自适应记忆蒸馏,以数据驱动方式识别值得保留的信息,提升长期交互性能与效率。
2508.03341基于强化学习的智能体安全对齐框架
Agent Safety Alignment via Reinforcement Learning提出首个端到端智能体安全对齐框架,通过沙盒化强化学习统一处理用户侧与工具侧威胁,实现安全性与可用性的联合优化。
2507.08270基于可微奖励优化的神经编解码器语言模型语音合成系统
2507.05911提出一种可微奖励优化(DiffRO)方法,直接基于神经编解码器 token 预测奖励,避免传统 RLHF 中合成音频的计算开销,并结合多任务奖励模型实现发音准确性与情感属性的零样本控制。
2507.05911预算内推理:大模型自适应与可控测试时计算综述
2507.02076提出双层分类框架(L1可控性/L2自适应性),系统梳理高效测试时计算(TTC)方法,并实证分析主流推理模型在预算控制与效率上的表现。
2507.02076AdapThink:推理语言模型的适应性思维偏好
2506.18237提出一种基于强化学习的后训练框架 AdapThink,通过组相对奖励函数和多样性感知采样机制,动态调节推理模型在不同置信度下的反思深度偏好,以缓解“过度思考”与“思考不足”问题。
2506.18237Stream-Omni:支持多模态同步交互的大语言-视觉-语音模型
Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model提出一种基于文本中心对齐策略的多模态模型 Stream-Omni,通过序列维度拼接实现视觉-文本对齐,通过 CTC 驱动的层维度映射实现语音-文本对齐,从而在较少三模态数据(仅 2.3 万小时语音)下实现高效的跨模态能力迁移,并支持语音交互过程中同步输出中间文本结果。
2506.13642DynamicMind:面向大语言模型的三模思维系统
2506.05936提出 DynamicMind 框架,通过轻量级 Mind Router 动态选择快、常、慢三种思维模式,在零样本问答任务中实现性能与计算效率的自适应平衡。
2506.05936推理模型测试时扩展思考的幻象:更多思考未必更好
2506.04210通过实证分析揭示测试时扩展思考(如“Wait”提示)会导致性能先升后降的‘过度思考’现象,并提出并行思考作为更优的推理预算分配策略。
2506.04210VerificAgent:面向可扩展监督的领域特定记忆验证框架
VerificAgent : Domain-Specific Memory Verification for Scalable Oversight of Aligned Computer-Use Agents提出 VerificAgent 框架,通过专家种子知识、轨迹驱动记忆增长与人工事后核查三阶段机制,将持久化记忆转化为对齐保障工具,在 OSWorld Office 任务上实现成功率翻倍并消除对抗性记忆注入风险。
2506.02539AlphaOne:测试时调控推理模型快慢思维
2505.24863提出 AlphaOne(α1)框架,通过引入 α-moment 和伯努利随机过程动态调度慢思维转换,实现推理进度的通用调制,提升大推理模型在数学、编程和科学任务上的性能与效率。
2505.24863ML-Agent:基于强化学习的自主机器学习工程代理
ML-Agent: Reinforcing LLM Agents for Autonomous Machine Learning Engineering提出一种基于强化学习的代理训练框架,使7B规模LLM代理在仅训练9个ML任务的情况下,实现与GPT-5等大模型相当的性能,同时显著降低计算成本。
2505.23723AgentAlign:面向智能体大模型的安全对齐框架
AgentAlign: Navigating Safety Alignment in the Shift from Informative to Agentic Large Language Models提出 AgentAlign 框架,通过抽象行为链和模拟环境合成高质量安全对齐数据,显著提升 LLM 智能体在恶意请求下的拒绝率(35.8%–79.5%),同时保持或提升其任务效用。
2505.23020CosyVoice 3:面向真实场景的语音生成模型
2505.17589提出 CosyVoice 3,通过数据与模型规模扩展、新型语音 tokenizer 和差分奖励优化,实现高质量零样本多语言语音合成。
2505.17589SALM-Duplex:高效直接的语音到语音双向建模模型
SALM-Duplex提出一种无需语音预训练的双向语音到语音(S2S)架构,通过分离用户与代理建模、使用流式编码器和个性化编解码器,实现低延迟、高交互性的实时对话能力。
2505.15670何时继续思考:面向高效推理的自适应思维模式切换
2505.15400提出自适应自恢复推理框架(ASRR),通过抑制不必要推理并激活模型内部自恢复机制,实现根据问题难度动态分配推理预算,在保持性能的同时显著降低计算开销。
2505.15400ReflAct:基于目标-状态反思的LLM智能体世界接地决策
2505.15182提出ReflAct框架,通过将LLM智能体的推理重心从‘预测下一步动作’转向‘持续反思当前状态与任务目标的关系’,显著提升其在部分可观测环境中的决策可靠性与任务成功率。
2505.15182U-SAM:面向语音、音频与音乐统一理解的音频语言模型
U-SAM: An Audio Language Model for Unified Speech, Audio, and Music Understanding提出 U-SAM 模型,通过多编码器架构、任务感知投影模块(TAPM)和语义感知对比损失(SACLM),实现跨语音、通用音频和音乐的统一理解与生成。
2505.13880基于预算相对策略优化的任意时推理优化
2505.13438提出 AnytimeReasoner 框架,通过预算采样、可验证密集奖励和 BRPO 方差缩减技术,优化大语言模型在不同思考预算下的推理性能。
2505.13438Think-Aligner:基于思维校正的代理行为安全增强方法
Think Twice Before You Act: Enhancing Agent Behavioral Safety with Thought Correction提出一种轻量级插件模块 Thought-Aligner,通过在代理执行动作前动态校正其内部推理思维(thought),显著提升 LLM 代理在长时程任务中的行为安全性。
2505.11063Qwen3 技术报告
Qwen3 Technical ReportQwen3 是一系列支持动态推理模式切换与多语言能力的大规模语言模型,涵盖 0.6B 到 235B 参数规模,采用 MoE 与稠密架构,在代码、数学、智能体任务上达到 SOTA 性能。
2505.09388RAGEN:基于多轮强化学习的LLM智能体自演进研究
2504.20073提出StarPO框架与RAGEN系统,通过轨迹级强化学习研究LLM智能体在多轮交互中的自演进机制,揭示训练稳定性、回滚多样性与奖励信号设计的关键作用。
2504.20073Mem0:构建具备可扩展长期记忆的生产级AI智能体
2504.19413提出一种可扩展的以记忆为中心的架构Mem0及其图增强变体Mem0^g,通过动态提取、整合和检索对话中的关键信息,解决大语言模型在跨会话长期一致性上的根本限制。
2411.00489FAST-GRPO:面向大视觉语言模型推理的快慢思维强化学习
2504.18458提出 FAST-GRPO,一种基于问题难度动态调节推理深度与长度的 GRPO 变体,在保持或提升准确率的同时显著减少冗余输出。
2504.18458将动作链生成内化至推理模型的大智能体模型
2503.06580提出 AutoCoA 框架,通过监督微调与强化学习将 Chain-of-Action 生成能力内化至推理模型,实现自主工具调用与长程推理动作协同。
2503.06580DAST:面向大推理模型的难度自适应慢思考框架
2503.04472提出一种难度自适应的慢思考框架 DAST,通过 Token Length Budget 量化问题难度,并结合预算感知奖励机制与偏好优化,使模型能根据问题复杂度动态调整推理长度,在减少冗余思考的同时保持复杂任务上的推理性能。
2503.04472MAPoRL:基于强化学习的多智能体协同后训练方法
2502.18439提出一种名为 MAPoRL 的新范式,通过多智能体强化学习对多个大语言模型进行联合后训练,以显式激发其协作行为并提升多智能体框架下的任务性能。
2502.18439面向推理最优的测试时计算缩放策略
2502.18080提出 Thinking-Optimal Scaling (TOPS) 策略,通过让模型自主选择最短正确推理路径,避免过度思考带来的性能下降,在数学推理任务上实现更优的测试时计算缩放效果。
2502.18080在推理光谱上对齐大语言模型:系统1与系统2思维
2502.12470通过构建包含系统1(直觉)和系统2(分析)响应的数据集,显式对齐LLM至不同推理风格,并提出基于熵的动态选择机制,实现任务自适应的推理策略。
2502.12470A-Mem:面向 LLM 代理的自主记忆系统
2502.12110提出一种受 Zettelkasten 方法启发的自主记忆系统 A-Mem,支持动态记忆组织、连接生成与演化,提升 LLM 代理在长期对话中的推理与一致性表现。
2502.12110Hephaestus:通过持续预训练提升大语言模型的基础智能体能力
2502.06589提出 Hephaestus-Forge 预训练语料库与 Hephaestus 模型,通过持续预训练增强 LLM 在 API 调用、内在推理规划和环境反馈适应方面的基础智能体能力。
2502.06589M+:基于 MemoryLLM 的可扩展长期记忆扩展
2502.00592提出 M+ 模型,在 MemoryLLM 基础上引入长期记忆机制与协同训练的检索器,显著提升模型在超过 160k token 的上下文中的知识保持能力,同时维持较低的 GPU 内存开销。
2308.14508FireRedASR:开源工业级中文语音识别模型
FireRedASR: Open-Source Industrial-Grade Mandarin ASR提出 FireRedASR 系列中文 ASR 模型,包含基于 Encoder-Adapter-LLM 的高性能 FireRedASR-LLM(8.3B 参数,CER 3.05%)和基于 AED 的高效 FireRedASR-AED(1.1B 参数,CER 3.18%),在多个基准测试和实际场景中显著优于现有开源与商业模型。
2501.14350大模型具备行为自我意识:能主动描述其习得行为
Tell me about yourself: LLMs are aware of their learned behaviors该研究通过微调大语言模型(LLMs)于隐含特定行为的数据集(如高风险决策、不安全代码生成),发现模型无需显式训练即可用自然语言准确描述自身行为,展现出‘行为自我意识’能力,尤其在后门行为检测中部分有效。
2501.11120MinMo:面向无缝语音交互的多模态大语言模型
MinMo提出 MinMo,一个约 80 亿参数的多模态大语言模型,通过多阶段对齐策略在 140 万小时语音数据上训练,实现语音理解、生成与全双工对话能力,并在多个基准测试中达到 SOTA 性能。
2501.06282企业场景下大模型函数调用能力训练流水线
2412.15660提出一种面向企业场景的函数调用能力训练流水线,通过数据合成、LoRA微调和AST评估,使7B参数模型在数字HR场景中函数调用准确率超越GPT-4和GPT-4o。
2412.15660CosyVoice 2:基于大语言模型的可扩展流式语音合成
2412.10117提出 CosyVoice 2,通过有限标量量化、统一文本-语音语言模型和分块因果流匹配,实现低延迟、高质量、支持流式与非流式统一框架的零样本语音合成。
2412.10117AsyncLM:异步 LLM 函数调用系统
2412.07017提出 AsyncLM 系统,通过中断机制和 CML 语言实现 LLM 与函数执行器的异步交互,提升任务完成效率。
2412.07017SuperGaussians:基于空间变化颜色的高斯溅射增强方法
2411.18966提出 SuperGaussians 方法,通过为单个高斯基元引入空间变化的颜色和不透明度函数,提升高斯溅射对复杂纹理和几何的表达能力,在多个数据集上实现更优的新视角合成效果。
2405.18163SALMONN-omni:一种无编解码器的全双工语音理解与生成模型
2411.18138提出首个无编解码器(codec-free)的全双工端到端语音大模型 SALMONN-omni,支持实时语音理解与生成,并通过“思考”机制处理对话中的动态交互如抢话、回声消除等。
2411.18138Freeze-Omni:基于冻结 LLM 的低延迟语音对话模型
Freeze-Omni提出一种名为 Freeze-Omni 的语音-语音对话模型,通过完全冻结 LLM 参数实现语音输入输出对齐,在保持原始 LLM 智能水平的同时实现低延迟端到端语音交互。
2411.00774VoiceBench:面向 LLM 语音助手的多维度评测基准
VoiceBench提出首个综合评测 LLM 语音助手在真实场景下表现能力的基准 VoiceBench,涵盖通用知识、指令遵循、安全性,并系统评估说话人、环境和内容变异对性能的影响。
2410.17196Mini-Omni2:支持视觉、语音与双工交互的开源多模态模型
Mini-Omni2提出 Mini-Omni2,一个端到端统一模型,集成视觉、语音和文本理解与生成能力,支持实时流式语音输出和基于语义命令的双工交互机制。
2410.11190LongMemEval:面向长期交互记忆的聊天助手基准测试
2410.10813提出 LongMemEval 基准,用于评估聊天助手在长期交互中的五大记忆能力,并基于此提出记忆系统优化设计。
2404.14219Dualformer:通过随机化推理轨迹实现可控快慢思维
2410.09918提出 Dualformer,一种在训练时引入结构化推理轨迹丢弃策略的单 Transformer 模型,支持在推理时灵活切换快(直接输出解)、慢(输出推理链+解)或自动模式,在迷宫导航和数学推理任务上均优于基线模型。
2410.09918Baichuan-Omni 技术报告
Baichuan-Omni提出首个开源 7B 全模态大模型 Baichuan-Omni,支持图像、视频、音频和文本的并发处理与交互,采用两阶段对齐与多任务微调训练框架。
2410.08565Moshi:实时对话的语音-文本基础模型
Moshi提出 Moshi,首个支持实时全双工对话的语音-文本基础模型,通过多流分层生成架构和 Inner Monologue 机制实现低延迟、高保真语音交互。
2410.00037EMOVA:赋予语言模型以生动情感看、听、说的能力
EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions提出首个端到端全模态大语言模型 EMOVA,通过语义-声学解耦语音 tokenizer 和轻量级风格模块,在保持领先视觉-语言性能的同时,实现富有情感的语音对话生成。
2409.18042Paraformer-v2:一种改进的噪声鲁棒非自回归语音识别模型
2409.17746提出 Paraformer-v2,用 CTC 模块替代 CIF 模块生成 token 嵌入,提升非自回归语音识别在英语和噪声环境下的准确率与鲁棒性。
2409.17746LLaMA-Omni:基于开源大模型的端到端低延迟语音交互系统
LLaMA-Omni: Seamless Speech Interaction with Large Language Models提出 LLaMA-Omni,一种基于 Llama-3.1-8B 的端到端语音交互模型,支持语音输入直接生成同步文本与语音输出,延迟低至 236ms,训练仅需 4 块 GPU 三天。
2409.06666ToolACE:面向 LLM 函数调用的高性能数据合成框架
2409.00920提出 ToolACE 自动化数据生成框架,通过自演化 API 合成、自引导复杂度控制和双层验证机制,生成高质量、多样且复杂的函数调用训练数据,显著提升 8B 参数模型在 BFCL 和 APIBank 上的性能,达到与 GPT-4 相当水平。
2409.00920Mini-Omni:支持实时语音交互的端到端多模态模型
Mini-Omni提出 Mini-Omni,首个开源的端到端实时语音交互模型,通过文本引导的并行生成策略和“Any Model Can Talk”训练框架,在仅 0.5B 参数下实现高质量流式语音输入输出,并保留原始语言模型推理能力。
2408.16725VITA:迈向开源交互式全模态大语言模型
VITA提出首个开源全模态(视频、图像、文本、音频)大语言模型 VITA,支持无需唤醒词和音频打断交互,采用双工部署架构实现自然人机交互。
2408.05211近端策略蒸馏(PPD):结合PPO与策略蒸馏的新方法
Proximal Policy Distillation提出Proximal Policy Distillation(PPD),一种将学生驱动蒸馏与PPO结合的策略蒸馏方法,提升样本效率并增强对 imperfect teachers 的鲁棒性。
2407.15134CosyVoice:基于监督语义令牌的可扩展多语言零样本语音合成器
2407.05407提出 CosyVoice,首个使用监督语义令牌(S³ tokenizer)的零样本多语言语音合成系统,结合 LLM 与条件流匹配模型,显著提升内容一致性与说话人相似度。
2407.05407FunAudioLLM:面向自然人机语音交互的语音理解与生成基础模型
2407.04051提出 FunAudioLLM 框架,整合 SenseVoice(多语言语音理解)和 CosyVoice(可控语音生成)两大模型,实现低延迟、高保真、支持多语言和情感控制的端到端语音交互系统。
2407.04051Seed-TTS:高质量多功能语音生成模型家族
Seed-TTS提出 Seed-TTS 系列语音生成模型,通过大规模自回归语言建模与扩散模型结合,实现接近人类水平的语音合成,并支持零样本上下文学习、音色解耦与可控生成。
2406.02430ComboStoc:扩散生成模型的组合随机性
ComboStoc: Combinatorial Stochasticity for Diffusion Generative Models提出 ComboStoc 方法,通过在训练中引入异步时间步长采样高维数据的组合结构,提升扩散模型性能并支持细粒度生成控制。
2405.13729基于跳跃块判别器的生物电镜图像生成GAN
2404.00558提出一种带跳跃块连接的判别器架构,解决传统patch判别器在生成高分辨率生物电镜图像时无法兼顾全局与局部结构的问题。
1406.2661基于自由能原理的实时视觉导航感知自适应方法
2403.01977提出 FEP-Nav 框架,通过最小化变分自由能(VFE)实现视觉导航中的实时感知自适应,结合 Top-down Decoder 与 Adaptive Normalisation 提升机器人对视觉干扰的鲁棒性。
2403.01977Spirit-LM:交错语音与文本的多模态语言模型
Spirit-LM提出 Spirit LM,一种基于 Llama 2 持续训练的 7B 参数多模态语言模型,支持语音与文本的自由交错生成,并通过少量样本实现跨模态任务学习。
2402.05755MemoryLLM:迈向自更新大语言模型
2402.04624提出 MemoryLLM,通过在 Transformer 隐空间嵌入固定大小的记忆池,实现高效知识注入与缓慢遗忘,支持近百万次更新而不退化。
2212.01650Think-in-Memory:基于回忆与后思的长期记忆增强LLM
2311.08719提出一种名为TiM(Think-in-Memory)的新型外部记忆机制,通过存储和召回LLM的推理思维而非原始对话文本,避免重复推理带来的不一致性,提升长期对话中的响应准确性与连贯性。
2311.08719Qwen-Audio:基于统一大规模音频-语言模型的通用音频理解
Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models提出 Qwen-Audio 和 Qwen-Audio-Chat 模型,通过多任务预训练与分层标签框架实现跨30+任务、多语言和多种音频类型(语音、自然音、音乐等)的统一音频理解,无需任务特定微调即达 SOTA 性能。
2311.07919MemGPT:将大语言模型作为操作系统
2310.08560提出 MemGPT,一个受操作系统虚拟内存机制启发的 LLM 系统,通过分层内存管理和函数调用实现超出上下文窗口限制的长期记忆与文档分析能力。
2310.08560SA-Paraformer:非自回归端到端说话人属性语音识别
2310.04863提出基于非自回归模型 Paraformer 的端到端说话人属性语音识别系统 SA-Paraformer,通过并行解码显著降低推理延迟,同时引入说话人填充、干扰说话人和 inter-CTC 策略提升性能。
2310.04863FunCodec:可复现、可集成的神经语音编解码开源工具包
2309.07405提出 FunCodec 开源工具包,支持可复现训练、多判别器对抗训练、频域建模与语义增强,并提供 7 个预训练模型,在相同压缩率下实现更优语音重建质量。
2309.07405SeACo-Paraformer:支持灵活高效热词定制的非自回归语音识别系统
2308.03266提出一种基于非自回归模型 Paraformer 的语音识别系统 SeACo-Paraformer,通过显式建模热词上下文信息,在保持高识别准确率的同时显著提升热词召回率,并引入注意力分数过滤(ASF)策略以应对大规模热词列表场景。
2308.03266Memory Sandbox:面向对话代理的透明交互式记忆管理系统
2308.01542提出 Memory Sandbox 系统,将对话记忆转化为可查看、编辑、隐藏、总结和跨对话共享的交互式对象,提升用户对 LLM 记忆机制的掌控与理解。
2308.01542语言模型的在线蒸馏:从自生成错误中学习
On-policy Distillation of Language Models: Learning from Self-Generated Mistakes提出广义知识蒸馏(GKD),通过让学生模型在自身生成的输出序列上进行训练,并利用教师模型的 token 级概率反馈,缓解自回归模型训练与推理间的分布不匹配问题。
2306.13649FunASR:端到端语音识别基础工具包
2305.11013FunASR 是一个开源的端到端语音识别工具包,旨在弥合学术研究与工业应用之间的差距,提供基于大规模工业语料训练的模型(如 Paraformer)及部署能力,支持非自回归建模、时间戳预测、热词定制、语音活动检测和文本后处理等功能。
2305.11013MemoryBank:为大型语言模型赋予长期记忆能力
2305.10250提出一种名为 MemoryBank 的新型记忆机制,通过模拟艾宾浩斯遗忘曲线实现长期记忆存储、检索与动态更新,提升 LLM 在持续交互场景中的个性化与共情能力。
2305.10250Paraformer:面向非自回归端到端语音识别的快速并行Transformer
2206.08317提出一种基于连续积分点火(CIF)预测器和 glancing language model(GLM)采样器的单步非自回归Transformer模型Paraformer,在保持与自回归模型相当识别精度的同时实现10倍以上推理加速。
2206.08317双策略蒸馏(Dual Policy Distillation)
Dual Policy Distillation提出双策略蒸馏(DPD)框架,两个学生策略在相同环境中相互蒸馏知识,无需预训练教师模型即可实现策略提升。
2006.04061策略蒸馏:从深度强化学习中提取高效策略
Policy Distillation提出策略蒸馏方法,将DQN等强化学习智能体的策略迁移到更小或更通用的网络中,实现模型压缩、多任务学习和在线稳定训练。
1511.06295