标签
210 个标签覆盖 275 个页面,用于按主题快速横向浏览。
rl 65
A Decomposition Perspective to Long-Context Reasoning for LLMsAgent Safety via RLAgent-R1: End-to-End RL for LLM AgentsAgenticQwen — Dual Data Flywheels for Small Agentic ModelsAgenticRecTune — Multi-Agent Recommendation System OptimizationAgent² RL-Bench: Agentic RL Post-TrainingAn Imperfect Verifier is Good Enough: Learning with Noisy RewardsAre Complicated Loss Functions Necessary for Teaching LLMs to Reason?Atari 2600Cascade RlCo-Evolving Policy Distillation (CoPD)Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement LearningCoEvolve: Training LLM Agents via Agent-Data Mutual EvolutionCOS-PLAY — Co-Evolving LLM Decision and Skill Bank AgentsDeep Q-NetworkDiffRODP-OPD: Differentially Private On-Policy DistillationFaithful GRPOGASP: Guided Asymmetric Self-Play For Coding LLMsGaussian GRPO (G2RPO)GRPOGRPO RL TrainingHorizon Length Training Study — arXiv 2605.02572Hybrid Distillation Policy OptimizationHybrid Policy Distillation for LLMsImitation LearningInteractive Imitation LearningLearning to Orchestrate Agents with the RL ConductorLightning OPD: Offline On-Policy DistillationLongCat-Flash-ThinkingLongCat-Flash-Thinking-2601ML-Agent: Autonomous ML via Reinforcement LearningNIM4-ASR: Efficient, Robust, Customizable Real-Time LLM-Based ASROmni-R1: 统一生成式多模态推理OmniJigsawOpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty TrajectoriesOPSDL: On-Policy Self-Distillation for Long-Context Language ModelsOutcome Rewards Do Not Guarantee Verifiable or Causally Important ReasoningPerception-Grounded Policy Optimization for VLMsPerlAD: Pseudo-simulation-based RL for E2E Autonomous DrivingPieceHint: Question Augmentation Framework for RLPolicy DistillationPolicy Split: Dual-Mode ExplorationPpoProcess Supervision of Confidence Margin for Calibrated LLM ReasoningRAGEN: Multi-Turn RL for LLM AgentsReinforcement Learning from Human FeedbackReinforcement-Aware Knowledge DistillationRelax: Async RL Engine for Omni-Modal Post-TrainingRethinking OPD: Phenomenology, Mechanism, and RecipeRL Post-Training Scaling Laws for LLMsRL-Guided Synthetic Data GenerationSample Routed Policy OptimizationSelf-Distillation Zero: Self-Revision Turns Binary Rewards into Dense SupervisionSelf-Distilled RLVR: On-Policy Distillation for RL with Verifiable RewardsSelf-Improving Pretraining: Using Post-Trained Models to Pretrain Better ModelsSelf-Play LimitationsStable Baselines3SUPERNOVA: 自然指令 RL 激发通用推理The Illusion of Certainty: Decoupling Capability and Calibration in OPDTIP: Token Importance in On-Policy DistillationTTVS: Test-Time Variational SynthesisV2A-DPO: Video-to-Audio Preference OptimizationVisually-Guided Policy Optimization for Multimodal ReasoningWaltzRL
training 64
Agent-Native Research Artifact (Ara)Agentic Harness Engineering (AHE)AgenticQwen — Dual Data Flywheels for Small Agentic ModelsAre Complicated Loss Functions Necessary for Teaching LLMs to Reason?Audio-AgentCascade RlCoEvolve: Training LLM Agents via Agent-Data Mutual EvolutionComposer 2COS-PLAY — Co-Evolving LLM Decision and Skill Bank AgentsDual Policy DistillationDynin-Omni: Diffusion-Based Omnimodal Foundation ModelEmoOmni: Emotional Understanding in Omni-LLMsEntropy Aware On Policy DistillationEven Less Is Even Better: Agentic/Reasoning/Coding LLMExposure BiasFree Process RewardsGeneralized Knowledge Distillation (GKD)Generalized On Policy DistillationGRPO RL TrainingHorizon Length Training Study — arXiv 2605.02572Hybrid Distillation Policy OptimizationImitation LearningInteractive Imitation LearningKnowledge DistillationLearning to Orchestrate Agents with the RL ConductorLLM-PRISM: GPU Faults & Silent Data CorruptionLongCat-FlashLongCat-Flash-OmniLongCat-Flash-ThinkingLongCat-Flash-Thinking-2601LongCat-ImageLongCat-NextLongCat-VideoM+: MemoryLLM 的可扩展长期记忆扩展MemoryLLM: 自更新大语言模型的潜在空间记忆MiniCPM-o 4.5Model DistillationMulti-Domain On-Policy DistillationMulti-Task LearningNegative Data Mining for Dense Retrieval at IKEANIM4-ASR: Efficient, Robust, Customizable Real-Time LLM-Based ASROn Policy DistillationOn Policy Prefix DistillationOn-Policy Self-Distillation for Reasoning CompressionOpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty TrajectoriesOPSDL: On-Policy Self-Distillation for Long-Context Language ModelsPpoProximal Policy DistillationQwen3 语音家族深度解析Qwen3.5-OmniReasonXL: Shifting LLM Reasoning Language Without Sacrificing PerformanceRecursive Multi-Agent Systems (RecursiveMAS)Reinforcement-Aware Knowledge DistillationRelax: Async RL Engine for Omni-Modal Post-TrainingRL Post-Training Scaling Laws for LLMsSample Routed Policy OptimizationSelf-Improving Pretraining: Using Post-Trained Models to Pretrain Better ModelsSilent Thought / FLAIR(潜在推理全双工对话)Stochastic KV Routing: Random Cross-Layer Attention for Depth-Wise Cache SharingStrong to Weak DistillationTurnGuideU-Mind: Real-Time Multimodal InteractionV2A-DPO: Video-to-Audio Preference OptimizationWhy Mean Pooling Works: Quantifying Second-Order Collapse in Text Embeddings
architecture 57
A-Mem: Zettelkasten 式自组织 Agent 记忆AriadneMem: 线团式终身记忆导航Audio-AgentAudioKV: KV Cache Eviction for Large Audio-Language ModelsAVID: Audio-Visual Inconsistency BenchmarkChain of Modality: Dynamic Orchestration in Omni-MLLMsComposer 2D-Mem: 双过程记忆系统DuplexCascadeDynin-Omni: Diffusion-Based Omnimodal Foundation ModelEAGLE (Speculative Decoding)EmoOmni: Emotional Understanding in Omni-LLMsEMOVALongCat-FlashLongCat-Flash-OmniLongCat-Flash-ThinkingLongCat-Flash-Thinking-2601LongCat-ImageLongCat-NextLongCat-VideoM+: MemoryLLM 的可扩展长期记忆扩展MemGPT: LLM 即操作系统Memori: LLM 无关的持久记忆层MemoryLLM: 自更新大语言模型的潜在空间记忆MGM-OmniMiniCPM-o 4.5Mixture of ExpertsModality Preference of Omni-Modal LLMsMulti-Token Prediction (MTP)Nemori: 认知启发的自适应记忆蒸馏框架NIM4-ASR: Efficient, Robust, Customizable Real-Time LLM-Based ASROmni-Modal LLMParaformer — Non-Autoregressive Parallel Transformer for ASRParaformer-v2 — Noise-Robust Multilingual NAR ASRQwen3Qwen3 语音家族深度解析Qwen3-ASRQwen3-OmniQwen3-TTSQwen3.5Qwen3.5-OmniRecursive Multi-Agent Systems (RecursiveMAS)Relax: Async RL Engine for Omni-Modal Post-TrainingSA-Paraformer — Speaker-Attributed Non-Autoregressive ASRSALMONN-omniSeACo-Paraformer — Non-Autoregressive ASR with Hotword CustomizationSenseVoice — Multi-Task Speech Understanding Foundation Modelshortcut-connected-moeSimpleMem: 高效语义压缩终身记忆Stochastic KV Routing: Random Cross-Layer Attention for Depth-Wise Cache SharingStream-OmniTachiom: Efficient Multivector Retrieval with Token-Aware ClusteringText2Mem: 统一记忆操作语言U-Mind: Real-Time Multimodal InteractionWhy Mean Pooling Works: Quantifying Second-Order Collapse in Text Embeddingszero-computation-experts全双工 Agent 融合架构(Duplex-Agent Integration)
distillation 52
Agentic Harness Engineering (AHE)Co-Evolving Policy Distillation (CoPD)DeepSeek R1 DistillationDP-OPD: Differentially Private On-Policy DistillationDual Policy DistillationEntropy Aware On Policy DistillationEx-OPDExposure BiasGeneralized Knowledge Distillation (GKD)Generalized On Policy DistillationHybrid Distillation Policy OptimizationHybrid Policy Distillation for LLMsKL Divergence in DistillationKnowledge DistillationLatent Agents — Internalized Multi-Agent Debate (IMAD)Lightning OPD: Offline On-Policy DistillationLLM Post-Training: A Unified View of Off-Policy and On-Policy LearningMixture-of-Layers Distillation with Stepwise Attention on Key InformationModel DistillationMulti-Domain On-Policy DistillationOn Policy DistillationOn Policy Distillation SurveyOn Policy Prefix DistillationOn Policy Self DistillationOn-Policy Distillation for Autonomous Vehicle Motion PlanningOn-Policy Distillation vs SFT 的优势与指标差距On-Policy Self-Distillation for Reasoning CompressionOPD 技术中 Student/Teacher 是否需要同一 TokenizerOPSDL: On-Policy Self-Distillation for Long-Context Language ModelsPer Token Kl ClippingPolicy DistillationProximal Policy DistillationQwen3 中的 On-Policy Distillation 做法Qwen3 技术要点总览Qwen3.5-OmniReasoning DistillationReinforcement-Aware Knowledge DistillationReopoldRethinking OPD: Phenomenology, Mechanism, and RecipeReverse KL DistillationSample Routed Policy OptimizationSelf-Distillation Zero: Self-Revision Turns Binary Rewards into Dense SupervisionSelf-Distilled RLVR: On-Policy Distillation for RL with Verifiable RewardsStrong to Weak DistillationTeacher Top-K Local Support MatchingThe Illusion of Certainty: Decoupling Capability and Calibration in OPDTIP: Token Importance in On-Policy DistillationToken Level Entropy AnalysisTVDFVideo OpdVoldX Opd
model 50
Agentic World Modeling — Foundations, Capabilities, LawsComposer 2CosyVoiceCosyVoice 2CosyVoice 3Diffusion Language ModelsDynin-Omni: Diffusion-Based Omnimodal Foundation ModelEmoOmni: Emotional Understanding in Omni-LLMsEMOVAFreeze-OmniFunASR — Fundamental End-to-End Speech Recognition ToolkitFunAudioLLM — Voice Understanding & Generation Foundation ModelsFunCodec — Neural Speech Codec ToolkitKimi K2LLaMA-OmniLongCat-FlashLongCat-Flash-OmniLongCat-Flash-ThinkingLongCat-Flash-Thinking-2601LongCat-ImageLongCat-NextLongCat-VideoM+: MemoryLLM 的可扩展长期记忆扩展MemoryLLM: 自更新大语言模型的潜在空间记忆MGM-OmniMiniCPM-o 4.5MinMoMixture of ExpertsMoshiNIM4-ASR: Efficient, Robust, Customizable Real-Time LLM-Based ASROmni-Modal LLMParaformer — Non-Autoregressive Parallel Transformer for ASRParaformer-v2 — Noise-Robust Multilingual NAR ASRQwen3Qwen3 语音家族深度解析Qwen3-ASRQwen3-OmniQwen3-TTSQwen3.5Qwen3.5-OmniSA-Paraformer — Speaker-Attributed Non-Autoregressive ASRSALMONN-omniSeACo-Paraformer — Non-Autoregressive ASR with Hotword CustomizationSeed Realtime VoiceSeed-TTSSeeduplexSenseVoice — Multi-Task Speech Understanding Foundation ModelSpeech-Omni-LiteStream-OmniU-Mind: Real-Time Multimodal Interaction
agent 50
A-Mem: Zettelkasten 式自组织 Agent 记忆Agent Memory System: LLM Agent 长期记忆系统总览Agent SafetyAgent Safety via RLAgent 供应链攻击Agent-Native Research Artifact (Ara)Agent-R1: End-to-End RL for LLM AgentsAgentAlignAgentic Code ReasoningAgentic Harness Engineering (AHE)Agentic Research IdeasAgentic WorkflowsAgenticRecTune — Multi-Agent Recommendation System OptimizationAgentPoisonAgent² RL-Bench: Agentic RL Post-TrainingAriadneMem: 线团式终身记忆导航Audio-AgentBeyond Human-Readable: Rethinking SE Conventions for AgentsClawGuard: Runtime Security for Tool-Augmented AgentsCoEvolve: Training LLM Agents via Agent-Data Mutual EvolutionD-Mem: 双过程记忆系统GASP: Guided Asymmetric Self-Play For Coding LLMsGenerative AgentsHyperMem: 超图记忆架构LightMem: 轻量级 Agent 记忆系统Mem0: AI Agent 的可扩展长期记忆层MemEvoBench: Memory Safety BenchmarkMemGPT: LLM 即操作系统Memori: LLM 无关的持久记忆层MemReader: 从被动到主动的记忆提取Mixture of AgentsML-Agent: Autonomous ML via Reinforcement LearningMulti-Agent CoordinationNemori: 认知启发的自适应记忆蒸馏框架PASK: 意图感知的主动 AgentPrompt InjectionRAGEN: Multi-Turn RL for LLM AgentsReaLM-Retrieve — Adaptive Retrieval for Large Reasoning ModelsReflexionRewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data AnalysisSAVeR: Self-Audited Verified ReasoningSelf-Evolving LLM Memory ExtractionSimpleMem: 高效语义压缩终身记忆Skill OrchestrationSkill-SD: Skill-Conditioned Self-DistillationText2Mem: 统一记忆操作语言Thought-AlignerVerificAgentYour Agent, Their Asset: A Real-World Safety Analysis of OpenClaw全双工 Agent 融合架构(Duplex-Agent Integration)
speech-model 47
ASR BenchmarksAudio-AgentAudioKV: KV Cache Eviction for Large Audio-Language ModelsCosyVoiceCosyVoice 2CosyVoice 3DiffRODuplexCascadeEMOVAFreeze-OmniFunASR — Fundamental End-to-End Speech Recognition ToolkitFunAudioLLM — Voice Understanding & Generation Foundation ModelsFunCodec — Neural Speech Codec ToolkitLLaMA-OmniLongCat-Flash-OmniMGM-OmniMiniCPM-o 4.5MinMoMoshiMoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language ModelsMTR-DuplexBenchNIM4-ASR: Efficient, Robust, Customizable Real-Time LLM-Based ASROmni Model Evolution OverviewOmni-Modal LLMParaformer — Non-Autoregressive Parallel Transformer for ASRParaformer-v2 — Noise-Robust Multilingual NAR ASRPrivacy-Preserving Full-Duplex Speech DialogueQwen3 语音家族深度解析Qwen3-ASRQwen3-OmniQwen3-TTSQwen3.5-OmniSA-Paraformer — Speaker-Attributed Non-Autoregressive ASRSALMONN-omniSeACo-Paraformer — Non-Autoregressive ASR with Hotword CustomizationSeed Realtime VoiceSeed-TTSSeeduplexSenseVoice — Multi-Task Speech Understanding Foundation ModelSilent Thought / FLAIR(潜在推理全双工对话)Speech LlmSpeech-Omni-LiteStream-OmniTurnGuideX Opd全双工语音模型(Full-Duplex Speech Model)声学前端与后端 ASR 的平衡(Audio Frontend-Backend Balance)
reasoning 43
A Decomposition Perspective to Long-Context Reasoning for LLMsAgentic Code ReasoningAgentic World Modeling — Foundations, Capabilities, LawsAre Complicated Loss Functions Necessary for Teaching LLMs to Reason?Chain of ThoughtContextual Agentic Memory is a Memo, Not True MemoryDeepSeek R1 DistillationDo Vision-Language Models Truly Perform Vision Reasoning?Even Less Is Even Better: Agentic/Reasoning/Coding LLMLatent Agents — Internalized Multi-Agent Debate (IMAD)Learning to Orchestrate Agents with the RL ConductorLongCat-FlashLongCat-Flash-ThinkingLongCat-Flash-Thinking-2601LongCat-NextMixture-of-Layers Distillation with Stepwise Attention on Key InformationMultimodal Latent Reasoning via Predictive EmbeddingsOmni-R1: 统一生成式多模态推理On Policy Self DistillationOpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty TrajectoriesOut of Context ReasoningOutcome Rewards Do Not Guarantee Verifiable or Causally Important ReasoningProcess Supervision of Confidence Margin for Calibrated LLM ReasoningReaLM-Retrieve — Adaptive Retrieval for Large Reasoning ModelsReasoning DistillationReasonXL: Shifting LLM Reasoning Language Without Sacrificing PerformanceRecursive Multi-Agent Systems (RecursiveMAS)ReflexionReopoldRethinking OPD: Phenomenology, Mechanism, and RecipeSAVeR: Self-Audited Verified ReasoningSCOPE: Signal-Calibrated On-Policy Distillation EnhancementSilent Thought / FLAIR(潜在推理全双工对话)STaRSUPERNOVA: 自然指令 RL 激发通用推理SVSR: 多模态推理的自验证自修正Test-Time ScalingThe Expense of Seeing: Trustworthy Multimodal Reasoning Within Monolithic ParadigmThinking BudgetThought-AlignerTTVS: Test-Time Variational SynthesisVisually-Guided Policy Optimization for Multimodal Reasoningπ²: Structure-Originated Reasoning Data Improves Long-Context Reasoning
open-source 37
Agentic CodingComposer 2CosyVoiceCosyVoice 2CosyVoice 3EMOVAFunASR — Fundamental End-to-End Speech Recognition ToolkitFunAudioLLM — Voice Understanding & Generation Foundation ModelsFunCodec — Neural Speech Codec ToolkitKimi K2LLaMA-OmniLongCat-FlashLongCat-Flash-OmniLongCat-Flash-ThinkingLongCat-Flash-Thinking-2601LongCat-ImageLongCat-NextLongCat-VideoMem0: AI Agent 的可扩展长期记忆层MiniCPM-o 4.5MoshiOpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty TrajectoriesParaformer — Non-Autoregressive Parallel Transformer for ASRParaformer-v2 — Noise-Robust Multilingual NAR ASRQwen3Qwen3-ASRQwen3-OmniQwen3-TTSQwen3.5SA-Paraformer — Speaker-Attributed Non-Autoregressive ASRSALMONN-omniSeACo-Paraformer — Non-Autoregressive ASR with Hotword CustomizationSenseVoice — Multi-Task Speech Understanding Foundation Modelshortcut-connected-moeStable Baselines3Stream-Omnizero-computation-experts
multimodal 36
AVID: Audio-Visual Inconsistency BenchmarkChain of Modality: Dynamic Orchestration in Omni-MLLMsDo Vision-Language Models Truly Perform Vision Reasoning?Dynin-Omni: Diffusion-Based Omnimodal Foundation ModelEmoOmni: Emotional Understanding in Omni-LLMsEMOVAGaussian GRPO (G2RPO)LongCat-Flash-OmniLongCat-ImageLongCat-NextLongCat-VideoMGM-OmniMinMoModality Preference of Omni-Modal LLMsMultimodal Latent Reasoning via Predictive EmbeddingsOmni Model Evolution OverviewOmni-Modal LLMOmni-R1: 统一生成式多模态推理OmniTrace: Generation-Time Attribution in Omni-Modal LLMsPseudo-Unification: 熵探测揭示多模态模型信息分歧Qwen3 语音家族深度解析Qwen3-OmniQwen3.5-OmniRelax: Async RL Engine for Omni-Modal Post-TrainingSpeech LlmSpeech-Omni-LiteStream-OmniSVSR: 多模态推理的自验证自修正The Expense of Seeing: Trustworthy Multimodal Reasoning Within Monolithic ParadigmU-Mind: Real-Time Multimodal InteractionV2A-DPO: Video-to-Audio Preference OptimizationVideo OpdVisual Enhanced Depth Scaling for Multimodal Latent ReasoningVisually-Guided Policy Optimization for Multimodal ReasoningVoldX Opd
alignment 30
Agent SafetyAgent Safety via RLAgentAlignAgentic World Modeling — Foundations, Capabilities, LawsAI Self-Awareness via Game TheoryAudioKV: KV Cache Eviction for Large Audio-Language ModelsBehavioral Self-AwarenessCascade RlChain of Modality: Dynamic Orchestration in Omni-MLLMsContextual Agentic Memory is a Memo, Not True MemoryDP-OPD: Differentially Private On-Policy DistillationEmergent MisalignmentEmoOmni: Emotional Understanding in Omni-LLMsEpistemologically-Informed LLM Self-LearningFrom Skill Text to Skill Structure: The SSL RepresentationLatent Agents — Internalized Multi-Agent Debate (IMAD)Learning to Orchestrate Agents with the RL ConductorLongCat-FlashLongCat-Flash-OmniMemEvoBench: Memory Safety BenchmarkMental Self-ModelingMiniCPM-o 4.5Modality Preference of Omni-Modal LLMsOmniTrace: Generation-Time Attribution in Omni-Modal LLMsPARM: Pipeline-Adapted Reward ModelReinforcement Learning from Human FeedbackSelf-Improving Pretraining: Using Post-Trained Models to Pretrain Better ModelsThe Illusion of Certainty: Decoupling Capability and Calibration in OPDV2A-DPO: Video-to-Audio Preference OptimizationWaltzRL
on-policy 30
Co-Evolving Policy Distillation (CoPD)DP-OPD: Differentially Private On-Policy DistillationEntropy Aware On Policy DistillationEx-OPDGeneralized Knowledge Distillation (GKD)Generalized On Policy DistillationHybrid Distillation Policy OptimizationHybrid Policy Distillation for LLMsLightning OPD: Offline On-Policy DistillationLLM Post-Training: A Unified View of Off-Policy and On-Policy LearningMulti-Domain On-Policy DistillationOn Policy DistillationOn Policy Distillation SurveyOn Policy Prefix DistillationOn Policy Self DistillationOn-Policy Self-Distillation for Reasoning CompressionOPSDL: On-Policy Self-Distillation for Long-Context Language ModelsQwen3.5-OmniReinforcement-Aware Knowledge DistillationReopoldRethinking OPD: Phenomenology, Mechanism, and RecipeSample Routed Policy OptimizationSelf-Distillation Zero: Self-Revision Turns Binary Rewards into Dense SupervisionSelf-Distilled RLVR: On-Policy Distillation for RL with Verifiable RewardsSelf-Improving Pretraining: Using Post-Trained Models to Pretrain Better ModelsThe Illusion of Certainty: Decoupling Capability and Calibration in OPDTIP: Token Importance in On-Policy DistillationVideo OpdVoldX Opd
memory 27
A-Mem: Zettelkasten 式自组织 Agent 记忆Agent Memory System: LLM Agent 长期记忆系统总览AgenticRecTune — Multi-Agent Recommendation System OptimizationAgentPoisonAriadneMem: 线团式终身记忆导航Complementary Learning SystemsD-Mem: 双过程记忆系统Generative AgentsHyperMem: 超图记忆架构LightMem: 轻量级 Agent 记忆系统LoCoMo: 长期对话记忆评测基准LongMemEval: 长期交互记忆评测基准M+: MemoryLLM 的可扩展长期记忆扩展Mem0: AI Agent 的可扩展长期记忆层MemEvoBench: Memory Safety BenchmarkMemGPT: LLM 即操作系统Memori: LLM 无关的持久记忆层MemoryLLM: 自更新大语言模型的潜在空间记忆MemReader: 从被动到主动的记忆提取Nemori: 认知启发的自适应记忆蒸馏框架PASK: 意图感知的主动 AgentROME / MEMITSelf-Evolving LLM Memory ExtractionSimpleMem: 高效语义压缩终身记忆Stochastic KV Routing: Random Cross-Layer Attention for Depth-Wise Cache SharingText2Mem: 统一记忆操作语言VerificAgent
inference 24
AudioKV: KV Cache Eviction for Large Audio-Language ModelsAudioKV: 音频大模型 KV Cache 驱逐Chain of Modality: Dynamic Orchestration in Omni-MLLMsComposer 2Diffusion Language ModelsEAGLE (Speculative Decoding)EAGLE-3LLM Inference OptimizationLongCat-FlashLongCat-Flash-OmniMiniCPM-o 4.5Mixture of AgentsMulti-Token Prediction (MTP)NIM4-ASR: Efficient, Robust, Customizable Real-Time LLM-Based ASROmniTrace: Generation-Time Attribution in Omni-Modal LLMsQwen3-ASRQwen3.5ReaLM-Retrieve — Adaptive Retrieval for Large Reasoning ModelsRecursive Multi-Agent Systems (RecursiveMAS)Stochastic KV Routing: Random Cross-Layer Attention for Depth-Wise Cache SharingTachiom: Efficient Multivector Retrieval with Token-Aware ClusteringTest-Time ScalingThinking BudgetU-Mind: Real-Time Multimodal Interaction
benchmark 22
Agent-Native Research Artifact (Ara)Agentic Harness Engineering (AHE)Agent² RL-Bench: Agentic RL Post-TrainingASR BenchmarksAtari 2600AVID: Audio-Visual Inconsistency BenchmarkContextual Agentic Memory is a Memo, Not True MemoryCursorBenchFrom Skill Text to Skill Structure: The SSL RepresentationHorizon Length Training Study — arXiv 2605.02572Learning to Orchestrate Agents with the RL ConductorLoCoMo: 长期对话记忆评测基准LongMemEval: 长期交互记忆评测基准MemEvoBench: Memory Safety BenchmarkMiniCPM-o 4.5Modality Preference of Omni-Modal LLMsMTR-DuplexBenchNegative Data Mining for Dense Retrieval at IKEAOmniTrace: Generation-Time Attribution in Omni-Modal LLMsOpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty TrajectoriesQwen3-ASRReaLM-Retrieve — Adaptive Retrieval for Large Reasoning Models
safety 20
Agent SafetyAgent Safety via RLAgentAlignAgentPoisonAI Self-Awareness via Game TheoryBackdoor AwarenessBehavioral Self-AwarenessContextual Agentic Memory is a Memo, Not True MemoryEmergent MisalignmentFrom Skill Text to Skill Structure: The SSL RepresentationIntrospectionMemEvoBench: Memory Safety BenchmarkPrivacy-Preserving Full-Duplex Speech DialoguePrompt InjectionSelf-Improving Pretraining: Using Post-Trained Models to Pretrain Better ModelsSituational AwarenessThought-AlignerVerificAgentWaltzRLYour Agent, Their Asset: A Real-World Safety Analysis of OpenClaw
optimization 20
AriadneMem: 线团式终身记忆导航Beyond Human-Readable: Rethinking SE Conventions for AgentsDeep Q-NetworkDiffROEAGLE (Speculative Decoding)GRPOHybrid Policy Distillation for LLMsKL Divergence in DistillationLightning OPD: Offline On-Policy DistillationMemori: LLM 无关的持久记忆层Multi-Token Prediction (MTP)Optimsyn: Influence-Guided Rubrics for Synthetic DataPer Token Kl ClippingPpoReverse KL Distillationshortcut-connected-moeSimpleMem: 高效语义压缩终身记忆Teacher Top-K Local Support MatchingToken Level Entropy Analysiszero-computation-experts
stub 19
Agent SafetyAgentic Research IdeasAgentic WorkflowsAgentPoisonASR BenchmarksComplementary Learning SystemsDiffusion Language ModelsEAGLE-3Generative AgentsLLM Inference OptimizationMixture of AgentsMulti-Agent CoordinationOmni Model Evolution OverviewPrompt InjectionQdrant Vector SearchReflexionROME / MEMITSkill OrchestrationTest-Time Scaling
streaming 17
CosyVoice 2DuplexCascadeFunASR — Fundamental End-to-End Speech Recognition ToolkitMGM-OmniMiniCPM-o 4.5NIM4-ASR: Efficient, Robust, Customizable Real-Time LLM-Based ASRPASK: 意图感知的主动 AgentPrivacy-Preserving Full-Duplex Speech DialogueQwen3-OmniQwen3-TTSSALMONN-omniSeACo-Paraformer — Non-Autoregressive ASR with Hotword CustomizationSilent Thought / FLAIR(潜在推理全双工对话)Stream-OmniTurnGuide全双工 Agent 融合架构(Duplex-Agent Integration)全双工语音模型(Full-Duplex Speech Model)
end-to-end 16
Agent-R1: End-to-End RL for LLM AgentsFreeze-OmniFunASR — Fundamental End-to-End Speech Recognition ToolkitFunAudioLLM — Voice Understanding & Generation Foundation ModelsLLaMA-OmniMoshiParaformer — Non-Autoregressive Parallel Transformer for ASRParaformer-v2 — Noise-Robust Multilingual NAR ASRPerlAD: Pseudo-simulation-based RL for E2E Autonomous DrivingPrivacy-Preserving Full-Duplex Speech DialogueSeed Realtime VoiceSeeduplexSenseVoice — Multi-Task Speech Understanding Foundation ModelSilent Thought / FLAIR(潜在推理全双工对话)TurnGuide全双工语音模型(Full-Duplex Speech Model)
long-term 16
A-Mem: Zettelkasten 式自组织 Agent 记忆Agent Memory System: LLM Agent 长期记忆系统总览AriadneMem: 线团式终身记忆导航D-Mem: 双过程记忆系统HyperMem: 超图记忆架构LightMem: 轻量级 Agent 记忆系统LoCoMo: 长期对话记忆评测基准LongMemEval: 长期交互记忆评测基准M+: MemoryLLM 的可扩展长期记忆扩展Mem0: AI Agent 的可扩展长期记忆层MemGPT: LLM 即操作系统Memori: LLM 无关的持久记忆层MemoryLLM: 自更新大语言模型的潜在空间记忆MemReader: 从被动到主动的记忆提取Nemori: 认知启发的自适应记忆蒸馏框架SimpleMem: 高效语义压缩终身记忆
grpo 13
A Decomposition Perspective to Long-Context Reasoning for LLMsAgent² RL-Bench: Agentic RL Post-TrainingAre Complicated Loss Functions Necessary for Teaching LLMs to Reason?Co-Evolving Policy Distillation (CoPD)Faithful GRPOFree Process RewardsGaussian GRPO (G2RPO)GRPOGRPO RL TrainingMemReader: 从被动到主动的记忆提取Sample Routed Policy OptimizationSelf-Distilled RLVR: On-Policy Distillation for RL with Verifiable RewardsTTVS: Test-Time Variational Synthesis
tool-use 12
Agent 供应链攻击Agentic CodingAgenticQwen — Dual Data Flywheels for Small Agentic ModelsAudio-AgentClawGuard: Runtime Security for Tool-Augmented AgentsFrom Skill Text to Skill Structure: The SSL RepresentationLongCat-Flash-ThinkingLongCat-Flash-Thinking-2601OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty TrajectoriesSkill OrchestrationText2Mem: 统一记忆操作语言全双工 Agent 融合架构(Duplex-Agent Integration)
full-duplex 12
DuplexCascadeMiniCPM-o 4.5MoshiMoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language ModelsMTR-DuplexBenchPrivacy-Preserving Full-Duplex Speech DialogueSALMONN-omniSeeduplexSilent Thought / FLAIR(潜在推理全双工对话)TurnGuide全双工 Agent 融合架构(Duplex-Agent Integration)全双工语音模型(Full-Duplex Speech Model)
company 10
agentic-coding 9
Agent-Native Research Artifact (Ara)Agentic Harness Engineering (AHE)Beyond Human-Readable: Rethinking SE Conventions for AgentsEven Less Is Even Better: Agentic/Reasoning/Coding LLMORACLE-SWERethinking Software Engineering for Agentic AISWE-AGILE: Dynamic Reasoning ContextSWE-HERO: 从无执行到有执行的 SWE Agent 训练SWE-Shepherd: PRMs for Code Agents
behavioral-awareness 9
concept 9
evaluation 9
retrieval 7
MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language ModelsNegative Data Mining for Dense Retrieval at IKEAQdrant Vector SearchRAG-Considerate PretrainingReaLM-Retrieve — Adaptive Retrieval for Large Reasoning ModelsTachiom: Efficient Multivector Retrieval with Token-Aware ClusteringWhy Mean Pooling Works: Quantifying Second-Order Collapse in Text Embeddings
codec 6
survey 6
multi-agent 6
fine-tuning 6
AgenticQwen — Dual Data Flywheels for Small Agentic ModelsCOS-PLAY — Co-Evolving LLM Decision and Skill Bank AgentsDP-OPD: Differentially Private On-Policy DistillationOPSDL: On-Policy Self-Distillation for Long-Context Language ModelsSelf-Distillation Zero: Self-Revision Turns Binary Rewards into Dense SupervisionSWE-HERO: 从无执行到有执行的 SWE Agent 训练