标签

210 个标签覆盖 275 个页面,用于按主题快速横向浏览。

rl 65

A Decomposition Perspective to Long-Context Reasoning for LLMsAgent Safety via RLAgent-R1: End-to-End RL for LLM AgentsAgenticQwen — Dual Data Flywheels for Small Agentic ModelsAgenticRecTune — Multi-Agent Recommendation System OptimizationAgent² RL-Bench: Agentic RL Post-TrainingAn Imperfect Verifier is Good Enough: Learning with Noisy RewardsAre Complicated Loss Functions Necessary for Teaching LLMs to Reason?Atari 2600Cascade RlCo-Evolving Policy Distillation (CoPD)Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement LearningCoEvolve: Training LLM Agents via Agent-Data Mutual EvolutionCOS-PLAY — Co-Evolving LLM Decision and Skill Bank AgentsDeep Q-NetworkDiffRODP-OPD: Differentially Private On-Policy DistillationFaithful GRPOGASP: Guided Asymmetric Self-Play For Coding LLMsGaussian GRPO (G2RPO)GRPOGRPO RL TrainingHorizon Length Training Study — arXiv 2605.02572Hybrid Distillation Policy OptimizationHybrid Policy Distillation for LLMsImitation LearningInteractive Imitation LearningLearning to Orchestrate Agents with the RL ConductorLightning OPD: Offline On-Policy DistillationLongCat-Flash-ThinkingLongCat-Flash-Thinking-2601ML-Agent: Autonomous ML via Reinforcement LearningNIM4-ASR: Efficient, Robust, Customizable Real-Time LLM-Based ASROmni-R1: 统一生成式多模态推理OmniJigsawOpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty TrajectoriesOPSDL: On-Policy Self-Distillation for Long-Context Language ModelsOutcome Rewards Do Not Guarantee Verifiable or Causally Important ReasoningPerception-Grounded Policy Optimization for VLMsPerlAD: Pseudo-simulation-based RL for E2E Autonomous DrivingPieceHint: Question Augmentation Framework for RLPolicy DistillationPolicy Split: Dual-Mode ExplorationPpoProcess Supervision of Confidence Margin for Calibrated LLM ReasoningRAGEN: Multi-Turn RL for LLM AgentsReinforcement Learning from Human FeedbackReinforcement-Aware Knowledge DistillationRelax: Async RL Engine for Omni-Modal Post-TrainingRethinking OPD: Phenomenology, Mechanism, and RecipeRL Post-Training Scaling Laws for LLMsRL-Guided Synthetic Data GenerationSample Routed Policy OptimizationSelf-Distillation Zero: Self-Revision Turns Binary Rewards into Dense SupervisionSelf-Distilled RLVR: On-Policy Distillation for RL with Verifiable RewardsSelf-Improving Pretraining: Using Post-Trained Models to Pretrain Better ModelsSelf-Play LimitationsStable Baselines3SUPERNOVA: 自然指令 RL 激发通用推理The Illusion of Certainty: Decoupling Capability and Calibration in OPDTIP: Token Importance in On-Policy DistillationTTVS: Test-Time Variational SynthesisV2A-DPO: Video-to-Audio Preference OptimizationVisually-Guided Policy Optimization for Multimodal ReasoningWaltzRL

training 64

Agent-Native Research Artifact (Ara)Agentic Harness Engineering (AHE)AgenticQwen — Dual Data Flywheels for Small Agentic ModelsAre Complicated Loss Functions Necessary for Teaching LLMs to Reason?Audio-AgentCascade RlCoEvolve: Training LLM Agents via Agent-Data Mutual EvolutionComposer 2COS-PLAY — Co-Evolving LLM Decision and Skill Bank AgentsDual Policy DistillationDynin-Omni: Diffusion-Based Omnimodal Foundation ModelEmoOmni: Emotional Understanding in Omni-LLMsEntropy Aware On Policy DistillationEven Less Is Even Better: Agentic/Reasoning/Coding LLMExposure BiasFree Process RewardsGeneralized Knowledge Distillation (GKD)Generalized On Policy DistillationGRPO RL TrainingHorizon Length Training Study — arXiv 2605.02572Hybrid Distillation Policy OptimizationImitation LearningInteractive Imitation LearningKnowledge DistillationLearning to Orchestrate Agents with the RL ConductorLLM-PRISM: GPU Faults & Silent Data CorruptionLongCat-FlashLongCat-Flash-OmniLongCat-Flash-ThinkingLongCat-Flash-Thinking-2601LongCat-ImageLongCat-NextLongCat-VideoM+: MemoryLLM 的可扩展长期记忆扩展MemoryLLM: 自更新大语言模型的潜在空间记忆MiniCPM-o 4.5Model DistillationMulti-Domain On-Policy DistillationMulti-Task LearningNegative Data Mining for Dense Retrieval at IKEANIM4-ASR: Efficient, Robust, Customizable Real-Time LLM-Based ASROn Policy DistillationOn Policy Prefix DistillationOn-Policy Self-Distillation for Reasoning CompressionOpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty TrajectoriesOPSDL: On-Policy Self-Distillation for Long-Context Language ModelsPpoProximal Policy DistillationQwen3 语音家族深度解析Qwen3.5-OmniReasonXL: Shifting LLM Reasoning Language Without Sacrificing PerformanceRecursive Multi-Agent Systems (RecursiveMAS)Reinforcement-Aware Knowledge DistillationRelax: Async RL Engine for Omni-Modal Post-TrainingRL Post-Training Scaling Laws for LLMsSample Routed Policy OptimizationSelf-Improving Pretraining: Using Post-Trained Models to Pretrain Better ModelsSilent Thought / FLAIR(潜在推理全双工对话)Stochastic KV Routing: Random Cross-Layer Attention for Depth-Wise Cache SharingStrong to Weak DistillationTurnGuideU-Mind: Real-Time Multimodal InteractionV2A-DPO: Video-to-Audio Preference OptimizationWhy Mean Pooling Works: Quantifying Second-Order Collapse in Text Embeddings

architecture 57

A-Mem: Zettelkasten 式自组织 Agent 记忆AriadneMem: 线团式终身记忆导航Audio-AgentAudioKV: KV Cache Eviction for Large Audio-Language ModelsAVID: Audio-Visual Inconsistency BenchmarkChain of Modality: Dynamic Orchestration in Omni-MLLMsComposer 2D-Mem: 双过程记忆系统DuplexCascadeDynin-Omni: Diffusion-Based Omnimodal Foundation ModelEAGLE (Speculative Decoding)EmoOmni: Emotional Understanding in Omni-LLMsEMOVALongCat-FlashLongCat-Flash-OmniLongCat-Flash-ThinkingLongCat-Flash-Thinking-2601LongCat-ImageLongCat-NextLongCat-VideoM+: MemoryLLM 的可扩展长期记忆扩展MemGPT: LLM 即操作系统Memori: LLM 无关的持久记忆层MemoryLLM: 自更新大语言模型的潜在空间记忆MGM-OmniMiniCPM-o 4.5Mixture of ExpertsModality Preference of Omni-Modal LLMsMulti-Token Prediction (MTP)Nemori: 认知启发的自适应记忆蒸馏框架NIM4-ASR: Efficient, Robust, Customizable Real-Time LLM-Based ASROmni-Modal LLMParaformer — Non-Autoregressive Parallel Transformer for ASRParaformer-v2 — Noise-Robust Multilingual NAR ASRQwen3Qwen3 语音家族深度解析Qwen3-ASRQwen3-OmniQwen3-TTSQwen3.5Qwen3.5-OmniRecursive Multi-Agent Systems (RecursiveMAS)Relax: Async RL Engine for Omni-Modal Post-TrainingSA-Paraformer — Speaker-Attributed Non-Autoregressive ASRSALMONN-omniSeACo-Paraformer — Non-Autoregressive ASR with Hotword CustomizationSenseVoice — Multi-Task Speech Understanding Foundation Modelshortcut-connected-moeSimpleMem: 高效语义压缩终身记忆Stochastic KV Routing: Random Cross-Layer Attention for Depth-Wise Cache SharingStream-OmniTachiom: Efficient Multivector Retrieval with Token-Aware ClusteringText2Mem: 统一记忆操作语言U-Mind: Real-Time Multimodal InteractionWhy Mean Pooling Works: Quantifying Second-Order Collapse in Text Embeddingszero-computation-experts全双工 Agent 融合架构(Duplex-Agent Integration)

distillation 52

Agentic Harness Engineering (AHE)Co-Evolving Policy Distillation (CoPD)DeepSeek R1 DistillationDP-OPD: Differentially Private On-Policy DistillationDual Policy DistillationEntropy Aware On Policy DistillationEx-OPDExposure BiasGeneralized Knowledge Distillation (GKD)Generalized On Policy DistillationHybrid Distillation Policy OptimizationHybrid Policy Distillation for LLMsKL Divergence in DistillationKnowledge DistillationLatent Agents — Internalized Multi-Agent Debate (IMAD)Lightning OPD: Offline On-Policy DistillationLLM Post-Training: A Unified View of Off-Policy and On-Policy LearningMixture-of-Layers Distillation with Stepwise Attention on Key InformationModel DistillationMulti-Domain On-Policy DistillationOn Policy DistillationOn Policy Distillation SurveyOn Policy Prefix DistillationOn Policy Self DistillationOn-Policy Distillation for Autonomous Vehicle Motion PlanningOn-Policy Distillation vs SFT 的优势与指标差距On-Policy Self-Distillation for Reasoning CompressionOPD 技术中 Student/Teacher 是否需要同一 TokenizerOPSDL: On-Policy Self-Distillation for Long-Context Language ModelsPer Token Kl ClippingPolicy DistillationProximal Policy DistillationQwen3 中的 On-Policy Distillation 做法Qwen3 技术要点总览Qwen3.5-OmniReasoning DistillationReinforcement-Aware Knowledge DistillationReopoldRethinking OPD: Phenomenology, Mechanism, and RecipeReverse KL DistillationSample Routed Policy OptimizationSelf-Distillation Zero: Self-Revision Turns Binary Rewards into Dense SupervisionSelf-Distilled RLVR: On-Policy Distillation for RL with Verifiable RewardsStrong to Weak DistillationTeacher Top-K Local Support MatchingThe Illusion of Certainty: Decoupling Capability and Calibration in OPDTIP: Token Importance in On-Policy DistillationToken Level Entropy AnalysisTVDFVideo OpdVoldX Opd

model 50

agent 50

A-Mem: Zettelkasten 式自组织 Agent 记忆Agent Memory System: LLM Agent 长期记忆系统总览Agent SafetyAgent Safety via RLAgent 供应链攻击Agent-Native Research Artifact (Ara)Agent-R1: End-to-End RL for LLM AgentsAgentAlignAgentic Code ReasoningAgentic Harness Engineering (AHE)Agentic Research IdeasAgentic WorkflowsAgenticRecTune — Multi-Agent Recommendation System OptimizationAgentPoisonAgent² RL-Bench: Agentic RL Post-TrainingAriadneMem: 线团式终身记忆导航Audio-AgentBeyond Human-Readable: Rethinking SE Conventions for AgentsClawGuard: Runtime Security for Tool-Augmented AgentsCoEvolve: Training LLM Agents via Agent-Data Mutual EvolutionD-Mem: 双过程记忆系统GASP: Guided Asymmetric Self-Play For Coding LLMsGenerative AgentsHyperMem: 超图记忆架构LightMem: 轻量级 Agent 记忆系统Mem0: AI Agent 的可扩展长期记忆层MemEvoBench: Memory Safety BenchmarkMemGPT: LLM 即操作系统Memori: LLM 无关的持久记忆层MemReader: 从被动到主动的记忆提取Mixture of AgentsML-Agent: Autonomous ML via Reinforcement LearningMulti-Agent CoordinationNemori: 认知启发的自适应记忆蒸馏框架PASK: 意图感知的主动 AgentPrompt InjectionRAGEN: Multi-Turn RL for LLM AgentsReaLM-Retrieve — Adaptive Retrieval for Large Reasoning ModelsReflexionRewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data AnalysisSAVeR: Self-Audited Verified ReasoningSelf-Evolving LLM Memory ExtractionSimpleMem: 高效语义压缩终身记忆Skill OrchestrationSkill-SD: Skill-Conditioned Self-DistillationText2Mem: 统一记忆操作语言Thought-AlignerVerificAgentYour Agent, Their Asset: A Real-World Safety Analysis of OpenClaw全双工 Agent 融合架构(Duplex-Agent Integration)

speech-model 47

reasoning 43

A Decomposition Perspective to Long-Context Reasoning for LLMsAgentic Code ReasoningAgentic World Modeling — Foundations, Capabilities, LawsAre Complicated Loss Functions Necessary for Teaching LLMs to Reason?Chain of ThoughtContextual Agentic Memory is a Memo, Not True MemoryDeepSeek R1 DistillationDo Vision-Language Models Truly Perform Vision Reasoning?Even Less Is Even Better: Agentic/Reasoning/Coding LLMLatent Agents — Internalized Multi-Agent Debate (IMAD)Learning to Orchestrate Agents with the RL ConductorLongCat-FlashLongCat-Flash-ThinkingLongCat-Flash-Thinking-2601LongCat-NextMixture-of-Layers Distillation with Stepwise Attention on Key InformationMultimodal Latent Reasoning via Predictive EmbeddingsOmni-R1: 统一生成式多模态推理On Policy Self DistillationOpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty TrajectoriesOut of Context ReasoningOutcome Rewards Do Not Guarantee Verifiable or Causally Important ReasoningProcess Supervision of Confidence Margin for Calibrated LLM ReasoningReaLM-Retrieve — Adaptive Retrieval for Large Reasoning ModelsReasoning DistillationReasonXL: Shifting LLM Reasoning Language Without Sacrificing PerformanceRecursive Multi-Agent Systems (RecursiveMAS)ReflexionReopoldRethinking OPD: Phenomenology, Mechanism, and RecipeSAVeR: Self-Audited Verified ReasoningSCOPE: Signal-Calibrated On-Policy Distillation EnhancementSilent Thought / FLAIR(潜在推理全双工对话)STaRSUPERNOVA: 自然指令 RL 激发通用推理SVSR: 多模态推理的自验证自修正Test-Time ScalingThe Expense of Seeing: Trustworthy Multimodal Reasoning Within Monolithic ParadigmThinking BudgetThought-AlignerTTVS: Test-Time Variational SynthesisVisually-Guided Policy Optimization for Multimodal Reasoningπ²: Structure-Originated Reasoning Data Improves Long-Context Reasoning

open-source 37

multimodal 36

alignment 30

on-policy 30

memory 27

inference 24

benchmark 22

safety 20

optimization 20

stub 19

streaming 17

end-to-end 16

long-term 16

grpo 13

tool-use 12

full-duplex 12

company 10

agentic-coding 9

behavioral-awareness 9

concept 9

evaluation 9

retrieval 7

codec 6

survey 6

multi-agent 6

fine-tuning 6

on-policy-distillation 6

speculative-decoding 5

diffusion 5

security 5

synthetic-data 5

rlhf 5

vision 5

reward-model 5

pretraining 5

dataset 5

embedding 5

inference-optimization 4

acceleration 4

rag 4

reinforcement-learning 4

post-training 4

audio 4

chain-of-thought 3

graph 3

coding 3

software-engineering 3

asr 3

long-context 3

self-play 3

process-reward 3

omni-modal 3

swe-agent 3

policy-optimization 3

voice-assistant 2

recommendation 2

orchestration 2

generation 2

efficiency 2

data-generation 2

data 2

data-quality 2

faithfulness 2

conversation 2

rlvr 2

information-theory 2

qwen 2

comparison 2

generative 2

self-distillation 2

autonomous-driving 2

multilingual 2

scaling-laws 2

multi-turn 2

self-reflection 2

knowledge 2

scaling 2

self-evolving 2

lab 1

tree-based 1

chatbot 1

ycombinator 1

markov-decision-process 1

supply-chain 1

api 1

automated 1

research 1

workflow 1

game-theory 1

self-awareness 1

frontend 1

signal-processing 1

robustness 1

omni 1

editing 1

understanding 1

rectified-flow 1

kv-cache 1

backdoor 1

scalable 1

runtime 1

indirect-prompt 1

adversarial 1

learning 1

calibration 1

data-laundering 1

llm-training 1

decomposition 1

cascaded 1

misalignment 1

self-learning 1

epistemology 1

dialogue 1

spatial-reasoning 1

reward-shaping 1

foundation 1

deepmind 1

simulation 1

hypergraph 1

noise 1

slm 1

lightweight 1

off-policy 1

gpu 1

hardware 1

silent-corruption 1

compression 1

information-bottleneck 1

react 1

extraction 1

theory-of-mind 1

metacognition 1

real-time 1

edge-deployment 1

mixture-of-experts 1

autonomous-ml 1

kyutai 1

moshi 1

coordination 1

latent 1

continuous 1

interleaved 1

visual-reasoning 1

self-supervised 1

video 1

gkd 1

analysis 1

rubrics 1

influence-function 1

oracle 1

pipeline 1

proactive 1

intent 1

vlm 1

perception 1

world-model 1

planning 1

robotics 1

data-augmentation 1

reward 1

exploration 1

dual-mode 1

ppo 1

entropy 1

unification 1

renyi-entropy 1

rkhs 1

starpo 1

paradigm 1

privacy 1

math-reasoning 1

model-editing 1

self-auditing 1

belief 1

moe 1

distributed 1

supercomputer 1

adaptive-weighting 1

dual-path 1

heterogeneous 1

skill-conditioned 1

decoding 1

natural-instructions 1

generalization 1

self-verification 1

self-rectification 1

context-management 1

dynamic 1

execution 1

prm 1

code-agent 1

trustworthiness 1

test-time 1

verification 1

latent-reasoning 1

depth-scaling 1

encoder 1

domain-adaptation 1

efficient-training 1

web 1

cross-document 1