GRPO (групповая относительная оптимизация политики) от DeepSeek | Обучение с подкреплением для LLM15просмотровгод назад
Визуализация скрытого пространства: PCA, t-SNE, UMAP | Анимация для глубокого обучения16просмотровгод назад