Agentes treinam seus próprios mundos
Self-play com ambientes executáveis ataca o gargalo de metas adaptativas para agentes.
fonte: SPADE: Self-Play in Adaptive Synthetic Executable Environments
Self-play com ambientes executáveis ataca o gargalo de metas adaptativas para agentes.
Self-play com ambientes executáveis ataca o gargalo de metas adaptativas para agentes.
fonte: SPADE: Self-Play in Adaptive Synthetic Executable Environments
Estados latentes fora do transcript são um ponto cego real para agentes auditáveis.
fonte: Beyond the Transcript: Detecting Covert Co ordination in Latent Multi-Agent Communication
Uma passada gera previsão e incerteza para séries irregulares, com bom encaixe em telemetria.
fonte: Lévy Attention: Single-Pass Predictive Uncertainty for Continuous-Time Attention
Resultado teórico forte leva Δ+1-edge coloring determinístico ao modelo com largura limitada.
fonte: A Fast Deterministic Algorithm for $(Δ+1)$-edge coloring in CONGEST
Replica pré-treinos quase idênticos para medir, não inferir, o efeito de uma única linha.
fonte: Learned, Then Lost: A Measured Single-Example Counterfactual in Pre-training
Sim-to-real visuotátil é forte, mas distante da stack prática do operador.
fonte: ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning
Defesa específica contra poisoning em LLM federado, sem acesso ao dado local.
fonte: FedLNS: Leverage LayerNorm Signature Modeling to Mitigate Adversarial Manipulation in Federated LLMs
Questiona se escrever código, treinar e avaliar basta para pós-treino feito por agentes.
fonte: What is Missing from AI Post-Training AI: An Empirical Analysis
Vale testar em runtime local se reduzir perda de qualidade nos modelos quantizados.
fonte: Unsloth Dynamic 3.0 GGUFs
Sinal forte para engenharia de inferência, mas ainda é consolidação de plataforma.
fonte: The Mojo language (by Modular, now Qualcomm) is now open-source