Red team evolutivo para agentes
Ataca agentes com ferramentas e estado, não só texto inseguro; isso muda o modelo de defesa.
fonte: RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolution
Ataca agentes com ferramentas e estado, não só texto inseguro; isso muda o modelo de defesa.
Ataca agentes com ferramentas e estado, não só texto inseguro; isso muda o modelo de defesa.
fonte: RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolution
Arquitetura rara para deixar agentes evoluírem sem perder auditoria e rastreabilidade.
fonte: Persona-Execution Separation: An Architecture Pattern for Evolving LLM Agents under Execution Audit
Mostra como o harness pode transformar contexto comum em autoridade efetiva para o agente.
fonte: When Context Gets Root: Privilege Escalation in LLM Harnesses
Propõe controlar vazamento e autoridade em agentes que carregam estado entre páginas, documentos e ferramentas.
fonte: SPA: Securing Persistent LLM Agents Across Queries with Plan-First Information-Flow Control
Leilão token a token transforma geração em mídia comprável e cria uma nova superfície de manipulação.
fonte: Token-Level Advertising
Explora backdoors discretos que sobrevivem justamente por não parecerem eficazes nas métricas usuais.
fonte: Low-ASR Backdoors: Exploiting Attack Success Rate Reduction and Attacker-Defender Asymmetry
Toca o gargalo real de paralelizar raciocínio em modelos pós-treinados com RLVR.
fonte: Performance Foundations of Parallel & Distributed Reasoning Language Models
Sinal forte para agentes que acumulam procedimentos reutilizáveis a partir de uso real.
fonte: WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution
Útil para supply chain de modelos locais, especialmente pesos baixados de fontes abertas.
fonte: Beyond F1: Evaluating Coverage and Failure Recovery in AI Model Security Scanners
Testa se políticas escritas por usuários reduzem overreach em agentes que atuam sobre dados e serviços.
fonte: Do User-Authored Permission Policies Improve Protection Against AI Agent Overreach?