Diffing abre controle multimodal
Busca direções internas para auditar e controlar comportamentos visuais em MLLMs.
fonte: Multimodal Model Diffing for Feature Discovery and Control
Busca direções internas para auditar e controlar comportamentos visuais em MLLMs.
Busca direções internas para auditar e controlar comportamentos visuais em MLLMs.
fonte: Multimodal Model Diffing for Feature Discovery and Control
O foco em contexto, memória, ferramentas e permissões encaixa diretamente em agentes com audit log.
fonte: SHE: Trajectory-driven Safety Harness Evolution for LLM Agents
Ataque mira traces cifrados em APIs proprietárias, relevante para segurança de agents.
fonte: Stealing Reasoning Traces from Proprietary LLM APIs
Mostra evasão por combinação de skills, ponto crítico para agents com permissões reais.
fonte: ColluSkill: Adversarial Cross-Skill Composition for Evading Agent Skill Scanners
Reformula agentes de pesquisa como fuzzers para lidar com feedback raro.
fonte: Agentic Auto-Research is Fuzz Testing
Mantém jailbreak semi-untethered em faixas recentes do iOS, sinal forte para pesquisa ofensiva mobile.
fonte: opa334/Dopamine
Usa dados sintéticos para contornar IP e escassez em verificação de hardware por microscopia.
fonte: Overcoming Data Scarcity and Confidentiality in Hardware Assurance via Synthetic Generation
Usa ativações de modelo aberto para flagrar falhas que a saída textual não mostra.
fonte: Activation Probes Surface Code-Security Signals that the Model's Output Misses
Stress test mira falhas de LLM sob prompts, guardrails e restrições estruturais.
fonte: Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness
Proveniência afeta publicação, arquivo e auditoria de fluxos feitos com Claude.
fonte: How Claude marks AI-generated content