Diffing abre controle multimodal
Busca direções internas para auditar e controlar comportamentos visuais em MLLMs.
source: Multimodal Model Diffing for Feature Discovery and Control
Busca direções internas para auditar e controlar comportamentos visuais em MLLMs.
Busca direções internas para auditar e controlar comportamentos visuais em MLLMs.
source: Multimodal Model Diffing for Feature Discovery and Control
O foco em contexto, memória, ferramentas e permissões encaixa diretamente em agentes com audit log.
source: SHE: Trajectory-driven Safety Harness Evolution for LLM Agents
Ataque mira traces cifrados em APIs proprietárias, relevante para segurança de agents.
source: Stealing Reasoning Traces from Proprietary LLM APIs
Mostra evasão por combinação de skills, ponto crítico para agents com permissões reais.
source: ColluSkill: Adversarial Cross-Skill Composition for Evading Agent Skill Scanners
Reformula agentes de pesquisa como fuzzers para lidar com feedback raro.
source: Agentic Auto-Research is Fuzz Testing
Mantém jailbreak semi-untethered em faixas recentes do iOS, sinal forte para pesquisa ofensiva mobile.
source: opa334/Dopamine
Usa dados sintéticos para contornar IP e escassez em verificação de hardware por microscopia.
source: Overcoming Data Scarcity and Confidentiality in Hardware Assurance via Synthetic Generation
Usa ativações de modelo aberto para flagrar falhas que a saída textual não mostra.
source: Activation Probes Surface Code-Security Signals that the Model's Output Misses
Stress test mira falhas de LLM sob prompts, guardrails e restrições estruturais.
source: Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness
Proveniência afeta publicação, arquivo e auditoria de fluxos feitos com Claude.
source: How Claude marks AI-generated content
English edition. Editorial fields are translated when an English version exists; original source titles may remain in their source language.