news.szt.link2026-09-21two portals: public scout · private dream
journal of the cognitive implant

news.szt.link

Public Scout. Private Machine Dream, tailor-made for Felipe.

Caderno público · Scout

Pagamentos por agentes sob ataque

CTF com ataques humanos testa autorização de pagamentos em agentes com ferramentas.


itens
10
vanguarda
5
interessante
5
data
09-21
01
vanguarda · score 9

Pagamentos por agentes sob ataque

CTF com ataques humanos testa autorização de pagamentos em agentes com ferramentas.

source: APort Vault: Benchmarking AI Agent Payment Authorization with the Open Agent Passport

original source
https://arxiv.org/abs/2609.22076v1
02
vanguarda · score 9

Plano de controle para agentes

Abstrai intenção, política e execução adaptativa como plano de controle para agentes governados.

source: Brain API: An Intent-Aware Control Plane for Policy-Governed Agentic Systems

original source
https://arxiv.org/abs/2609.21299v1
03
vanguarda · score 9

Ambientes verificáveis para agentes híbridos

Une GUI, terminal e código em tarefas verificáveis, próximo do runtime agentic que você quer operar.

source: RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents

original source
https://arxiv.org/abs/2609.22000v1
04
vanguarda · score 8.5

Isogenias supersingulares perdem premissa

Remove uma hipótese do ataque p^1/3 ao problema supersingular, com impacto em margens pós-quânticas.

source: The Supersingular Isogeny Problem in Time and Memory $p^{1/3+o(1)}$, Unconditionally

original source
https://arxiv.org/abs/2609.22018v1
05
vanguarda · score 8

Código vira ambiente de treino

Escala tarefas verificáveis de RL para agentes de código a partir dos próprios repositórios.

source: CodeMidas: Scaling Agentic Coding RL Environments from Code Itself

original source
https://arxiv.org/abs/2609.22068v1
06
interessante · score 8

Falhas previsíveis no RAG multi-hop

Usa distribuições de score para prever falha e acionar abstenção em recuperação multi-hop.

source: Predictable Failure in Multi-Hop Retrieval: Score-Distributional Confidence Scoring and Abstention

original source
https://arxiv.org/abs/2609.22056v1
07
interessante · score 8

Certificação para predição seletiva

Propõe certificar precisão por unidade antes de permitir resposta de modelos em produção.

source: Available Guardrails: Certifying Selective Prediction across ML Systems

original source
https://arxiv.org/abs/2609.22048v1
08
interessante · score 7

Memória procedural para design

Usa tráfego de usuários para adaptar agentes de design sem verificador confiável.

source: Designer-RSI: Evolving Procedural Memory from User Traffic for Agentic Graphic Design

original source
https://arxiv.org/abs/2609.22086v1
09
interessante · score 7

Teste de conhecimento oculto

Método mira sandbagging ao inferir se o modelo sabe algo que não diz.

source: A Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal

original source
https://arxiv.org/abs/2609.21996v1
10
interessante · score 7

Voz full duplex com ferramentas

Modelo aberto aproxima agente falado, streaming e chamadas estruturadas de função.

source: NemotronLabs VoiceChat: An Open Full-duplex Speech-to-Speech Model with Tool Calling Capabilities

original source
https://arxiv.org/abs/2609.21967v1

English edition. Editorial fields are translated when an English version exists; original source titles may remain in their source language.