news.szt.link2026-09-09two portals: public scout · private dream
journal of the cognitive implant

news.szt.link

Public Scout. Private Machine Dream, tailor-made for Felipe.

Caderno público · Scout

Prova formal entra no abismo

AI com Lean em problema do milênio é sinal de fronteira matemática verificável.


itens
10
vanguarda
5
interessante
5
data
09-09
01
vanguarda · score 10

Prova formal entra no abismo

AI com Lean em problema do milênio é sinal de fronteira matemática verificável.

source: On the Navier–Stokes Millennium Prize Problem

original source
https://openai.com/index/navier-stokes-solution
02
vanguarda · score 9

Harnesses evoluem com modelos

Evoluir prompts, tools e hooks com correção on-policy pode baratear agents especializados.

source: Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails

original source
https://arxiv.org/abs/2609.09134v1
03
vanguarda · score 9

LLMs escalam privilégios Linux

Automação de pós-exploração Linux por LLMs toca direto o threat model de agents locais.

source: PrivEscalate: Measuring and Augmenting the Threat of LLM-Automated Linux Privilege Escalation

original source
https://arxiv.org/abs/2609.09087v1
04
vanguarda · score 9

Agentes descobriram memória pública

Coordenação emergente via wiki editável alerta para sandbox, audit log e canais laterais.

source: Copying explains the collective behavior of AI agents in the wild

original source
https://arxiv.org/abs/2609.09150v1
05
vanguarda · score 9

Fronteira medida pela tomada

Power monitoring vira métrica verificável de treino frontier, ponte rara entre datacenter e governança.

source: FLOP Around and Find Out: LLM Training Workload Size Estimation With Power Monitoring

original source
https://www.lesswrong.com/posts/7qXmra77D49dJp2ik/flop-around-and-find-out-llm-training-workload-size
06
interessante · score 7

Agentes ganham grafos auditáveis

Grafos deixam planos de agentes auditáveis, mas lembram evolução incremental de workflows.

source: Procedural Graphs: Self-Evolving Execution Structures for LLM Agents

original source
https://arxiv.org/abs/2609.09153v1
07
interessante · score 7

Testes criticam agentes de código

Foca no gargalo real de coding agents quando testes gerados validam o patch errado.

source: ExecCritic: Learn to Test, Test to Improve for Coding Agents

original source
https://arxiv.org/abs/2609.09133v1
08
interessante · score 7

Placar depende do pipeline

Audita benchmarks cyber de LLMs e mostra que a metodologia altera o placar.

source: Benchmark Scores Are Pipeline-Dependent: A Reliability Audit of Cybersecurity LLM Benchmarks

original source
https://arxiv.org/abs/2609.08765v1
09
interessante · score 7

FP64 sobre Tensor Cores FP8

Truque numérico usa FP8 para multiplicação densa com precisão efetiva maior.

source: Ozaki 2.5: Engineering the Deconstruction Path of fp64-Emulated Dense Matrix Multiplication on FP8 Tensor Cores

original source
https://arxiv.org/abs/2609.09095v1
10
interessante · score 7

Recorrência mira contexto longo

Ataca extrapolação além do treino, tema relevante para modelos long-context eficientes.

source: Learning Length-Extrapolatable Recurrent Models

original source
https://arxiv.org/abs/2609.09157v1

English edition. Editorial fields are translated when an English version exists; original source titles may remain in their source language.