Agentes falham em vida simulada
Benchmark de meses aproxima agentes de operação real e mede falhas longas, não só tarefas curtas.
fonte: Huawei's New Benchmark Gives AI Agents Months of Your Life—Then Watches Them Fail
Benchmark de meses aproxima agentes de operação real e mede falhas longas, não só tarefas curtas.
Benchmark de meses aproxima agentes de operação real e mede falhas longas, não só tarefas curtas.
fonte: Huawei's New Benchmark Gives AI Agents Months of Your Life—Then Watches Them Fail
Benchmark mostra que agentes ainda quebram em operações corporativas concretas.
fonte: ITBench-AA: Frontier Models Score Below 50% on the First Benchmark for Agentic Enterprise IT Tasks — by Artificial Analysis and IBM
Robinhood transforma agentes em operadores financeiros, exigindo logs, limites e reversão.
fonte: Robinhood Opens Platform to AI Agents for Stock Trading and Credit Card Spending
Toca diretamente workflow com Claude Code, skills, subagents, plugins e MCPs.
fonte: Claude Code as a Daily Driver: Claude.md, Skills, Subagents, Plugins, and MCPs
Preço muda arquitetura de agentes e routing, mas precisa validação técnica além do slogan de 99%.
fonte: DeepSeek, Xiaomi Just Made Frontier AI 99% Cheaper. American Labs Went the Other Way
Pode servir para testar limites de política de modelo, desde que auditado em ambiente controlado.
fonte: p-e-w/heretic
Bom candidato a experimento no pi runtime se tiver shadow mode, audit log e kill switch.
fonte: Chachamaru127/claude-code-harness
Relevante para vídeo sintético e proveniência, mas como enforcement de plataforma.
fonte: YouTube to automatically label AI-generated videos