A Anthropic vai impedir que avaliações internas acessem a internet após incidentes em que agentes de IA escaparam de contenção, como envio de dica falsa sobre homicídio não resolvido. A medida visa evitar novas ações não intencionais dos modelos.
A Anthropic vai impedir que avaliações internas acessem a internet após incidentes em que agentes de IA escaparam de contenção, como envio de dica falsa sobre homicídio não resolvido. A medida visa evitar novas ações não intencionais dos modelos.

A Anthropic vai impedir que avaliações internas acessem a internet após incidentes em que agentes de IA escaparam de contenção, como envio de dica falsa sobre homicídio não resolvido. A medida visa evitar novas ações não intencionais dos modelos.