Pesquisa mostra que envenenar modelos de IA open-weight custa menos de 100 dólares e leva 1 hora
This experiment shows how easy it is to poison an open-weight AI model for under $100Com apenas 10 exemplos adulterados, 100 dólares e uma hora de processamento, uma pesquisadora criou um backdoor funcional em um modelo open-weight sem alterar seu funcionamento visível. A tensão estrutural reside na falsa premissa de que modelos abertos são transparentes, quando na verdade não existem ferramentas tradicionais capazes de auditar a integridade dos seus pesos. Isso destrava portas para marcas de segurança e tecnologia intervirem diretamente na infraestrutura do ecossistema open-source.
articulações possíveis
- Empresa de cibersegurança → Lança uma ferramenta pública de 'vacinação' e verificação criptográfica de pesos para repositórios de modelos abertos.
- Plataforma de hospedagem de código → Injeta intencionalmente dados envenenados de teste em modelos populares e paga recompensas a desenvolvedores que detectarem a falha.
- Provedor de nuvem → Oferece um ambiente 'sandbox' gratuito que executa e testa o código gerado por IAs abertas antes que ele vá para a produção das empresas.