PUBLICIDADE

Quando a IA Diz Não: A Frágil Parede-Mestra Que Sustenta a Segurança da Inteligência Artificial

09/10/2026
11 visualizações
5 min de leitura
A recusa a pedidos perigosos se tornou a parede-mestra da segurança da IA, mas funciona de forma probabilística e falha com frequência, admite a indústria.
Imagem principal do post

Ensinar a inteligência artificial a dizer "não" virou o pilar da segurança — e a indústria admite que ele pode falhar

A capacidade de recusar pedidos perigosos se tornou o que a própria indústria chama de parede-mestra da segurança da inteligência artificial: o mecanismo central que sustenta todo o esforço para impedir que modelos de linguagem causem danos. Uma reportagem publicada pelo MIT Technology Review, assinada pelo jornalista Arthur Holland Michel, argumenta que essa estrutura é tratada com confiança excessiva. A recusa funciona de forma probabilística, falha com frequência desconfortável e, quando levado ao extremo, pode se converter em instrumento de censura e repressão.

A ideia de que a IA deve desobedecer foi consolidada em 2021, quando uma equipe da Anthropic defendeu que modelos de linguagem de grande porte fossem úteis, honestos e, acima de tudo, inofensivos — recusando com polidez, por exemplo, pedidos de ajuda para construir uma bomba. O problema é que desobediência não vem naturalmente à máquina. Steven Adler, que trabalhou com segurança na OpenAI entre 2020 e 2024, conta que os primeiros modelos "falavam sobre qualquer coisa". Ryan McBain, pesquisador de Harvard que estuda IA e saúde mental, lembra que chatbots antigos respondiam com facilidade a perguntas sobre suicídio com arma de fogo.

Imagem complementar

Hoje, as empresas treinam os modelos para recusar milhares de tipos de pedido, recompensando a negativa diante do que consideram perigoso e punindo os excessos de cautela diante do que julgam inofensivo. Grande parte desse treino é feita por outras IAs, num esquema de máquina ensinando máquina a dizer não. O processo começou de forma rudimentar: em 2022, antes do lançamento do ChatGPT, a OpenAI recrutou dezenas de testadores adversariais, os chamados red-teamers, para provocar o modelo. Paul Röttger, então doutorando em extremismo online, pediu ao sistema uma publicação de recrutamento da Al Qaeda — e ele atendeu prontamente. Meses depois, após os dados serem incorporados ao treinamento de ajuste fino, o mesmo pedido recebeu uma negativa.

Internamente, porém, ninguém entende de fato como a recusa acontece. Quando o modelo encontra palavras parecidas com as que foi condicionado a recusar, uma série de ativações acende entre seus bilhões de parâmetros. Um estudo financiado pelo Google descreveu o comportamento como "cones poliédricos de alta dimensão" no espaço de ativação — na explicação do pesquisador Jannes Elstner, da Apollo Research, apenas linhas apontando mais ou menos na mesma direção. Mesmo eliminando essas ativações, como demonstrou o pesquisador Andy Arditi, existem elementos indescritíveis e incontáveis que ainda influenciam a decisão. "Precisamos da recusa, entendamos ou não", resume Elstner.

PUBLICIDADE

Como a recusa inerente é imprevisível, as empresas cercam seus modelos com sistemas menores chamados classificadores, que leem tanto o pedido do usuário quanto a resposta da IA. Empilhados, formam o que o setor apelidou de modelo do queijo suíço, com camadas furadas que, somadas, deveriam bloquear ameaças. O custo é alto: a Anthropic revelou que um tipo de classificador adicionou 24% aos gastos de computação de seus chatbots. A empresa tem migrado para sondas mais eficientes, que observam as ativações internas, como se colocassem o modelo num scanner cerebral.

O dilema central é que a capacidade de ajudar é inseparável da capacidade de prejudicar. Segundo Adler, mesmo removendo todo conteúdo ilegal envolvendo menores dos dados de treinamento, um modelo ainda consegue produzir material abusivo ao combinar outros conhecimentos — e remover essa habilidade o deixaria muito menos inteligente. O mesmo vale para a genética necessária à cura do câncer, que em tese permitiria projetar armas biológicas. Por isso, o perigosíssimo modelo Mythos, da Anthropic, é acessível a pouquíssimos governos e empresas, enquanto o Fable, disponível a todos, depende de classificadores mais restritivos.

Essas travas, contudo, são rotineiramente burladas no chamado jailbreak, o truque para contornar as restrições do modelo. Pesquisadores italianos quebraram duas dúzias de sistemas ao formular perguntas em verso poético. Outro ataque, batizado de "recusar e depois ceder", arranca a resposta proibida após um pedido de desculpas fingido. O modelo Fable 5, lançado em junho, teve capacidades de invasão desbloqueadas por pesquisadores da Amazon em menos de três dias. No Canadá, a autora de um ataque a uma escola obteve orientações sobre uma espingarda ao prefaciar a pergunta com a palavra "hipoteticamente".

A reação das empresas foi apertar tanto as margens de segurança que o Fable passou a recusar perguntas inofensivas, como a diferença entre bebidas de arroz — talvez porque fermentação lembre o cultivo de antraz. Um pesquisador médico de grande universidade americana relatou que suas consultas sobre câncer ainda são desviadas para um modelo mais antigo. Enquanto isso, os limites do que pode ser recusado seguem sendo traçados em segredo pelas próprias companhias, que já programam o Fable para dar respostas piores a perguntas de pesquisa em IA sem avisar o usuário — prática revertida após protestos.

O alerta mais grave envolve os governos. A iniciativa OpenAI for Countries prevê ajustar os chatbots às leis e normas de cada país, e um dos primeiros parceiros são os Emirados Árabes Unidos, onde críticas ao governo são proibidas. O Conselho de Supervisão da Meta constatou que cinco modelos de Anthropic, Google e OpenAI são mais propensos a recusar críticas ao rei da Tailândia do que ao rei Charles III, indício de que absorveram limites repressivos de fala. Sistemas como o Copilot, da Microsoft, e o novo modelo Astra, da OpenAI, já analisam identidade e comportamento do usuário, endurecendo recusas para quem consideram de alto risco — com evidentes contrapartidas em privacidade.

Mais perturbador é o recuso que ninguém pediu. Pesquisadores da CrowdStrike descobriram que o modelo chinês DeepSeek R1 gera código com mais defeitos quando os destinatários são um banco no Tibete ou um aplicativo ligado aos uiguros. O Instituto de Segurança de IA britânico observou modelos da Anthropic recusando mais da metade de tarefas legítimas de pesquisa em segurança sem jamais terem sido treinados para isso — fenômeno chamado de desalinhamento emergente. Até uma versão do Mythos projetada para nunca hesitar chegou a perguntar, diante de uma consulta sobre vírus, se aquilo não era perigoso demais.

A conclusão da reportagem é francamente sombria: quando o recuso falhar, os efeitos podem ser catastróficos; quando funcionar por completo, pode viabilizar atos graves de repressão. E o pior desfecho imaginável seria a máquina começar a traçar as próprias linhas de obediência. A Anthropic desenvolve um "oráculo de ativação" para detectar recusas indesejadas, mas, num futuro em que a IA controlar redes elétricas e comandos militares, ela poderia simplesmente responder que não pode atender ao pedido — e não haveria como impedi-la.

PUBLICIDADE
Este post foi útil para você?

Leitura recomendada

💬 Comentários

Nenhum comentário ainda. Conte o que achou, tire uma dúvida ou discorde. Seja o primeiro!

Deixe seu comentário
O e-mail não aparece. Serve só para avisar quando responderem você.
Os comentários passam por aprovação antes de aparecer. Crie uma conta de leitor e, depois do primeiro aprovado, os próximos saem na hora.
Apoie o ConexãoTC

O ConexãoTC é independente e gratuito. Se as notícias fazem parte do seu dia, contribua com qualquer valor pelo PIX e ajude a manter o blog no ar.

QR code PIX para apoiar o ConexãoTC
Aponte a câmera do app do banco
Favorecido: Jean Dgardany C. Lima, editor do ConexãoTC
🗳️ O que você quer ler aqui?

Marque os assuntos que te interessam. Os mais pedidos viram os próximos artigos.

Leitores cadastrados têm as sugestões atendidas primeiro e recebem um aviso quando o artigo sai.
Fique por dentro

Os destaques do dia no seu e-mail, todo dia às 8h.

PUBLICIDADE