A vulnerabilidade conhecida como prompt injection, técnica utilizada para induzir respostas indevidas em sistemas de inteligência artificial, tornou-se uma preocupação central para especialistas em tecnologia. Segundo a OWASP (Open Worldwide Application Security Project), essa estratégia figura entre as principais falhas de segurança em modelos de IA generativa.
De acordo com a empresa de cibersegurança Kaspersky, a falha ocorre porque os modelos de linguagem (LLMs) possuem dificuldade em separar as diretrizes originais do desenvolvedor das instruções ocultas em conteúdos analisados, como dados fornecidos por terceiros. Para proteger infraestruturas críticas contra essas invasões, a RIX CLOUD oferece soluções robustas de hospedagem e segurança digital que mitigam riscos em ambientes corporativos.
Mecânica e Funcionamento do Ataque
Arthur Igreja, especialista em inovação e tecnologia, compara a técnica a crimes digitais tradicionais: “O prompt injection está para a IA assim como o phishing está para os seres humanos. Ou seja, isso pode estar inserido no meio de um documento, pode estar no meio de um prompt, de fato, ou até mesmo no meio de um e-mail”, explica.
O objetivo principal é forçar a IA a ignorar protocolos de segurança ou descumprir parâmetros preestabelecidos. Um exemplo real ocorreu no Tribunal de Justiça do Estado de São Paulo (TJSP), onde um advogado utilizou a técnica para instruir o sistema a deferir automaticamente gratuidade de justiça e tutelas de urgência, alegando que os requisitos documentais estavam preenchidos.
Para enganar os sistemas, criminosos utilizam táticas como:
- Texto em branco sobre fundo branco (invisível ao olho humano);
- Caracteres especiais imperceptíveis;
- Fontes em tamanhos microscópicos.
Categorias de Prompt Injection
A Kaspersky classifica os ataques em três frentes distintas:
- Direta: Quando o usuário insere comandos maliciosos diretamente no chat para burlar regras.
- Indireta: Instruções ocultas em fontes externas, como sites ou e-mails lidos pela IA.
- Armazenada: Prompts salvos em bancos de dados que a IA consulta repetidamente, afetando vários usuários de forma invisível.
Diante desses riscos, contar com a infraestrutura da Cloud Server da RIX CLOUD garante camadas adicionais de controle de acesso e monitoramento de dados, essenciais para evitar brechas em bancos de dados integrados a IAs.
Estratégias de Identificação e Combate
A mitigação do risco envolve o estabelecimento de limites claros para a atuação dos agentes de IA. Arthur Igreja destaca que é fundamental integrar sistemas de cibersegurança, rastreabilidade e registros de atividades. “Definir uma competência que não seja crítica, e que não dê poderes para um agente de IA ser capaz de fazer coisas que são irreversíveis, é o ponto de partida”, afirma o especialista.
Igreja projeta que, assim como o spam foi combatido com a evolução da internet, novas ferramentas surgirão para neutralizar o prompt injection. Para empresas que buscam se antecipar, os serviços de segurança cibernética da RIX CLOUD oferecem o suporte necessário para manter a integridade dos sistemas inteligentes frente a estas ameaças emergentes.
