Estou recebendo muitos spammers de IA ultimamente, e é demorado analisá-los.
Com o spammer atual que estou analisando, o texto está escrito em inglês perfeito, é uma VPN, o endereço de e-mail está no StopForumSpam e posso dizer que o conteúdo foi copiado/colado porque o caractere de hífen usado não existe em teclados. Tive que verificar tudo isso manualmente e ainda tenho vários outros para analisar esta manhã.
Pensando em outra ideia:
Quando uma postagem é salva, o Discourse poderia registrar dados extras em um campo JSONB nessa postagem:
- Endereço IP
- é_vpn? — uma consulta no maxmind para encontrar a organização e ver se é uma VPN (por exemplo, PacketHub S.A.)
- Uma consulta rápida para o endereço de e-mail no StopForumSpam
- Uma comparação do número de caracteres de saída no editor versus o número de caracteres que produzem saída digitados (excluindo teclas de seta, ctrl, etc.). Por exemplo, o usuário gerou 1.000 caracteres no conteúdo bruto, mas pressionou teclas que produzem saída apenas 10 vezes (sugerindo que o conteúdo foi colado e o usuário pode ter editado uma palavra).
- Número de vezes que o conteúdo foi copiado ou cortado usando atalhos de teclado ou clique com o botão direito.
- Número de vezes que o conteúdo foi colado usando atalhos de teclado ou clique com o botão direito. A diferença nos números de cópia/colagem forneceria outra pista.
Os moderadores poderiam visualizar esses dados nas postagens em uma pequena tabela. Valores incomuns poderiam ser destacados para que postagens suspeitas se destacassem.
Provavelmente não há um método perfeito para automatizar a detecção, mas ter mais informações aceleraria o processo de moderação.