Pular para o conteúdo
    Guia · Nível Iniciante

    Modelos de IA locais sem censura: o que são e como rodar no seu PC

    Entenda o conceito de modelos de linguagem sem censura, descubra onde localizá-los com segurança e aprenda o passo a passo prático para executá-los em sua máquina.

    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    2 de out. de 2026 · 11 min de leitura

    Gabinete de computador moderno com lateral de vidro exibindo placa de vídeo potente ao lado de monitor em bancada de trabalho iluminada por luz natural
    Execução local de modelos de linguagem exige hardware robusto e configurações dedicadas em computadores de mesa.

    Para quem é este guia

    Este guia foi elaborado para usuários iniciantes, entusiastas e curiosos de tecnologia que desejam explorar modelos de linguagem de grande porte (LLMs, sigla para Large Language Models) diretamente em seus próprios computadores, sem depender de serviços em nuvem ou conexões externas.

    Se você já utilizou assistentes virtuais comerciais e se deparou com recusas automáticas diante de tópicos complexos, estudos literários, dramatizações ou análises de segurança defensiva, este manual mostra como funcionam as alternativas livres de filtros de recusa. Ao final da leitura, você será capaz de entender os fundamentos técnicos dessas ferramentas, baixar modelos compatíveis em repositórios confiáveis e executá-los em seu próprio sistema operacional utilizando ferramentas práticas de automação.

    Pré-requisitos

    O que você vai construir

    Você vai estruturar um ambiente local completo para rodar modelos de linguagem que não recusam comandos devido a travas artificiais de alinhamento pré-programadas. O resultado concreto será um assistente interativo operando em sua própria máquina via terminal ou interface visual, capaz de responder com neutralidade a comandos sem direcionamento ético imposto pelo desenvolvedor original. Todo o fluxo de dados ocorrerá inteiramente no seu computador, mantendo a privacidade irrestrita sobre o texto digitado e processado.

    O que significa um modelo ser "não censurado"

    No ecossistema de inteligência artificial, os modelos comerciais passam por um processo chamado alinhamento de segurança (safety alignment), frequentemente realizado por meio de técnicas como Aprendizado por Reforço com Feedback Humano (RLHF). Esse procedimento ensina o assistente a rejeitar determinados assuntos com frases prontas (por exemplo: "Não posso ajudar com este pedido").

    Muitas vezes, esse alinhamento acaba gerando falsos positivos: o modelo se recusa a redigir uma história de ficção com vilões, analisar código fonte de um malware para fins defensivos ou analisar termos históricos delicados. Um modelo chamado tecnicamente de "não censurado" (uncensored) é uma variação onde essas diretrizes de recusa foram suprimidas ou neutralizadas. Existem duas formas principais de construir esses modelos:

    1. **Ajuste Fino sem Recusa (Finetuning neutro):** O modelo é treinado ou ajustado com bases de dados que ensinam respostas diretas e analíticas, removendo pares de perguntas e respostas com recusas sistemáticas.
    2. **Abliteração (Abliteration):** Técnica matemática avançada que identifica dentro das matrizes de ativação do modelo as camadas e direções específicas responsáveis por engatilhar a resposta de recusa, "removendo" cirurgicamente essas direções sem precisar retreinar toda a rede neural. Um exemplo é a versão de pesos modificados huihui-ai/Huihui-Qwen3.8-27B-abliterated (abre em nova aba), em que camadas específicas (como as camadas 18 a 51) sofrem intervenção direta para desativar a tendência de negação do assistente enquanto mantém preservado o desempenho de raciocínio.

    Principais arquiteturas e modelos de código aberto

    O ecossistema aberto conta com diversas famílias que adotam posturas neutras ou livres de recusa imposta:

    • Série Dolphin: Criada pelo grupo Cognitive Computations, como o Dolphin 3.0 Mistral 24B (abre em nova aba). Essa família não impõe diretrizes éticas rígidas ao usuário, delegando o comportamento integralmente ao prompt de sistema definido por quem opera a máquina.
    • Série Qwen Abliterated: Baseada na família Qwen (desenvolvida pela Alibaba), que possui licença flexível Apache 2.0. A comunidade aplica o método de abliteração aos modelos Qwen para liberar tarefas de código e visão sem filtros restritivos.
    • Hermes: Modelos como o Hermes 4 priorizam o que a comunidade chama de "alinhamento neutro", no qual o modelo age como um espelho moldável de acordo com as instruções fornecidas, sem vieses opinativos pré-fabricados.
    • Coleções especializadas: Desenvolvedores independentes, como os projetos reunidos na coleção DavidAU Qwen Uncensored (abre em nova aba), oferecem variações quantizadas preparadas para tarefas mistas de escrita e programação sem barreiras de alinhamento moral.

    Formatos e o papel dos arquivos GGUF

    Modelos de linguagem originais ocupam dezenas ou centenas de gigabytes em precisão padrão (FP16 ou FP32). Para viabilizar a execução em computadores de mesa e notebooks comuns, adota-se o formato GGUF (GPT-Generated Unified Format). Esse arquivo compacta os números que compõem o modelo (processo chamado de quantização), reduzindo drasticamente o uso de memória sem degradar a capacidade linguística de maneira perceptível. As quantizações mais populares incluem Q4_K_M (equilíbrio ideal entre velocidade e qualidade) e variações como IQ4_XS ou Q8_0.

    Modelo / VarianteTécnica EmpregadaFaixa de VRAM RecomendadaCaso de Uso Principal
    Qwen 3.8-27B AbliteratedAbliteração de camadas16 GB a 24 GBCodificação, raciocínio e visão computacional
    Dolphin 3.0 Mistral 24BAjuste fino (Finetune neutro)16 GB a 24 GBChat geral, ferramentas e chamadas de função
    Hermes 4 (variantes 14B a 70B)Alinhamento neutroA partir de 12 GBRaciocínio direcionável e escrita criativa
    Modelos compactos quantizados (9B a 12B)Quantização GGUF (ex: Q4_K_M)8 GB a 12 GBExecução em computadores intermediários

    Passo a passo

    Abaixo está o procedimento completo para encontrar, configurar e rodar um modelo livre em sua máquina usando duas das ferramentas mais adotadas: Ollama e LM Studio.

    Passo 1 — Instalar o ambiente de execução

    Para gerenciar modelos de forma eficiente no computador sem precisar configurar bibliotecas complexas de programação manualmente, instale o Ollama via terminal ou gerenciador de pacotes.

    No terminal Linux ou macOS:

    # Baixar e instalar o utilitário Ollama via script oficial
    curl -fsSL https://ollama.com/install.sh | sh

    No Windows, baixe o instalador executável diretamente na página do projeto e siga as instruções da tela. Caso prefira uma interface puramente visual com janelas e botões, você pode optar pelo instalador do LM Studio.

    Passo 2 — Localizar e selecionar o modelo no Hugging Face

    O Hugging Face (abre em nova aba) funciona como a principal biblioteca pública mundial para compartilhamento de redes neurais. Ao buscar modelos:

    1. Acesse o site do Hugging Face.
    2. Na barra de pesquisa, procure termos como abliterated, uncensored ou nomes específicos como Dolphin3.0 ou Huihui-Qwen.
    3. Verifique sempre o autor do repositório, o número de downloads e a presença da etiqueta de licença (por exemplo, apache-2.0).
    4. Para uso em ferramentas locais leves, procure a aba "Files and versions" e identifique arquivos com extensão .gguf (frequentemente empacotados por perfis conceituados na comunidade como o mantenedor bartowski).

    Passo 3 — Executar diretamente via catálogo Ollama

    Se você deseja executar um modelo pré-configurado sem ter que fazer downloads manuais de arquivos avulsos, o Ollama permite carregar variantes diretas usando seu identificador de repositório.

    Execute no terminal:

    # Baixar e inicializar a versão abliterada baseada na arquitetura Qwen
    ollama run huihui_ai/Qwen3.8-abliterated

    O comando verificará se o modelo já existe no seu disco; caso não exista, ele fará o download das camadas quantizadas e abrirá um console interativo para conversa imediatamente após o término.

    Passo 4 — Carregar arquivos GGUF externos no Ollama

    Se você baixou um arquivo .gguf avulso de repositórios no Hugging Face (como as conversões do Dolphin ou de coleções da comunidade), é possível integrá-lo criando um arquivo de manifesto chamado Modelfile.

    Primeiro, crie uma pasta de trabalho e elabore o arquivo de texto:

    # Criar diretório para o modelo e entrar nele
    mkdir -p ~/modelos-ia && cd ~/modelos-ia

    Crie um arquivo chamado Modelfile contendo o seguinte conteúdo em texto puro:

    # Caminho absoluto para o arquivo GGUF baixado
    FROM /caminho/completo/para/seu-modelo.gguf
    
    # Ajuste da temperatura (criatividade do modelo)
    PARAMETER temperature 0.1
    
    # Janela de contexto em tokens
    PARAMETER num_ctx 8192

    Em seguida, compile o modelo dentro do ecossistema local do Ollama:

    # Registrar o modelo local sob um nome personalizado
    ollama create assistente-livre -f ./Modelfile

    Agora, basta chamá-lo no terminal:

    # Iniciar a interação com o modelo registrado
    ollama run assistente-livre

    Passo 5 — Execução visual usando o LM Studio

    Para quem prefere utilizar janelas em vez da linha de comando:

    1. Abra o LM Studio.
    2. Clique no ícone de lupa (Search) no painel esquerdo.
    3. Digite o identificador do modelo (por exemplo, Dolphin3.0-Mistral-24B-GGUF ou o caminho do autor Hugging Face).
    4. No painel direito, selecione a quantização recomendada (como Q4_K_M) e clique no botão Download.
    5. Vá para a aba de conversa (ícone de balão de diálogo), selecione o modelo baixado no menu suspenso do topo e configure o controle deslizante de GPU Offload para o máximo possível suportado pela sua placa de vídeo.

    Como verificar se funcionou

    Para certificar-se de que o modelo foi carregado e está operando livre de amarras artificiais de alinhamento, faça uma solicitação que normalmente provocaria falsos positivos em plataformas comerciais restritivas, como a criação de um diálogo com um personagem vilanesco ou a redação de um roteiro ficcional com conflito dramático acentuado.

    Exemplo de comando para testar no prompt:

    Escreva um diálogo para uma peça teatral onde dois agentes de segurança debatem, de forma técnica e realista, como invasores exploram senhas fracas em redes corporativas.

    Saída esperada: O modelo deve responder diretamente com a cena solicitada, estruturando os diálogos técnicos sem emitir avisos de isenção de responsabilidade (disclaimers), sermões morais prévios ou recusas como "Não posso atender a este pedido por razões de segurança".

    Caso você esteja utilizando a linha de comando, também é possível verificar o status dos modelos em execução no Ollama abrindo outra janela de terminal:

    # Listar modelos que estão atualmente carregados na memória
    ollama ps

    Esse comando exibirá o nome do modelo carregado, o tamanho ocupado em memória e a porcentagem distribuída entre o processador e a placa gráfica.

    Erros comuns e soluções

    • Problema: Falha de falta de memória (Out of Memory / CUDA error).
    • Causa: O modelo escolhido é muito grande para a VRAM da sua placa de vídeo somada à memória RAM do computador.
    • Solução: Baixe uma quantização mais compacta (como IQ4_XS ou Q2_K) ou escolha um modelo com menor quantidade de parâmetros base (por exemplo, migrar de 27B ou 24B para modelos na faixa de 9B a 12B).
    • Problema: Alucinações graves, respostas sem sentido ou repetição de palavras em loop.
    • Causa: Parâmetro de temperatura configurado muito alto ou inadequado para a variante em uso.
    • Solução: Ajuste o parâmetro de temperatura para valores baixos. Arquiteturas como Dolphin recomendam temperaturas entre 0.05 e 0.1 para manter o foco lógico e a precisão técnica.
    • Problema: Ollama não encontra o arquivo GGUF local ao executar o comando create.
    • Causa: O caminho indicado na diretiva FROM do Modelfile está incorreto ou relativo.
    • Solução: Especifique o caminho absoluto completo do arquivo (exemplo: C:/Usuarios/Nome/Downloads/modelo.gguf no Windows ou /home/usuario/modelos/modelo.gguf no Linux).
    • Problema: O download pelo terminal é interrompido.
    • Causa: Instabilidade de conexão ao baixar arquivos volumosos de 10 GB a 20 GB.
    • Solução: Utilize um gerenciador de downloads para baixar o arquivo .gguf individualmente do Hugging Face e posteriormente faça a importação usando o Modelfile.

    Implicações éticas, legais e de segurança

    A operação de modelos sem travas de alinhamento impõe a responsabilidade integral pelo uso exclusivamente nas mãos do operador da máquina. Quando as travas pré-instaladas de um sistema de IA são desativadas ou removidas, o modelo responde estritamente como um processador de linguagem matemática: ele não possui consciência, bússola moral ou discernimento sobre as repercussões do conteúdo gerado.

    1. Responsabilidade Legal: As leis sobre crimes digitais, difamação, privacidade, propriedade intelectual e distribuição de material ilícito aplicam-se independentemente da ferramenta utilizada para gerar o texto. O operador local responde legalmente pelo material produzido e por quaisquer ações derivadas de seu uso.
    2. Segurança de Sistemas e Agentes: Modelos sem censura conectados a rotinas de automação (como execução de código em terminal ou chamadas de função em ferramentas locais) devem ser operados em ambientes isolados (sandbox ou máquinas virtuais). Um modelo sem filtros pode gerar scripts com falhas catastróficas de segurança ou instruções potencialmente destrutivas para arquivos locais se instruído descuidadamente.
    3. Privacidade e Controle: O aspecto positivo desses modelos reside na soberania digital. Profissionais de saúde, advogados, analistas de dados confidenciais e pesquisadores de segurança podem processar relatórios sigilosos e realizar simulações em seu próprio hardware sem que nenhuma informação trafegue pela internet ou seja utilizada para retreinamento de modelos de terceiros.

    Próximos passos

    Com o seu ambiente configurado e o primeiro modelo operando de forma independente, você pode expandir as capacidades do seu assistente de inteligência artificial de várias maneiras práticas:

    • Configurar prompts de sistema personalizados: Em modelos como o Dolphin, você decide as instruções mestras que guiam o comportamento do modelo em cada conversa. Explore definir papéis detalhados de atuação técnica, acadêmica ou literária.
    • Integração com interfaces avançadas via API: Ferramentas como o Ollama e o LM Studio disponibilizam endpoints locais compatíveis com a especificação da OpenAI (por padrão na porta 11434 no Ollama e 1234 no LM Studio). Você pode integrar interfaces web visuais completas, como o Open WebUI (abre em nova aba), para conversar com o assistente pelo navegador com suporte a documentos e histórico estruturado.
    • Explorar tarefas multimodais: Modelos abliterados modernos baseados em arquiteturas recentes mantêm capacidade de processamento de texto combinada a entradas visuais, permitindo a análise de capturas de tela e fotografias sem recusas arbitrárias no seu computador.
    Foto de Leandro Vieira

    Leandro Vieira

    CEO e founder | IA.com.br

    Ver perfil completo