Como extrair o texto puro de um DOCX
Extrair o texto de um DOCX sem abrir o Word é a base de qualquer automação com documentos: indexar currículos, alimentar buscadores, analisar contratos em lote. O serviço descarta a formatação e devolve só o conteúdo, em texto puro, na ordem em que aparece no documento original.
Rode online
Rode nos nossos servidores com a sua conta. As ferramentas grátis rodam no seu navegador; esta aqui é descontada do seu saldo do KIT pelo preço acima.
Para que serve texto sem formatação
Sistemas não leem negrito — leem caracteres. Quando o objetivo é buscar, classificar, comparar ou alimentar um modelo de linguagem, a formatação do Word é ruído: o que importa é o conteúdo em estado bruto. A extração entrega exatamente isso: os parágrafos do documento em texto puro, sem estilos, sem marcação, prontos para entrar em um índice de busca, um banco de dados ou um pipeline de análise.
O que vem na extração
O corpo do documento sai completo e em ordem: parágrafos, títulos (como texto), listas e o conteúdo das tabelas, linearizado linha a linha. Imagens e elementos gráficos ficam de fora — texto puro é texto puro. Para a maioria dos usos (indexação, análise, migração), isso é precisamente o desejado: nada de limpar HTML nem lutar com estilos herdados de dez edições.
Um documento por chamada, milhares por noite
O desenho é para escala: cada chamada processa um DOCX e devolve o texto, e o seu sistema encadeia quantas precisar. Uma rotina noturna extrai o conteúdo de todos os documentos recebidos no dia — currículos, propostas, atas — e de manhã a base de busca está atualizada. Sem Office instalado em servidor, sem macro frágil, sem abrir arquivo por arquivo.
Quanto custa e quando abre
O preço publicado: US$ 0,052 por chamada mais US$ 0,003 por documento — cada extração fecha em US$ 0,055. Processar os 300 currículos de uma vaga concorrida custa US$ 16,50. Limites: 25 MB e 200 páginas por arquivo. Ponto de honestidade: a capacidade está em implantação e ainda não aceita execuções; publicar o preço antes é proposital, para você orçar a integração sem surpresa.
Casos de uso
Currículos pesquisáveis no sistema do RH
O RH de uma rede varejista recebe centenas de currículos em DOCX por vaga. A extração noturna joga o texto de cada um no índice de busca interno: a recrutadora digita “Excel avançado Recife” e encontra os candidatos na hora.
Contratos analisados em lote pelo jurídico
O jurídico de uma construtora extrai o texto de 400 contratos de fornecedores para localizar quais contêm cláusula de reajuste pelo IGP-M. Sem extração, seriam semanas de abrir arquivo por arquivo.
Migração de intranet sem copiar e colar
Uma cooperativa migra 2.000 documentos internos do formato Word para a nova base de conhecimento. A extração em massa entrega o conteúdo limpo, pronto para importação — a formatação antiga, que ninguém queria manter, fica para trás.
Atas alimentando um assistente de busca interna
Uma associação extrai o texto das atas de reunião dos últimos cinco anos para alimentar sua busca semântica interna. Perguntas como “quando aprovamos a reforma do telhado?” passam a ter resposta em segundos.
Perguntas frequentes
A extração preserva negrito, cores e estilos?
Não, e é de propósito: a saída é texto puro, sem formatação. Se você precisa do documento com visual, o caminho é outra ferramenta — esta existe para alimentar sistemas.
O conteúdo das tabelas do Word vem junto?
Vem, linearizado: o texto das células sai em sequência, linha a linha, integrado ao fluxo do documento.
Serve para processar currículos em massa?
É um dos usos mais comuns. Cada chamada extrai um documento; seu sistema encadeia o lote e monta a base pesquisável — 300 currículos custam US$ 16,50.
O texto sai na mesma ordem do documento?
Sim, na ordem de leitura: títulos, parágrafos, listas e tabelas aparecem na sequência em que estão no DOCX.
Currículos têm dado pessoal. Como vocês tratam isso?
O documento existe no serviço apenas durante o processamento e a retirada do resultado; depois é eliminado, sem cópia nem uso secundário. Tratamento aderente à LGPD.
Está funcionando agora ou ainda vai abrir?
Ainda vai abrir: a capacidade está em fase de implantação e não aceita execuções no momento. O preço publicado é o que valerá na estreia.
Para desenvolvedores — acesso via API
Tudo nesta página está disponível via API. Esta seção é para equipes que querem integrar a ferramenta aos próprios sistemas; quem não precisa disso pode simplesmente usar a ferramenta acima.
Endpoint
Autenticação por token Bearer. Um único POST coloca a tarefa na fila; o resultado chega por webhook ou link assinado.
Chame do seu código
curl -X POST https://api.kit.forhosting.com/doc/docx-to-text \
-H "Authorization: Bearer $KIT_KEY" \
-H "Content-Type: application/json" \
-d '{"input":"…"}'const res = await fetch("https://api.kit.forhosting.com/doc/docx-to-text", {
method: "POST",
headers: {
"Authorization": `Bearer ${process.env.KIT_KEY}`,
"Content-Type": "application/json"
},
body: JSON.stringify({
"input": "…"
})
});
const { task_id } = await res.json();import os, requests
res = requests.post(
"https://api.kit.forhosting.com/doc/docx-to-text",
headers={"Authorization": f"Bearer {os.environ['KIT_KEY']}"},
json={
"input": "…"
},
)
task_id = res.json()["task_id"]<?php
$res = file_get_contents("https://api.kit.forhosting.com/doc/docx-to-text", false, stream_context_create([
"http" => [
"method" => "POST",
"header" => "Authorization: Bearer " . getenv("KIT_KEY") . "\r\nContent-Type: application/json",
"content" => '{"input":"…"}',
],
]));
$task = json_decode($res, true);body := bytes.NewBufferString(`{"input":"…"}`)
req, _ := http.NewRequest("POST", "https://api.kit.forhosting.com/doc/docx-to-text", body)
req.Header.Set("Authorization", "Bearer "+os.Getenv("KIT_KEY"))
req.Header.Set("Content-Type", "application/json")
res, _ := http.DefaultClient.Do(req)Exemplo de requisição
{
"input": "…"
}Exemplo de resposta
{
"task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
"type": "doc.docx_to_text",
"status": "queued",
"_links": {
"result": "/tasks/tsk_…/result"
}
}A API é assíncrona: cada chamada devolve um task_id na hora. Se preferir polling, consulte o status a até 1 requisição por segundo.
Preço
Preço publicado, sem tokens nem créditos escondidos. Tarefa que falha não é cobrada.
Limites
max_mb | 25 |
max_pages | 200 |
Erros
| HTTP | Código | O que significa |
|---|---|---|
401 | unauthorized | Token ausente ou inválido. Confira o header Authorization. |
402 | insufficient_balance | Saldo insuficiente para esta tarefa. Faça uma recarga e tente de novo. |
404 | unknown_type | Esse tipo de tarefa não existe. Confira o campo type no catálogo. |
429 | rate_limited | Muitas requisições em pouco tempo. Espere um instante e tente de novo. |