DOM-PI 2025 — PDFs-fonte (Diário Oficial dos Municípios do Piauí)
PDFs originais das publicações de 2025 do Diário Oficial dos Municípios do Piauí, organizados por Território de Desenvolvimento. São a fonte da qual o corpus textual foi extraído por OCR/parsing. 41.617 PDFs · ~70 GB.
Dataset de texto derivado (carregável, com limpeza e tiers de qualidade):
gutoportelaa/dom-pi-corpus-2025.
Cobertura de PDFs (parcial): presentes 7 territórios —
tabuleiros_alto_parnaiba,carnaubais,vale_dos_rios_piaui_e_itaueiras,planice_litoran,entre_rios,vale_do_sambitoeteresina. Faltam os PDFs de 6 territórios (cocais,mangabeiras,serra_da_capivara,chapada_vale_do_rio_itaim,vale_do_caninde,vale_do_rio_guaribas), removidos do disco local após a extração — a serem adicionados. O texto extraído de TODOS os 13 territórios está completo no dataset de corpus (configextraido= OCR bruto).
Estrutura
<territorio>/ # slug do Território de Desenvolvimento
.../*.pdf # PDFs das edições/atos
manifest.parquet # índice consultável: 1 linha por PDF
Manifesto (manifest.parquet) — consulta por município/data
Como os PDFs são um dump de arquivos (sem colunas), há um manifest.parquet com 1 linha
por PDF: arquivo (caminho no repo), territorio, municipio (nome oficial canonizado),
data_publicacao (DD/MM/AAAA) e edicao. Permite filtrar/baixar por município ou data:
import duckdb
m = "https://huggingface.co/datasets/gutoportelaa/dom-pi-pdfs-2025/resolve/main/manifest.parquet"
duckdb.sql(f"SELECT arquivo FROM '{m}' WHERE municipio='Campo Maior' AND data_publicacao LIKE '%/03/2025'")
O manifesto acompanha a cobertura atual dos PDFs no repo; é regenerado quando novos territórios são adicionados.
Territórios incluídos: os 12 Territórios de Desenvolvimento do corpus + teresina (capital,
diário próprio — incluída aqui como fonte; o texto de Teresina é disponibilizado à parte).
Como reproduzir a extração
Os PDFs alimentam o pipeline de extração híbrido (PyMuPDF → PaddleOCR-CUDA / Docling-CUDA) do
projeto. O texto OCR bruto resultante está no config extraido do dataset de corpus; as camadas
limpas/tierizadas (default/curated/raw) derivam dele. Veja o código e a documentação em
github.com/gutoportelaa/building-a-LLM.
Natureza dos documentos
Boa parte é escaneada (imagem), exigindo OCR; há edições consolidadas com múltiplos municípios e atos (portarias, decretos, licitações, leis, relatórios fiscais RGF/RREO). Qualidade de OCR varia por documento — ver os tiers de qualidade no dataset de corpus.
Fonte, licença e atribuição
- Fonte: Diário Oficial dos Municípios do Piauí — publicações oficiais de 2025 (documentos públicos).
- Licença: CC-BY-4.0 — atribua à fonte (DOM-PI / municípios do Piauí).
- Cobertura: 12 Territórios de Desenvolvimento + Teresina. Parnaíba não incluída (coleta via SPA não retornou PDFs válidos).