« Tüm yayınlar

Emboss: PDF'leri Yapılandırılmış Veri Olarak Tutan Python Motoru

Emboss, deterministik ve erişilebilir PDF üreten saf Python dizgi motoru; tablo verisini gömer, PDF/UA uyumludur, MCP ile AI entegre çalışır.

Emboss, LLM tarafından üretilen veya yapılandırılmış içerikleri erişilebilir, baskıya hazır PDF'lere dönüştüren saf Python tabanlı bir dizgi motoru. Chromium veya HTML-to-PDF yaklaşımlarının aksine gerçek bir tipografi motoru (Knuth-Plass satır kırma) kullanıyor ve çıktı byte-seviyesinde deterministik: aynı belge her makinede aynı hash'i üretiyor, bu da CI'da diff ve doğrulama yapılabilmesini sağlıyor.

Projenin öne çıkan yanı, PDF'i son çıktı değil yapılandırılmış veri olarak ele alması. Bir tablo, kendi kaynak CSV'sini PDF içine gömebiliyor; böylece görselleştirilen veri ile analistin ihtiyaç duyduğu veri hiçbir zaman ayrışmıyor. Belgeler ayrıca kendi spec'lerini, karakter bazlı metin indekslerini ve blok bazlı sabit ID'lerini içinde taşıyor, bu da üretim, inceleme, düzenleme, imzalama ve doğrulama adımlarının aynı yapı üzerinden çalışmasına imkan tanıyor.

Mühendisler için önemi: tek zorunlu bağımlılığın fonttools olması, kısıtlı sunucu ortamlarında denetim ve dağıtımı kolaylaştırıyor. PDF/UA erişilebilirlik etiketleme varsayılan olarak geliyor ve gerçek veraPDF doğrulayıcısıyla CI'da test ediliyor; ayrıca PDF/A, Factur-X/ZUGFeRD e-fatura ve PAdES/eIDAS imza standartlarını tek motorda destekliyor. MCP sunucusu sayesinde belgeler Claude gibi araçlardan sorgulanabiliyor, LLM düzenlemeleri düğüm bazlı olduğu için maliyet de düşük kalıyor.

Bu sentez, kaynağından yapay zeka tarafından üretildi; insan editör ya da elle onay adımı yoktur. Nasıl çalışıyoruz