Yapay Zeka Araçları

deepDoctection 1.2.x ile Uçtan Uca Belge Zekası ve OCR Boru Hattı Geliştirme Rehberi

Karmaşık belge ve PDF’leri yapay zeka ile otomatik olarak okuyup içindeki tablo ve metinleri yapılandırılmış verilere dönüştüren yeni bir yazılım rehberi yayınlandı.

Yapay zeka ekosisteminde belge analizi ve veri çıkarma süreçleri için geliştirilen deepDoctection 1.2.x sürümü, karmaşık doküman işleme iş akışlarında kapsamlı bir rehber ile duyuruldu. Yeni araç; düzen tespiti (layout detection), tablo yapısı tanıma, optik karakter tanıma (OCR), okuma sırası rekonstrüksiyonu, ek açıklamaların ilişkilendirilmesi ve yapılandırılmış veri ihracını tek bir çatı altında birleştiriyor.

Yayınlanan eğitim içeriğinde, DocLayNet tabanlı düzen tespiti, Table Transformer yapı tanıma ve DocTR OCR bileşenleri kullanılarak özel bir analizör yapılandırılıyor. Geliştiriciler bu sistem sayesinde PDF ve görsel dosyalarındaki metinleri, figürleri, tabloları ve mantıksal okuma sırasını Page nesneleri üzerinden detaylı bir şekilde inceleyebiliyor. Ayrıca çerçeveye özel nesne türleri kaydedilerek, belgelerin yapısal özelliklerine göre parasal ve tarihsel varlıkları çıkaran özel PipelineComponent bileşenleri yazmak da mümkün hale geliyor.

Süreç sonunda ServiceFactory ile manuel olarak boru hatları kurulabiliyor; filtreleme, servis geri alma (rollback) işlemleri gerçekleştirilerek işlenen sayfalar serialize edilebiliyor. Üretilen doküman ek açıklamaları ise doğrudan RAG (Retrieval-Augmented Generation) ve bilgi getirme sistemlerinde kullanılmak üzere sıralı JSONL parçalarına dönüştürülebiliyor.

İlgili yazılar: AutoFigure ile Bilimsel ve Akademik Çizgide Yapay Zeka Figürleri Üretin

Görsel ve haber kaynağı: MarkTechPost

Paylaş
Devam Et
AI yolculuğunda bir adım daha at.

12 uygulamalı kursla AI'ı işine yedir, bugün başla.

Eğitime Başla

Bu site, deneyiminizi geliştirmek için çerezler kullanır. Sitemizi kullanmaya devam ederek KVKK Aydınlatma Metni'ni kabul etmiş sayılırsınız.

Daha Fazla