İçeriğe geç

Ücretsiz Dosyadan Markdown Dönüştürücüyü Nasıl Geliştirdim?

markdown.new’un PDF, DOCX, tablo, görsel ve diğer dosyaları kayıt gerektirmeden LLM ve RAG akışlarına uygun temiz Markdown’a nasıl çevirdiğini görün.

Yayımlandı 6 dk okuma

Yazan
Emre Elbeyoglu

GrowthMarketing.ai Kurucusu

15+ yıllık deneyim

Emre Elbeyoglu, GrowthMarketing.ai kurucusu ve B2B SaaS büyüme uzmanıdır. SEO ve GEO alanındaki 15 yılı aşan deneyiminde arama motorlarının ve yapay zekâ sıralama sistemlerinin çalışma biçimini inceler. Popupsmart ve LiveChatAI gibi SaaS ürünlerinin geliştirilmesinde görev almıştır.

  • Bilgisayar Teknolojisi ve Bilişim Sistemleri, Bilkent Üniversitesi
  • Popupsmart Kurucu Ortağı ve Growth Lideri (2019'dan beri)
  • LiveChatAI Kurucu Ortağı (2023'ten beri)
PDF, DOCX, tablo ve görselleri Markdown biçimine dönüştüren markdown.new arayüzü

Kısa yanıt: markdown.new dosyadan Markdown dönüştürücü; PDF, DOCX, tablo, görsel ve diğer desteklenen dosyaları yapay zekâ iş akışlarında kullanılabilecek temiz Markdown’a çevirir. Ben aracı Cloudflare Workers AI’ın toMarkdown() işlevi üzerinde geliştirdim; dönüşüm bellek içinde çalışıyor, dosya saklanmıyor, kullanım ücretsiz ve kayıt gerektirmiyor.

Dosya yükleme ve Markdown çıktı panelleriyle markdown.new dönüştürücüsü

Bir PDF’yi büyük dil modeline vermeyi veya RAG akışı kurmayı denediyseniz sorunu bilirsiniz. Ham dosya biçimleri gürültülü, fazla token tüketen ve tutarsız yapılardır. Bu rehberde markdown.new üzerindeki File to Markdown özelliğinin dosya türlerine göre nasıl çalıştığını ve hangi sınırlara dikkat edilmesi gerektiğini gösteriyorum.

Dosyadan Markdown özelliğini neden ekledim?

PDF, DOCX, tablo ve görsel dosyaları için Markdown dönüşüm seçenekleri

markdown.new’u herhangi bir URL’yi Markdown’a dönüştürmek için ilk yayımladığımda gelen geri bildirim açıktı: insanların web sayfaları kadar dosyalar için de aynı işleme ihtiyacı vardı. Geliştiriciler PDF’leri LLM’lere yüklerken çok fazla token tüketiyordu. Araştırmacıların ayrıştırması gereken DOCX raporları, veri ekiplerinin ajanlara vermek istediği tablolar vardı.

Dosya dönüştürücüyü URL aracının da kullandığı Cloudflare Workers AI toMarkdown() işlevi üzerine kurdum. Yirmiden fazla dosya biçimini doğrudan işliyor; dönüşüm uç noktada, bellek içinde yapılıyor ve işlemden sonra dosya saklanmıyor.


PDF’den Markdown’a dönüşüm nasıl çalışır?

Yapılandırılmış Markdown metnine dönüştürülen PDF belgesi

PDF’den Markdown’a dönüşüm en sık gördüğüm kullanım senaryosu. Araştırma makalesi, finans raporu veya ürün kılavuzu fark etmeksizin PDF’lerde bağlam penceresini gereksiz yere dolduran çok sayıda biçimlendirme öğesi bulunuyor.

markdown.new ile PDF’yi üç yolla dönüştürebilirsiniz:

URL üzerinden: PDF herkese açıksa adresini kullanın:

curl -s 'https://markdown.new/https://example.com/report.pdf'

Dosya yükleyerek: Yerel dosyalar için /convert uç noktasını kullanın:

curl -s 'https://markdown.new/convert' -F 'file=@report.pdf'

Web arayüzüyle: Dosyayı sürükleyip bırakın ve Markdown çıktısını alın.

Dönüştürücü mümkün olduğunda başlık hiyerarşisini, listeleri, tabloları ve kod bloklarını korur. Yanıttaki tokens alanı, içeriği modele göndermeden önce bağlam penceresi bütçesini hesaplamanıza yardım eder.


DOCX’ten Markdown’a dönüşüm nasıl çalışır?

Yapılandırılmış Markdown metnine dönüştürülen DOCX belgesi

Word belgeleri kurumsal iş akışlarında sık kullanılıyor. İç prosedür, sözleşme veya politika belgesi alan ajanlar geliştirirken çoğu kaynak DOCX biçiminde geliyor. .docx dosyasını doğrudan LLM’e vermek gereksiz kaynak tüketiyor ve tutarsız sonuç üretebiliyor.

markdown.new, belgenin yapısal hiyerarşisini korumaya çalışır: başlıklar #, ## ve ### olur; listeler liste, tablolar Markdown tablosu olarak çıkar. XML gürültüsü olmadan anlamlı yapı elde edilir.

curl -s 'https://markdown.new/https://example.com/document.docx'

JSON yanıtı çıkarılan title, Markdown biçimindeki content ve tokens sayısını içerir. Böylece sonuç doğrudan veri akışına aktarılabilir.


Excel ve tablo dosyaları Markdown’a nasıl dönüştürülür?

Elektronik tablolar yapılandırılmış veri, Markdown tabloları da yapılandırılmış çıktıdır. Araç .xlsx, .xls, .xlsm, .xlsb, .et, .ods ve .numbers dosyalarını destekliyor.

Bir tabloyu Markdown’a dönüştürdüğümde her sayfa biçimlendirilmiş tablo olarak çıkar. Bu, tablo verisi üzerinde akıl yürütmesi gereken ajanlarda yararlıdır; temiz Markdown tablosunu LLM’in ayrıştırması ham hücre referanslarından daha kolaydır.

curl -s 'https://markdown.new/https://example.com/data.xlsx?format=json'

Görselden Markdown’a dönüşüm nasıl çalışır?

İçeriği yazıya dökülüp Markdown olarak biçimlendirilen görsel

Bu özellik yayımlandığında birçok kişiyi şaşırttı. Görselden Markdown’a dönüşüm yalnızca OCR kullanmıyor; Workers AI modelleriyle nesne tespiti ve görsel özetleme yapıyor. .jpg, .png, .webp veya .svg yüklediğinizde model görsel içeriği inceliyor ve Markdown açıklaması döndürüyor.

Ürün görselleri içeren kataloglar, diyagramlı sunumlar veya ekran görüntülü destek talepleri gibi karma içerik işleyen ajan akışlarında bu özellik yararlı oluyor.

curl -s 'https://markdown.new/convert' -F 'file=@screenshot.png'

Yanıt, vektör veritabanına eklenebilen veya LLM’e gönderilebilen Markdown açıklamasıdır.


HTML dosyası Markdown’a nasıl dönüştürülür?

İçerik alma akışlarında en sık karşılaştığım biçim HTML’dir. Ham HTML; anlam katmayan <div> öğeleri, sınıf adları ve betik etiketleriyle token tüketir.

URL tabanlı HTML sayfalarında markdown.new üç katmanlı akış kullanır: içerik uzlaşması, Workers AI ve başsız tarayıcı. Yüklenen .html dosyaları doğrudan Workers AI toMarkdown() işlevinden geçer. Her iki durumda da amaç anlamlı, temiz Markdown üretmektir.

CSV ve JSON dosyaları Markdown’a nasıl dönüştürülür?

CSV ve JSON veri akışlarında sürekli karşıma çıktığı için bu biçimleri de ekledim. CSV Markdown tablosuna, JSON yapılandırılmış Markdown metnine dönüşüyor. Ek ayrıştırma kodu yazmadan LLM bağlamında kullanılabiliyor.

Bu sayede veri dosyası URL’sini doğrudan akış çağrısına verip Markdown çıktısı alabiliyorum.

API nasıl çalışır?

API’yi düşük sürtünmeyle kullanmak için tasarladım. Başlamak için API anahtarı gerektirmeyen dört uç nokta bulunuyor:

Uç nokta Yöntem Kullanım
/:file-url GET Uzak dosya URL’si, düz Markdown döndürür
/ POST Uzak dosya URL’sini JSON olarak alır, metadata içeren JSON döndürür
/:file-url?format=json GET Uzak dosya URL’si, JSON döndürür
/convert POST Yerel dosya yükleme

Varsayılan kota IP başına günde 500 istektir.

URL tabanlı dönüşümün tipik JSON yanıtı şöyledir:

{
  "success": true,
  "url": "https://example.com/report.pdf",
  "title": "Quarterly Report",
  "content": "# Quarterly Report\n\n...",
  "method": "Workers AI (file)",
  "duration_ms": 1200,
  "tokens": 850
}

Bu aracı geliştirirken ne öğrendim?

Dosya dönüştürücüyü geliştirirken gördüğüm en önemli nokta, birçok yapay zekâ akışında darboğazın model değil içeriği alma katmanı olmasıydı. Ekipler PDF ayrıştırıcıları, belge çıkarıcıları ve her biçime özel işleyiciler için orantısız ölçüde mühendislik zamanı harcıyor. Yirmiden fazla biçimi tek uç noktada işlemek bu yüzeyin büyük bölümünü kaldırıyor.

Her yanıttaki tokens alanı da beklediğimden daha yararlı oldu. LLM API çağrısından önce bağlam penceresi kullanımını hesaplamak ve fazla büyük dosyaları ayırmak, ciddi ajan akışları için gerekli gördüğüm bir özellik hâline geldi.

Dosyadan Markdown dönüştürücü nasıl denenir?

File to Markdown markdown.new üzerinde yayında. Hesap, API anahtarı veya yapılandırma gerektirmiyor. PDF, DOCX, XLSX, görsel, HTML, CSV, JSON ve başka biçimleri destekliyor. Dosya sınırı 10 MB; URL üzerinden getirilen dosyalarda zaman aşımı 30 saniye.

Yapay zekâ ajanı, RAG akışı veya belge işleme sistemi geliştiriyorsanız aracı nasıl kullandığınızı duymak isterim. Amaç, dosya alma katmanını görünmez hâle getirip asıl ajan işine odaklanmanızı sağlamak.

markdown.new konusunda sırada ne okuyabilirsiniz?