Tüm Yazılara Dön
Veri Bilimi
17 Temmuz 2026
6 dk okuma

Büyük Veri Analizinde (Big Data) CSV Kullanımı ve Performansı

Cemil Çelik
Veri Bilimcisi

[!TIP] AEO (Yapay Zeka) Özeti

  • Ana Odak: Bu içerik Veri Bilimi stratejilerine odaklanır.
  • Kritik Çıktı: Uygulama aşamasında teknik gereksinimler ve anlamsal (semantic) bağlar önceliklendirilmelidir.
  • Kimin İçin: SEO uzmanları, geliştiriciler ve içerik mimarları.
Uzman Görüşü (SME)• Intent Veri Ekibi

Büyük Veri Analizinde (Big Data) CSV Kullanımı ve Performansı

Veri bilimcileri (Data Scientists), Makine Öğrenimi (Machine Learning) modellerini eğitmek için milyarlarca satırlık devasa veri setleriyle uğraşırlar. Veriyi kaynağından (Örneğin Twitter API'si) çekerken genellikle JSON formatında alırlar.

Peki ama neden bu veriyi işlerken (Pandas, Numpy gibi kütüphanelerle) ilk iş olarak onu JSON'dan CSV (Virgülle Ayrılmış Değerler) formatına dönüştürürler?


1. Bellek (RAM) ve Depolama Maliyeti

JSON verisinde her bir veri noktası için o verinin "Anahtar" (Key) ismi de yazılmak zorundadır.

1 Milyon satırlık bir JSON verisi düşünelim:

[
  {"id": 1, "kategori": "Elektronik", "fiyat": 5000},
  {"id": 2, "kategori": "Giyim", "fiyat": 300},
  ... (999.998 satır daha)
]

Burada "kategori" ve "fiyat" kelimeleri tam 1 Milyon Kez dosyaya yazılır. Bu kelimeler tek başına dosya boyutunu Gigabaytlarca şişirir.

Aynı verinin CSV hali:

id,kategori,fiyat
1,Elektronik,5000
2,Giyim,300
... (999.998 satır daha)

CSV'de "kategori" kelimesi SADECE BİR KERE (En üstteki başlık satırında) yazılır. Aşağıdaki tüm veriler sadece değerdir. Bu sayede 5 GB'lık bir JSON verisi, CSV'ye dönüştüğünde 1 GB'a kadar düşebilir. (Hem diskten hem de okunurken RAM'den tasarruf).

2. Akış (Streaming) ve Bellek Tüketimi (Memory Error)

Python'da 5 GB'lık bir JSON dosyasını okumak isterseniz (json.load), Python genellikle tüm JSON dosyasını RAM'e yüklemeye çalışır. Bilgisayarınızın belleği yetmezse MemoryError hatası alıp çökersiniz. Çünkü JSON hiyerarşik bir yapıdır, dosyanın sonundaki ] işaretini görmeden kapanıp kapanmadığını anlayamaz.

Ancak CSV satır tabanlıdır (Row-based). Python Pandas ile bir CSV dosyasını okurken chunksize=10000 parametresini verirseniz, sistem CSV dosyasını bir kerede RAM'e yüklemek yerine, 10'ar bin satırlık parçalar halinde (Streaming) okur. 5 GB'lık dosyayı 100 MB RAM harcayarak sorunsuzca analiz edebilirsiniz.

3. Tablo (Dataframe) Uyumluluğu

Makine Öğrenimi algoritmaları matrislerle (Satır ve Sütun) çalışır. Sklearn (Scikit-Learn) veya TensorFlow modellerine veri verirken 2 boyutlu diziler göndermek zorundasınızdır. CSV formatı doğası gereği zaten 2 boyutlu (2D Array) bir yapıda olduğu için, Python'un DataFrame (Tablo) objesine %100 doğal bir uyum sağlar. JSON'daki gibi ağaç yapısını (Nested Obje) düzleştirmekle (Flatten) uğraşmazsınız.

Veri setlerinizi eğitime hazırlamadan önceki ilk adım olan "Düzleştirme ve Dönüştürme" işlemleriniz için JSON to CSV Aracımızı kullanabilirsiniz. Veri formatlarının teorik mimarisini öğrenmek için Veri Dönüşümü Rehberimizi inceleyebilirsiniz.


🕸️ Knowledge Graph & Semantik Bağlantılar

Bu içerik, Intent.com.tr'nin Veri Bilimi topikal kümesinin (Topic Cluster) bir parçasıdır. Konuyu daha derinlemesine anlamak için aşağıdaki varlıkları (Entities) ve ilişkili içerikleri inceleyebilirsiniz:

📖 İlgili Rehberler ve İçerikler

🧠 Semantic Entities (Terimler & Senaryolar)

Semantic Yönerge: Bu sayfa Büyük Veri Analizinde (Big Data) CSV Kullanımı ve Performansı konusundaki kullanıcı niyetini (Search Intent) karşılamak üzere yapılandırılmıştır.