タグ: #iceberg
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 6 件
2026年のデータツール地形の読み方 — ツール一覧ではなく層ごとの決定として
2026年7月28日、GeekNewsに「開発者のためのデータツール地形ガイド」が投稿され51ポイントを獲得しました。良い地図ですが、地図は目的地を選んでくれません。この記事は同じ地形を五つの層に分け、各層で実際に下すべき決定が何かを整理します。テーブルフォーマット戦争がIceberg v3で事実上終結し、争いがカタログへ移った経緯、DuckDB級の単一ノードエンジンがクラスタの仕事をローカルへ引き寄せる流れ、FivetranとdbtL
2026-07-31 · 26 分で読めます #data-engineering#lakehouse#iceberg#duckdb#data-platformIceberg v3 ロウリネージ — 行IDはファイルに保存されない
Apache Icebergフォーマットv3は、すべての行に安定した識別子を与えるロウリネージをスペックに組み込みました。これはオプションではなく、v3テーブルであれば無条件でオンになります。ところがこの値はデータファイルには保存されません — テーブルのnext-row-idからスナップショット、マニフェスト、データファイルへと下る継承チェーンを通じて、読み取り時に計算されます。楽観的コミットが再試行される際にデータファイルを書き直さ
2026-07-16 · 31 分で読めます #iceberg#lakehouse#table-format#data-engineering#sparkモダン Hadoop & ビッグデータエコシステム 2026 完全ガイド - Hadoop 3.4 · Spark 4 · Hive 4 · Kafka 4 · Flink 2 · Iceberg · Trino 徹底解説
2026年の Hadoop とビッグデータエコシステムは『死んだ』のではなく『再配置された』。Hadoop 3.4 の Erasure Coding と Ozone、Spark 4 の ANSI モードと Spark Connect、Hive 4 の Iceberg 統合、Kafka 4 の KRaft GA と tiered storage、Flink 2 の disaggregated state、Iceberg 1.8 と RES
2026-05-16 · 38 分で読めます #japanese#hadoop#spark#hive#kafkaHadoopエコシステム & データエンジニアリング 2026 完全ガイド - Hadoop · Spark · Flink · Trino · Iceberg · Delta Lake · Hudi · Airflow · dbt 詳細分析
2026年5月時点のデータエンジニアリングスタックを徹底解説する。「Hadoopは死んだ」という刺激的なヘッドラインの真実(HDFSは縮小しているが、YARNとレイクハウスパターンは生き残っている)、Iceberg vs Delta Lake vs Hudiのテーブルフォーマット戦争の決着、Spark 4.0 + Photon + Spark Connectの現在、Flink SQLとCDCによるストリーミング標準化、Trinoによるフ
2026-05-16 · 33 分で読めます #hadoop#spark#flink#trino#prestoHadoop は死んだか — big data stack 進化史、Hadoop から Lakehouse まで(Spark・Iceberg・Delta、そして 2026 年の実情)
Hadoop は死んだか。より正確には『default の座から降りた』。HDFS と YARN と MapReduce の三点セット時代は終わり、Spark が MapReduce を置き換え、object storage が HDFS を置き換え、open table format(Iceberg・Delta・Hudi)が Hive metastore 時代を終わらせた。その進化の全体を整理する — 何が何を置き換えたのか、どこに
2026-05-14 · 32 分で読めます #hadoop#big-data#spark#iceberg#delta-lakeデータエンジニアリング完全ガイド — Lakehouse・Streaming・dbt・Orchestration・Data Mesh (Season 2 Ep 8, 2025)
データエンジニアリングはもはや「ETLを回す仕事」ではない。2025年のデータエンジニアは Lakehouse アーキテクチャ(Iceberg/Delta/Hudi)を設計し、Streaming(Flink/Kafka)と Batch(Spark)を統合し、dbt でモデリングを標準化し、Data Mesh で組織境界を引き直し、Data Contract でチーム間のインタフェースを管理する。2025年のデータエンジニアリングを一本に
2026-04-15 · 11 分で読めます #data-engineering#lakehouse#iceberg#delta-lake#hudi