タグ: #spark
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 15 件
PySpark 4.2、Python UDFがデフォルトでArrowに乗る — 型強制変換225マスのうち132マスが変わる話
2026年7月14日にリリースされたApache Spark 4.2.0は、SPARK-54555でspark.sql.execution.pythonUDF.arrow.enabledのデフォルト値をfalseからtrueに反転させました。ベンダーブログはこれを「コード書き換えなしでより速いカラム経路が使える」と紹介していますが、リリースのどこにもArrowとpickleの速度比較の数値は公開されていません。そして本当の論点は速度では
2026-07-16 · 27 分で読めます #spark#python#arrow#data-engineeringIceberg v3 ロウリネージ — 行IDはファイルに保存されない
Apache Icebergフォーマットv3は、すべての行に安定した識別子を与えるロウリネージをスペックに組み込みました。これはオプションではなく、v3テーブルであれば無条件でオンになります。ところがこの値はデータファイルには保存されません — テーブルのnext-row-idからスナップショット、マニフェスト、データファイルへと下る継承チェーンを通じて、読み取り時に計算されます。楽観的コミットが再試行される際にデータファイルを書き直さ
2026-07-16 · 31 分で読めます #iceberg#lakehouse#table-format#data-engineering#sparkモダン Scala 2026 — Scala 3.6 / 3.7 / ZIO 2 / Cats Effect 3 / Pekko / Tapir / Mill / Scala CLI 徹底ガイド
2026年の Scala エコシステムを総まとめ — Scala 3.6/3.7 の新機能、Scala 4 preview、sbt 2.x vs Mill vs Scala CLI、ZIO 2 vs Cats Effect 3、Pekko/Akka の BSL 騒動、Play/http4s/Tapir、Scala.js/Native、Spark、Lichess、Effect.ts、Iron による refined types、そして韓国
2026-05-16 · 36 分で読めます #scala#scala-3#sbt#mill#scala-cliモダン Hadoop & ビッグデータエコシステム 2026 完全ガイド - Hadoop 3.4 · Spark 4 · Hive 4 · Kafka 4 · Flink 2 · Iceberg · Trino 徹底解説
2026年の Hadoop とビッグデータエコシステムは『死んだ』のではなく『再配置された』。Hadoop 3.4 の Erasure Coding と Ozone、Spark 4 の ANSI モードと Spark Connect、Hive 4 の Iceberg 統合、Kafka 4 の KRaft GA と tiered storage、Flink 2 の disaggregated state、Iceberg 1.8 と RES
2026-05-16 · 38 分で読めます #japanese#hadoop#spark#hive#kafkaHadoopエコシステム & データエンジニアリング 2026 完全ガイド - Hadoop · Spark · Flink · Trino · Iceberg · Delta Lake · Hudi · Airflow · dbt 詳細分析
2026年5月時点のデータエンジニアリングスタックを徹底解説する。「Hadoopは死んだ」という刺激的なヘッドラインの真実(HDFSは縮小しているが、YARNとレイクハウスパターンは生き残っている)、Iceberg vs Delta Lake vs Hudiのテーブルフォーマット戦争の決着、Spark 4.0 + Photon + Spark Connectの現在、Flink SQLとCDCによるストリーミング標準化、Trinoによるフ
2026-05-16 · 33 分で読めます #hadoop#spark#flink#trino#prestoデータレイクハウス & モダンデータエンジニアリング 2026 — Iceberg / Delta / Hudi / Paimon / Tabular (Databricks買収) / Trino / Spark 4 / Flink 2 / DataFusion 徹底ガイド
2026年のデータエンジニアリングは、もはや「データウェアハウス対データレイク」の時代ではない。2024-25年のテーブルフォーマット戦争はApache Icebergの勝利に終わり、Netflix・Apple・LinkedIn・Stripe・Airbnbが揃ってその上に集まった。Databricksは2024年6月、Iceberg共同創設者Ryan BlueのTabularを10億ドル超で買収し、Delta LakeとIcebergを
2026-05-16 · 40 分で読めます #data-engineering#data-lakehouse#apache-iceberg#delta-lake#apache-hudiHadoop は死んだか — big data stack 進化史、Hadoop から Lakehouse まで(Spark・Iceberg・Delta、そして 2026 年の実情)
Hadoop は死んだか。より正確には『default の座から降りた』。HDFS と YARN と MapReduce の三点セット時代は終わり、Spark が MapReduce を置き換え、object storage が HDFS を置き換え、open table format(Iceberg・Delta・Hudi)が Hive metastore 時代を終わらせた。その進化の全体を整理する — 何が何を置き換えたのか、どこに
2026-05-14 · 32 分で読めます #hadoop#big-data#spark#iceberg#delta-lakeColumnar ストレージ完全ガイド 2025: Parquet, ORC, Apache Arrow, Dremel — 分析 DB が 10,000 倍速い理由
Snowflake, BigQuery, Spark が TB 規模のデータを数秒でクエリする秘密。Parquet の Dremel 構造、ORC、Apache Arrow のメモリフォーマット、RLE/Dictionary Encoding、ベクトル化実行までを完全解説。
2026-04-15 · 18 分で読めます #columnar-storage#parquet#orc#apache-arrow#dremelApache Spark 内部完全ガイド 2025: RDD, Catalyst Optimizer, Tungsten, Whole-Stage Codegen, Shuffle 深層解析
Spark が同じクエリを MapReduce より 100 倍速く処理する秘訣。RDD から DataFrame/Dataset、Catalyst optimizer、Tungsten project、whole-stage code generation、shuffle 最適化まで完全解析する。
2026-04-15 · 17 分で読めます #spark#catalyst#tungsten#rdd#whole-stage-codegenデータエンジニアリング入門 — ETL、データウェアハウス、ストリーミング、データレイク
データパイプラインはどう構築するのか?ETL/ELT、データウェアハウス、ストリーミング、バッチ処理、Spark、Kafka、Airflowまで。
2026-04-13 · 23 分で読めます #data-engineering-aws#data-engineering#etl#data-warehouse#sparkデータエンジニアリングパイプライン完全ガイド2025:ETL/ELT、Spark、Airflow、リアルタイムストリーミング
データエンジニアリングの全て!ETL vs ELT、Apache Spark(PySpark)、Apache Airflow(DAG/Operator/Sensor)、リアルタイムストリーミング(Kafka+Flink)、dbt(データ変換)、データウェアハウス(BigQuery/Snowflake/Redshift)、データ品質、モニタリング。
2026-03-25 · 25 分で読めます #data-engineering#etl#elt#spark#airflowDatabricks AI Engineer(FDE)完全合格ガイド:Spark、Unity Catalog、RAGから顧客デプロイまで
Databricks AI Engineer(FDE)のJDを完全分析します。Spark/Delta Lake/Unity Catalogの技術スタック、Lakehouseアーキテクチャ、RAGパイプライン構築、顧客現場デプロイ能力まで — 面接予想質問25選と8ヶ月学習ロードマップ。
2026-03-23 · 52 分で読めます #databricks#fde#spark#delta-lake#unity-catalogApache Spark 実運用ガイド: 性能チューニング、シャッフル、スキュー、AQE、ストリーミング運用
Apache Sparkを本番環境で安定して運用するために重要な実行モデル、シャッフルとデータスキュー、AQE、キャッシュ戦略、Structured Streaming運用チェックリストを整理します。
2026-03-17 · 10 分で読めます #spark#spark-tuning#data-engineering#shuffle#adaptive-query-executionApache Icebergデータレイクハウステーブルフォーマットガイド
データレイクハウスアーキテクチャのためのApache Icebergテーブルフォーマット総合ガイド。スキーマ進化、パーティショニング、タイムトラベル、クエリ最適化を解説します。
2026-03-14 · 27 分で読めます #apache-iceberg#data-lakehouse#big-data#hadoop#sparkSpark on YARN のインストール方法
Spark on YARNのインストール方法を解説します。
2022-11-26 · 9 分で読めます #hadoop#spark#yarn