タグ: #data-engineering
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 26 件
657,607本のリンクを辿った結果とURLの寿命 — リンクはなぜ404ではなく接続失敗で死ぬのか
2009年から2014年の間に作られた短縮リンク65万本あまりを2026年にすべて辿った調査が公開されました。結果より重要なのは失敗の内訳です。死んだリンクの大半は404ではなく接続そのものが成立しない状態であり、これは内容が移動したのではなくインフラが消えたという意味です。調査手法の限界まで押さえたうえで、外部URLをデータとして保管するシステムで何を変えるべきかを整理します。
2026-08-14 · 13 分で読めます #web#data-engineering#archival#reliability#url-designいま注目のオープンソース (5) データと ML パイプライン
データパイプラインはスケジューラ一つでは解決しません。取り込み、変換、オーケストレーション、実行エンジン、モデルのライフサイクル、検索ストアが、それぞれ別のツールの領域になりました。この記事では、これらの層で実際に使われているオープンソース 11 件を、スター数の順位ではなく担当する区間ごとにまとめて紹介します。何を置き換えるのか、成熟度はどの程度か、いつ使うべきでないのかも併せて記し、リポジトリのパスとライセンス、スター数、最終プッシ
2026-08-12 · 8 分で読めます #open-source#data-engineering#mlops#python#rust2026年のデータツール地形の読み方 — ツール一覧ではなく層ごとの決定として
2026年7月28日、GeekNewsに「開発者のためのデータツール地形ガイド」が投稿され51ポイントを獲得しました。良い地図ですが、地図は目的地を選んでくれません。この記事は同じ地形を五つの層に分け、各層で実際に下すべき決定が何かを整理します。テーブルフォーマット戦争がIceberg v3で事実上終結し、争いがカタログへ移った経緯、DuckDB級の単一ノードエンジンがクラスタの仕事をローカルへ引き寄せる流れ、FivetranとdbtL
2026-07-31 · 26 分で読めます #data-engineering#lakehouse#iceberg#duckdb#data-platformAirflow 2 EOL後 — 2から3への実際の作業リストと、3.3まで来た3.x系列の現在地
Apache Airflow 2は2026年4月22日にEOLを迎え、もうセキュリティパッチが出ないバージョンになりました。しかし2から3への道はpipアップグレードではなくアーキテクチャ転換です — ワーカーによるメタデータDBへの直接アクセスが消え、executiondate系のコンテキストキーが削除され、クロンスケジュールのデフォルトのセマンティクスまで変わります。本稿は公式アップグレードガイドとリリースノートを原文で読み、実際に
2026-07-17 · 25 分で読めます #data-engineering#airflow#workflow-engine#migrationPySpark 4.2、Python UDFがデフォルトでArrowに乗る — 型強制変換225マスのうち132マスが変わる話
2026年7月14日にリリースされたApache Spark 4.2.0は、SPARK-54555でspark.sql.execution.pythonUDF.arrow.enabledのデフォルト値をfalseからtrueに反転させました。ベンダーブログはこれを「コード書き換えなしでより速いカラム経路が使える」と紹介していますが、リリースのどこにもArrowとpickleの速度比較の数値は公開されていません。そして本当の論点は速度では
2026-07-16 · 27 分で読めます #spark#python#arrow#data-engineeringIceberg v3 ロウリネージ — 行IDはファイルに保存されない
Apache Icebergフォーマットv3は、すべての行に安定した識別子を与えるロウリネージをスペックに組み込みました。これはオプションではなく、v3テーブルであれば無条件でオンになります。ところがこの値はデータファイルには保存されません — テーブルのnext-row-idからスナップショット、マニフェスト、データファイルへと下る継承チェーンを通じて、読み取り時に計算されます。楽観的コミットが再試行される際にデータファイルを書き直さ
2026-07-16 · 31 分で読めます #iceberg#lakehouse#table-format#data-engineering#sparkDuckDB にクライアント・サーバープロトコルができた — Quack が変えるものと変えないもの
2026年5月12日、DuckDBチームがQuackを発表しました。HTTPの上に載せたクライアント・サーバープロトコルで、DuckDBインスタンス2つが互いにクライアントとサーバーになり、同じデータベースを複数プロセスから同時に読み書きできるようにします。7年間「インプロセス」をアイデンティティとして掲げてきたプロジェクトが自らサーバーを取り付けたわけで、何が変わったかより何が変わらなかったかのほうが重要です。本稿ではQuackの設計
2026-07-16 · 31 分で読めます #database#duckdb#olap#analytics#data-engineeringParquet 2.13.0 の nan_count と IEEE 754 total order — float 統計が3年3か月かけて直った話
Parquetのmin/max統計は、クエリエンジンにデータをスキップさせるための仕組みです。ところが浮動小数点カラムでは、この仕組みが10年以上前から微妙に壊れていました — NaNはどんな比較でもfalseを返すため統計から除外され、その結果NaNを含むページが、maxより大きい値を探すクエリで丸ごとスキップされてしまうことがあります。性能の問題ではなく、結果が間違う問題です。2026年6月13日にリリースされたparquet-fo
2026-07-16 · 31 分で読めます #data-engineering#parquet#columnar-storage#apache-arrowドキュメントから知識グラフへ — 正直な構築パイプライン
「ドキュメントから知識グラフを抽出する」はデモでは LLM 呼び出し一回のように見えます。しかし顧客のドキュメントを実際にクエリ可能なグラフに変える仕事は6段階のパイプラインであり、コストと苦痛の大半は抽出ではなくエンティティ解決にあります。この記事では、スキーマ(オントロジー)を先に決める理由、LLM ベースのスキーマ制約抽出(LangChain の LLMGraphTransformer、LlamaIndex の Simple/Sc
2026-07-15 · 17 分で読めます #knowledge-graph#ai#llm#data-engineeringLLM学習データ前処理の完全ガイド — Webクロールからトークンパッキングまで、最新論文とともに
よいモデルはよいデータから生まれ、よいデータは前処理パイプラインから生まれます。Webクロール収集 → 本文抽出 → 言語識別 → ヒューリスティック・分類器による品質フィルタリング → 厳密・近似(MinHash)重複除去 → PII・有害性処理 → ベンチマーク汚染除去 → トークナイズとシーケンスパッキングまで、事前学習データの全工程を段階ごとに解説します。あわせてSFTデータ整備の要点、datatrove・Dolma・NeMo
2026-07-09 · 13 分で読めます #ai#llm#data-engineering#preprocessing#trainingDuckDB実践 — ノートPCで完結する組み込み分析の時代
OLAPのSQLiteと呼ばれるDuckDBがなぜこれほど愛されるのか、アーキテクチャから解き明かします。Parquetの直接クエリ、ウィンドウ関数・PIVOT・ASOF JOINの実践例、pandasとのzero-copy連携、dbt-duckdbによる軽量ETL、MotherDuckのハイブリッド実行、そしてPostgresやClickHouseと比較した選択ガイドまで整理します。
2026-06-12 · 22 分で読めます #duckdb#database#olap#analytics#parquetHadoopエコシステム & データエンジニアリング 2026 完全ガイド - Hadoop · Spark · Flink · Trino · Iceberg · Delta Lake · Hudi · Airflow · dbt 詳細分析
2026年5月時点のデータエンジニアリングスタックを徹底解説する。「Hadoopは死んだ」という刺激的なヘッドラインの真実(HDFSは縮小しているが、YARNとレイクハウスパターンは生き残っている)、Iceberg vs Delta Lake vs Hudiのテーブルフォーマット戦争の決着、Spark 4.0 + Photon + Spark Connectの現在、Flink SQLとCDCによるストリーミング標準化、Trinoによるフ
2026-05-16 · 33 分で読めます #hadoop#spark#flink#trino#prestoデータレイクハウス & モダンデータエンジニアリング 2026 — Iceberg / Delta / Hudi / Paimon / Tabular (Databricks買収) / Trino / Spark 4 / Flink 2 / DataFusion 徹底ガイド
2026年のデータエンジニアリングは、もはや「データウェアハウス対データレイク」の時代ではない。2024-25年のテーブルフォーマット戦争はApache Icebergの勝利に終わり、Netflix・Apple・LinkedIn・Stripe・Airbnbが揃ってその上に集まった。Databricksは2024年6月、Iceberg共同創設者Ryan BlueのTabularを10億ドル超で買収し、Delta LakeとIcebergを
2026-05-16 · 40 分で読めます #data-engineering#data-lakehouse#apache-iceberg#delta-lake#apache-hudiHadoop は死んだか — big data stack 進化史、Hadoop から Lakehouse まで(Spark・Iceberg・Delta、そして 2026 年の実情)
Hadoop は死んだか。より正確には『default の座から降りた』。HDFS と YARN と MapReduce の三点セット時代は終わり、Spark が MapReduce を置き換え、object storage が HDFS を置き換え、open table format(Iceberg・Delta・Hudi)が Hive metastore 時代を終わらせた。その進化の全体を整理する — 何が何を置き換えたのか、どこに
2026-05-14 · 32 分で読めます #hadoop#big-data#spark#iceberg#delta-lakePolars 1.x vs Pandas — Pandas 時代の終わりか? Rust・Arrow・lazy 時代の dataframe 深掘り 2026
Polars が 1.x で stable API を約束し、Pandas 2.2 が PyArrow backend を正式採用したことで、dataframe 世界の重心が揺れた。Polars 1.x は本当に Pandas を置き換えるのか? Rust + Arrow アーキテクチャ、lazy evaluation、query optimizer(predicate / projection pushdown、common sube
2026-05-14 · 28 分で読めます #polars#pandas#dataframe#apache-arrow#duckdbデータエンジニアリング完全ガイド — Lakehouse・Streaming・dbt・Orchestration・Data Mesh (Season 2 Ep 8, 2025)
データエンジニアリングはもはや「ETLを回す仕事」ではない。2025年のデータエンジニアは Lakehouse アーキテクチャ(Iceberg/Delta/Hudi)を設計し、Streaming(Flink/Kafka)と Batch(Spark)を統合し、dbt でモデリングを標準化し、Data Mesh で組織境界を引き直し、Data Contract でチーム間のインタフェースを管理する。2025年のデータエンジニアリングを一本に
2026-04-15 · 11 分で読めます #data-engineering#lakehouse#iceberg#delta-lake#hudiデータエンジニアリング入門 — ETL、データウェアハウス、ストリーミング、データレイク
データパイプラインはどう構築するのか?ETL/ELT、データウェアハウス、ストリーミング、バッチ処理、Spark、Kafka、Airflowまで。
2026-04-13 · 23 分で読めます #data-engineering-aws#data-engineering#etl#data-warehouse#sparkデータエンジニアリングパイプライン完全ガイド2025:ETL/ELT、Spark、Airflow、リアルタイムストリーミング
データエンジニアリングの全て!ETL vs ELT、Apache Spark(PySpark)、Apache Airflow(DAG/Operator/Sensor)、リアルタイムストリーミング(Kafka+Flink)、dbt(データ変換)、データウェアハウス(BigQuery/Snowflake/Redshift)、データ品質、モニタリング。
2026-03-25 · 25 分で読めます #data-engineering#etl#elt#spark#airflowSnowflake Data Engineerキャリアガイド:クラウドデータウェアハウスの王座を制した技術の全て
Snowflake Data Engineerの役割を完全分析します。Snowflakeアーキテクチャ(コンピュート・ストレージ分離)、Snowpark、Cortex AI、Icebergテーブル、dbt連携、ストリーミング(Snowpipe)、コスト最適化 — 面接質問20選と学習ロードマップ。
2026-03-23 · 33 分で読めます #snowflake#data-engineering#data-warehouse#sql#dbtDatabricks AI Engineer(FDE)完全合格ガイド:Spark、Unity Catalog、RAGから顧客デプロイまで
Databricks AI Engineer(FDE)のJDを完全分析します。Spark/Delta Lake/Unity Catalogの技術スタック、Lakehouseアーキテクチャ、RAGパイプライン構築、顧客現場デプロイ能力まで — 面接予想質問25選と8ヶ月学習ロードマップ。
2026-03-23 · 52 分で読めます #databricks#fde#spark#delta-lake#unity-catalog