タグ: #data-pipeline
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 6 件
Mistral OCR 4.1のブロック単位の信頼度スコア — 文書パイプラインで人をどこに置くかを決める値
MistralがOCR 4.1を公開し、段落単位のバウンディングボックスと構造ブロックのラベル、そしてブロックごとの信頼度スコアを出しました。文書パイプラインを作ったことがある人にとって実際に重要なのは3つ目です。信頼度スコアがあれば全数レビューと無レビューの間に閾値という選択肢が生まれるからです。その閾値をどう決めるか、信頼度を確率と取り違えると何が壊れるか、そしてページ単価を基準に自前構築がいつ有利になるかを計算します。
2026-08-14 · 12 分で読めます #ocr#document-ai#data-pipeline#human-in-the-loop#cost-optimizationFeature Store & MLOps パイプライン完全ガイド 2025:Feast、Feature Engineering、モデルサービング
Feature StoreとMLOpsのすべて!Feature Storeアーキテクチャ(Feast/Tecton/Hopsworks)、Feature Engineeringパターン、MLOpsパイプライン(学習→検証→デプロイ→モニタリング)、モデルサービング(BentoML/Seldon/TFServing)、モデルレジストリ(MLflow)、ドリフト検知、A/Bテスト。
2026-04-13 · 19 分で読めます #feature-store#mlops#feast#feature-engineering#model-servingWEKA高性能ストレージ完全ガイド2025:AI/HPC向け並列ファイルシステム
WEKAの全て!並列ファイルシステムアーキテクチャ、NVMeティアリング、GPU Direct Storage、AI/MLワークロード最適化、クラウド連携(AWS/Azure/GCP)、Ceph/Lustre/GPFS比較、データパイプライン、性能ベンチマーク。
2026-03-25 · 24 分で読めます #weka#wekafs#storage#parallel-filesystem#ai-infrastructureデータエンジニアリングパイプライン完全ガイド2025:ETL/ELT、Spark、Airflow、リアルタイムストリーミング
データエンジニアリングの全て!ETL vs ELT、Apache Spark(PySpark)、Apache Airflow(DAG/Operator/Sensor)、リアルタイムストリーミング(Kafka+Flink)、dbt(データ変換)、データウェアハウス(BigQuery/Snowflake/Redshift)、データ品質、モニタリング。
2026-03-25 · 25 分で読めます #data-engineering#etl#elt#spark#airflowデータエンジニアリング&AIパイプライン完全ガイド: SparkからKafkaまで
AIのためのデータエンジニアリング完全ガイド。Apache Spark、Kafka、Airflow、dbt、Delta Lake、フィーチャーストアまで、大規模データパイプラインの設計と実装を解説します。
2026-03-17 · 16 分で読めます #data-engineering#apache-spark#kafka#airflow#dbtリアルタイム金融データパイプライン構築:Kafka、Flinkストリーミングアーキテクチャ実践ガイド
リアルタイム金融データパイプラインの設計と実装を解説します。Kafkaベースの市場データ収集、Flinkストリーム処理、CDC連携、ウィンドウ集計、異常取引検知まで、低遅延金融データアーキテクチャをコードとともに構築します。
2026-03-13 · 17 分で読めます #finance#kafka#flink#streaming#data-pipeline