タグ: #rag
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 59 件
いま注目のオープンソース (1) AIエージェントとLLMツール
LLMアプリケーションのスタックは、推論サーバー、オーケストレーション、ゲートウェイ、エージェント、RAGへと層が分かれました。各層で実際に使われているオープンソース12件を、スター数の順位ではなく役割ごとにまとめて紹介します。プロジェクトごとに何を置き換えるのか、成熟度はどの程度か、どんな状況で使ってはいけないのかも併せて整理し、リポジトリのパスとライセンス、スター数、最近のプッシュ日は2026年8月12日にGitHubで直接確認した
2026-08-12 · 9 分で読めます #open-source#llm#ai-agent#ai-platform#rag韓国の開発ブログ名文キュレーション 3 — AIとML実務、直接開いて確認した14本
AIとMLを実務で扱う韓国語記事から、具体的で再現可能な14本を選びました。LangChainによるRAGパイプラインの全工程、埋め込みとベクトル類似度から見た意味検索の原理、ベクトルデータベース7種の比較、pgvectorからQdrantへの移行記録、OllamaからvLLMへ移してスループットを上げた過程、LLMサービングの指標のトレードオフ、使用量トラッカーの自作記、Transformer論文のレビューとコード実装、BERTの整理
2026-08-12 · 24 分で読めます #curation#큐레이션#ai#llm#rag埋め込みとリランカー、RAGで実際に重要なもの
RAGを作るとき埋め込みモデルの選択を左右するのは、リーダーボードの順位ではなく次元、最大入力長、接頭辞の規約、多言語対応の表記、そしてリランカーとの役割分担です。この記事は2026-08-12に確認した埋め込み・リランカーモデルの実際のカード値を整理し、MTEBのスコアが何を語らないのか、日本語や韓国語の文書を扱うときに何を自分で測るべきかを説明します。オープンモデルガイドシリーズ第3回です。
2026-08-12 · 12 分で読めます #ai#llm#huggingface#open-source-llm#embedding社内ナレッジベースをLLMで作るということ — 権限認識検索、鮮度、そして公開前の評価セット
Cerebrasが2026年7月15日に公開した社内ナレッジベース構築記は、1日15,000件を超える問い合わせを人間と自動化とエージェントが一緒に投げるシステムの内部構造を明らかにしています。しかし社内ナレッジベースでチームが実際に過小評価しがちなのは、チャンキングやリランキングではなく、権限、鮮度、削除伝播、そして真実源の衝突です。HR文書を漏らす検索はないほうがましで、すでに廃止されたランブックを自信満々に引用する検索はウィキより
2026-07-31 · 26 分で読めます #ai#rag#enterprise-search#llm#platform-engineeringRAGが的外れな答えを返すとき — 検索の失敗と生成の失敗を切り分けるデバッグ手順
RAGが誤った答えを出すと、たいていはプロンプトから直しにかかりますが、実際の原因の多くは検索段階にあります。正解チャンクを手で入れてみるという一度の実験で検索の失敗と生成の失敗を切り分ける手順から始め、チャンキングがなぜ最もよくある犯人なのか、埋め込み類似度が意味的類似度と分かれる地点とBM25の混合がしばしば勝つ理由、リランキングが値打ちを出す条件、チャンクに文書タイトルとメタデータを付けたときの効果を整理しました。最後にゴールデン
2026-07-26 · 23 分で読めます #llm#rag#retrieval#chunking#evaluationLLM APIのコスト最適化 — 出力トークン、プロンプトキャッシング、ルーティングの損益分岐計算
LLM APIの請求書を半分にする作業は勘ではなく算数です。出力トークンの単価が入力の数倍という構造のせいで、最大のレバーはほぼ常に出力長の制御であり、その次がプロンプトキャッシングです。キャッシングが接頭辞しか捕まえられないという制約がプロンプトの配置順をどう強制するのか、RAGと全文投入の損益分岐がどこにあるのか、モデルルーティングの削減率の公式とそれに伴う精度の損失を同じ単位でどう測るのかを整理しました。月額コストをシミュレーショ
2026-07-26 · 21 分で読めます #llm#cost-optimization#prompt-caching#rag#model-routingRAG・ファインチューニング・ロングコンテキスト — 自分の問題には何を使うべきか:論文が実際に測ったもの、そして誰も測っていないもの
LLMアーキテクチャで最も頻繁に出る質問ですが、大半の答えは出典のない意思決定ツリーです。本稿は測定されたものだけで答えます。ファインチューニングが新しい知識の注入に失敗することは複数の論文で繰り返し測定されており(Ovadiaら、Gekhmanら)、正反対に見える農業のケーススタディは実は別の介入(教師なし継続事前学習 vs 教師ありQ&Aチューニング)を測ったものなので、矛盾ではありません。ロングコンテキストは位置・長さ・語彙という
2026-07-17 · 43 分で読めます #rag#llm#fine-tuning#long-context#aiGraph RAG とは何か — ベクトルRAGが行き詰まる場所と、コストに見合う瞬間
RAGの標準レシピ(チャンク→埋め込み→上位k件の検索)は、答えが一つのチャンクに収まっているときはよく効きますが、マルチホップの質問や、コーパス全体を貫くグローバルな「センスメイキング」質問では構造的に行き詰まります。MicrosoftのGraphRAGはこの2つの死角を狙い、LLMでコーパスから知識グラフを抽出し、Leidenアルゴリズムでコミュニティを検出して要約を事前生成します。そのうえでグローバルな質問はコミュニティ要約のマッ
2026-07-15 · 15 分で読めます #rag#graph-rag#knowledge-graph#ai#llmプロダクション RAG パターン — 素朴な RAG が失敗する理由と、実際に効く技法
デモ用の RAG は半日で作れますが、プロダクションで静かに壊れる場所は、たいてい生成ではなく検索です。本稿はチャンキング、埋め込みとハイブリッド検索(BM25 + ベクトル)、リランキング、コンテキスチュアル・リトリーバル、クエリ書き換え、そして評価を、それぞれ何であり・いつ効き・何を代償に払うのかで整理します。Anthropic のコンテキスチュアル・リトリーバルの数値のように出典のある数字だけを引用し、RAG は魔法ではないこと、
2026-07-11 · 18 分で読めます #ai#rag#llm#retrieval#embeddingsAIエンジニアになる方法 完全ガイド2026 — LLM・RAG・エージェント・Evals・キャリアロードマップ
AIエンジニアになるための2026年完全ガイド。MLエンジニアとの違いから、LLM API、プロンプトエンジニアリング、RAG設計、エージェント構築、LoRAファインチューニング、vLLMサービング、Evals中心の開発、フレームワークとベクトルDBの選び方、コスト最適化、ポートフォリオ5選、日本・韓国・グローバルの採用市場と面接対策まで一気に整理します。
2026-07-02 · 44 分で読めます #ai-engineer#career#llm#rag#ai-agentsSOTAテキスト埋め込みモデル分析 — 検索とRAGの心臓
テキスト埋め込みは検索とRAGシステムの心臓です。対照学習とInfoNCE、デュアルエンコーダ、ハードネガティブ、E5/BGE/GTE系列、Matryoshka表現学習、MTEBベンチマークまで、最新埋め込みモデルの原理と実務適用を整理します。
2026-06-30 · 33 分で読めます #ai-papers#embedding#retrieval#rag#contrastive-learningコンテキストエンジニアリング — AIエージェントに記憶を設計する方法
プロンプトエンジニアリングの時代が終わり、コンテキストエンジニアリングが中核スキルとして浮上しました。コンテキストウィンドウの経済学、メモリ階層の設計、会話から事実を自動抽出してユーザープロフィールを構築するパターン、RAGとメモリの区別、compaction戦略、評価手法と落とし穴まで、実務の観点から整理します。
2026-06-12 · 28 分で読めます #ai#context-engineering#llm#ai-agent#memoryAIの言葉は誰の言葉か — ドイツ裁判所による Google AI Overviews 責任判決
2026年6月、ドイツの裁判所が Google AI Overviews を検索結果の羅列ではなく Google 自身の発話と分類し、虚偽回答への直接責任を認めました。判決の論理を解剖し、既存のプラットフォーム免責法理との衝突、AI 回答エンジンを作る開発者と企業が今すぐ点検すべき事項を整理します。
2026-06-12 · 41 分で読めます #ai#law#liability#rag#governanceベクトルデータベース 2026 完全ガイド - Pinecone・Weaviate・Milvus・Qdrant・Chroma・LanceDB・pgvector・Vespa・Turbopuffer 徹底解剖
2026年のベクトルデータベース市場はカンブリア爆発そのものだ。Pinecone serverless、Weaviate 1.27、Milvus 2.5、Qdrant 1.13、Chroma 0.5、LanceDB 0.20、pgvector 0.8、Vespa、Turbopufferまで — 10以上の陣営がそれぞれの意見を携えて市場に乗り込んできた。HNSWやDiskANN、IVF・PQ・SQのようなインデックスアルゴリズムから、q
2026-05-16 · 38 分で読めます #japanese#vector-database#pinecone#weaviate#milvusベクターデータベース 2026 完全ガイド - Pinecone · Weaviate · Qdrant · Milvus · pgvector · LanceDB · Chroma · FAISS · DiskANN 徹底解説
2026年5月時点、RAGとセマンティック検索を支えるベクターDBエコシステムを徹底的に整理する。Pinecone Serverless v3、Weaviate、Qdrant(Rust)、Milvus 2.5 + Zilliz、Chroma、LanceDB、pgvector + pgvectorscale + ParadeDB、Vespa、OpenSearch k-NN、Redis Vector、MongoDB Atlas Vector
2026-05-16 · 23 分で読めます #vector-database#pinecone#weaviate#qdrant#milvusノーコードAIビルダー2026完全ガイド - Flowise · Langflow · Dify · Coze · n8n AI · Rivet · Vectara · Promptflow · LlamaIndex 深掘り
2026年5月時点のノーコード/ローコードAIビルダー生態系を一本にまとめます。Flowise・Langflow・Dify・Cozeのグラフ型LLMビルダーから、Microsoft Promptflow・Vectara・LlamaIndex Cloud・Stack AI・Voiceflow・Botpress・Vellum・Humanloop、そしてLangSmith・Langfuse・Helicone・Arize Phoenixの可観測
2026-05-16 · 46 分で読めます #japanese#no-code-ai#flowise#langflow#difyLLM論文キュレーション 2024-2026 - Llama・DeepSeek・Qwen・Mistral・Phi・RLHF・DPO・CoT・RAG・FlashAttention・vLLM 詳細ガイド
LLMを構築し運用するエンジニアのための2024-2026必読論文30+本キュレーション。基盤モデル(Llama 3/4、DeepSeek-V3/R1、Qwen3、Mistral、Phi-4、Gemma 3)、学習革新(MoE、MLA、GQA)、ポストトレーニング(RLHF、DPO、ORPO、KTO)、推論(CoT、ToT、GRPO)、エージェント(ReAct、SWE-Agent)、検索(RAG、GraphRAG、ColBERT)、効率
2026-05-16 · 25 分で読めます #llm#papers#llama#deepseek#qwenローカルAI & オンデバイスLLM 2026 完全ガイド — Ollama · LM Studio · Jan · Msty · Open WebUI · GPT4All · AnythingLLM · Faraday 徹底解説
2026年5月、ローカルAIはもはや「趣味」ではない。M4 Max MacBook ProがLlama 4 Scout 109B MoEを毎秒24トークンで動かす時代だ。Ollama、LM Studio、Jan、MstyのようなデスクトップランタイムがGUI/CLIを統一し、Open WebUI、AnythingLLM、LibreChatがChatGPT級のインターフェースを提供する。バックエンドはllama.cpp、MLX-LM、vL
2026-05-16 · 28 分で読めます #local-ai#on-device-llm#ollama#lm-studio#janグラフDB & ナレッジグラフ 2026 完全ガイド — Neo4j 5 · ArangoDB · Memgraph · TigerGraph · Amazon Neptune · Apache AGE · Kuzu · FalkorDB · Dgraph · GraphRAG 徹底解説
2026年5月時点のグラフデータベースとナレッジグラフ生態系を一気にまとめます。Neo4j 5、ArangoDB、Memgraph、TigerGraph、Amazon Neptune、Apache AGE、Kuzu、FalkorDB、DgraphなどのグラフDB、GraphDB・Stardog・Virtuoso・Apache JenaなどのRDFトリプルストア、Cypher・GQL・Gremlin・SPARQLクエリ言語、Microso
2026-05-16 · 32 分で読めます #graph-database#knowledge-graph#neo4j#arangodb#memgraphエンタープライズAI検索 & 知識プラットフォーム2026完全ガイド - Glean・Guru・Coveo・Atlassian Rovo・Notion Atlas・Microsoft 365 Copilot・Slack AI 徹底解説
2026年エンタープライズAI検索市場の全体地図。社内の知識がSlack・Confluence・Drive・Notion・Jira・Salesforceに散らばる時代に、RAG over corporate dataがどう従業員の生産性を変えるのか。Glean(2024年2.6億ドル調達、評価額46億ドル)、Microsoft 365 Copilot(席あたり月30ドル)、Atlassian Rovo、Notion Atlas、Slac
2026-05-16 · 28 分で読めます #enterprise-search#glean#guru#coveo#atlassian-rovo