タグ: #retrieval
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 7 件
練習の構造:うまくいく練習と残る練習が違う理由
間隔をあけること、検索練習、混ぜて練習すること。学習研究のなかで根拠が比較的しっかりしている三つを、効果量とあわせて整理しました。そしてこの分野の中心にある逆説を扱います。練習の最中の遂行をもっともよくする条件と、あとまで残るものをもっとも多くする条件が互いに違うということ。自分で組んだ練習が気分はよいのに伸びない理由が、ここにあります。
2026-08-16 · 26 分で読めます #mindset#learning#practice#retrieval#spacing分類せずに作り出せという技法とその検証 — 偽ラベルが元の問い合わせより良い理由
数百項目の分類体系をプロンプトに入れる代わりに、小さなモデルにもっともらしい偽の分類を作らせ、それを埋め込みで実際の分類に結び付ける技法が議論されました。なぜこれが動きうるのかは埋め込み空間の非対称性で説明されます。ただし原文には測定結果がなく、コメントにはこの技法が本当に元の問い合わせを直接埋め込むより良いのかを問う正確な反論と、より安い代替が並びました。何をどう測るべきかまで整理します。
2026-08-14 · 14 分で読めます #llm#embedding#classification#search#retrieval100倍安いという主張は課題を狭めたときにだけ真です — 検証と損益分岐
2026年8月に公開されたある事例記事は、40億パラメータ級のオープンモデルを強化学習で後学習し、検索課題でフロンティアモデルと肩を並べながらリクエストあたりのコストを桁単位で下げたと述べます。この記事はその主張を紹介するのではなく検証します。原文で実際に確認できる数字と確認できない数字を区別し、狭い課題でだけ成立する条件が何かを整理し、後学習がルーティングより有利になる損益分岐を自分で計算できるコードを付けました。
2026-08-09 · 14 分で読めます #llm#cost#fine-tuning#retrieval#open-modelsRAGが的外れな答えを返すとき — 検索の失敗と生成の失敗を切り分けるデバッグ手順
RAGが誤った答えを出すと、たいていはプロンプトから直しにかかりますが、実際の原因の多くは検索段階にあります。正解チャンクを手で入れてみるという一度の実験で検索の失敗と生成の失敗を切り分ける手順から始め、チャンキングがなぜ最もよくある犯人なのか、埋め込み類似度が意味的類似度と分かれる地点とBM25の混合がしばしば勝つ理由、リランキングが値打ちを出す条件、チャンクに文書タイトルとメタデータを付けたときの効果を整理しました。最後にゴールデン
2026-07-26 · 23 分で読めます #llm#rag#retrieval#chunking#evaluationプロダクション RAG パターン — 素朴な RAG が失敗する理由と、実際に効く技法
デモ用の RAG は半日で作れますが、プロダクションで静かに壊れる場所は、たいてい生成ではなく検索です。本稿はチャンキング、埋め込みとハイブリッド検索(BM25 + ベクトル)、リランキング、コンテキスチュアル・リトリーバル、クエリ書き換え、そして評価を、それぞれ何であり・いつ効き・何を代償に払うのかで整理します。Anthropic のコンテキスチュアル・リトリーバルの数値のように出典のある数字だけを引用し、RAG は魔法ではないこと、
2026-07-11 · 18 分で読めます #ai#rag#llm#retrieval#embeddingsSOTAテキスト埋め込みモデル分析 — 検索とRAGの心臓
テキスト埋め込みは検索とRAGシステムの心臓です。対照学習とInfoNCE、デュアルエンコーダ、ハードネガティブ、E5/BGE/GTE系列、Matryoshka表現学習、MTEBベンチマークまで、最新埋め込みモデルの原理と実務適用を整理します。
2026-06-30 · 33 分で読めます #ai-papers#embedding#retrieval#rag#contrastive-learningRAGパイプライン本番構築ガイド: ベクトルDB選定からチャンキング・リランキング・評価まで
RAG(Retrieval-Augmented Generation)パイプラインの本番構築を体系的に解説します。埋め込みモデル比較、ベクトルDB選定(Pinecone・Milvus・Weaviate・Qdrant・Chroma)、チャンキング戦略、ハイブリッド検索、リランキング、RAGAS評価メトリクス、障害対応まで実践的なノウハウを提供します。
2026-03-11 · 22 分で読めます #llm#rag#vector-database#retrieval#embedding