タグ: #llm
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 208 件
みんなのためのAI 第1回 — 1600万パラメータの言語モデルを15分でゼロから学習させる
GPU 1枚で言語モデルをゼロから学習させます。TinyStories データセットと1600万パラメータのデコーダ専用トランスフォーマーで、15分で読める英語の童話を生成しました。因果マスクがなぜ必要か、重み共有が何を節約するのか、perplexity 8 が実際にどんな文章を意味するのかを、実際の学習ログと生成結果で確認します。RTX 3090 実測。
2026-08-19 · 15 分で読めます #ai#llm#transformer#pytorch#hands-onAIエンジニア会議の英語: 分からないと言いながら信頼を失わない方法
AIチームの会議でいちばんよく必要になる英語は、確信を表す言葉ではなく、不確実性を信頼感をもって表す言葉です。評価結果とその限界を一緒に伝えること、原因がまだ不明な回帰の報告、指標は上がったのに品質は上がっていないとき、ラベリングの意見の相違、コストと遅延のトレードオフ、研究の日程と製品の日程の衝突、非技術の利害関係者への不確実性の説明、他人の実験への異議、再現できないときまで、場面別の表現を整理しました。ヘッジ表現の強さの目盛りと、ア
2026-08-16 · 50 分で読めます #english#business-english#meeting#ai#llmQwen3.8-27Bのハイブリッドアテンション — 64層のうちKVキャッシュを積むのは16層だけ
27Bのモデルが26万トークンのコンテキストをノートパソコンで扱える理由は、パラメータ数ではなく層の構成にあります。Qwen3.8-27Bは64層のうち48層を線形アテンション(Gated DeltaNet)に、16層だけを通常のアテンションに配置し、KVキャッシュが伸びる層そのものを4分の1に減らしました。この構造が何を節約して何を失うのか、FP8ブロック量子化はどこに効くのか、そしてローカル推論を検討するとき実際に計算すべき値は何か
2026-08-14 · 13 分で読めます #llm#inference#quantization#local-llm#attention分類せずに作り出せという技法とその検証 — 偽ラベルが元の問い合わせより良い理由
数百項目の分類体系をプロンプトに入れる代わりに、小さなモデルにもっともらしい偽の分類を作らせ、それを埋め込みで実際の分類に結び付ける技法が議論されました。なぜこれが動きうるのかは埋め込み空間の非対称性で説明されます。ただし原文には測定結果がなく、コメントにはこの技法が本当に元の問い合わせを直接埋め込むより良いのかを問う正確な反論と、より安い代替が並びました。何をどう測るべきかまで整理します。
2026-08-14 · 14 分で読めます #llm#embedding#classification#search#retrievalGemini 3.7 Flashの導入価格と3週間サイクル — モデル原価を固定費ではなく条件付きの値として扱う理由
Gemini 3.7 Flashの発表で実務者が見るべきはベンチマークの上げ幅ではなく、2つの事実です。1つは特定の日付で単価が2倍になる導入価格の構造、もう1つは直前のモデルが3週間前に出たという点です。2つが重なると、モデル原価は固定費ではなく期限付きの条件付きの値になります。公開されたベンチマークが何と比較し何と比較していないのか、そして発表で最後まで公開されなかった2つの数字がなぜアーキテクチャを決める数字なのかを整理します。
2026-08-14 · 12 分で読めます #llm#cost-optimization#benchmark#api-design#capacity-planningCerebras Ultrafastとエージェントループのボトルネック — 毎秒750トークンでも減らない時間
CerebrasとOpenAIが毎秒最大750トークンを出す推論ティアを公開しました。発表文が挙げる原理は演算量ではなくデータ移動であり、重みをウェハ上のSRAMに置く方式です。なぜバッチ1のデコードがメモリ帯域に縛られるのか、公開された倍率が何を測り何を測っていないのか、そしてトークン生成が速くなっても減らない時間が自分のエージェントループで何パーセントかを計算する方法を整理します。
2026-08-14 · 13 分で読めます #llm#inference#hardware#latency#performanceいま注目のオープンソース (1) AIエージェントとLLMツール
LLMアプリケーションのスタックは、推論サーバー、オーケストレーション、ゲートウェイ、エージェント、RAGへと層が分かれました。各層で実際に使われているオープンソース12件を、スター数の順位ではなく役割ごとにまとめて紹介します。プロジェクトごとに何を置き換えるのか、成熟度はどの程度か、どんな状況で使ってはいけないのかも併せて整理し、リポジトリのパスとライセンス、スター数、最近のプッシュ日は2026年8月12日にGitHubで直接確認した
2026-08-12 · 9 分で読めます #open-source#llm#ai-agent#ai-platform#ragハーネスエンジニアリングとは何か — モデルは固定入力、デプロイするのはその周り全部です
同じモデルを使っているのに、なぜチームごとにエージェントの成果が違うのでしょうか。ほとんどのチームにとってモデルは固定入力であり、実際にデプロイしているのはツール表面、失敗の返し方、ループと停止条件、コンテキストポリシー、権限、評価者まで、モデルを取り囲むハーネス全部です。ハーネスエンジニアリング連載の第1回として、ハーネスの定義と6つのつまみ、そしてプロンプトエンジニアリングという名前がこの仕事を過小評価する理由を整理しました。
2026-08-12 · 10 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트ツール表面の設計 — スキーマ1行が成功率を動かします
ツールを増やしたのにエージェントの成功率が下がる、という事態は珍しくありません。ツール表面はエージェントのインターフェースであり、名前・説明・パラメータ・失敗の返し方・応答サイズのすべてが設計対象です。ハーネスエンジニアリング連載第3回では、ツール数の呪い、ネームスペーシングと説明文、ポカヨケなパラメータ、失敗を返す形式まで、ツール表面の設計を整理しました。
2026-08-12 · 10 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트ループ設計 — 無限ループと早すぎる諦めの間
エージェントのループは2方向に失敗します。同じ呼び出しを何十回も繰り返す無限ループと、最初の障害で諦める早すぎる停止です。ハーネスエンジニアリング連載第4回では、再試行上限、固定ステップ・目標チェック・確信度という3つの停止条件、確信度ベース停止の落とし穴、そして人間やサブエージェントへのエスカレーションまで、ループ設計を整理しました。
2026-08-12 · 10 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트ハーネスエンジニアとして成長する — なぜ生まれた職務で、何を練習すべきか
ハーネスエンジニアという肩書きは求人票にはまだ珍しいものの、その仕事はエージェントをデプロイするすべてのチームにすでにあります。ハーネスエンジニアリング連載の最終回である第8回では、この職務がなぜ生まれたのか、既存のソフトウェア技能がどう再配置されるのか、そして観測と指紋から自己改善ループまで、ハーネスRPGの6ティアで段階的に練習する経路を整理しました。
2026-08-12 · 8 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트評価者のボトルネック — 弱い採点者がシステム全体の上限になります
ハーネスをどれだけ直してもスコアが動かないなら、ボトルネックはハーネスではなく評価者かもしれません。測定できない品質は選択できず、だから弱い採点者がシステム全体の上限になります。ハーネスエンジニアリング連載第5回では、スモークテストからユニットテスト、ルーブリック、採点データの隔離、牽制指標のパネルまで、評価者のはしごと、評価の較正を先にすべき理由を整理しました。
2026-08-12 · 9 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트リワードハッキング — 指標は上がるのに課題は失敗します
エージェントにとってテストを通す最も安い方法がテストを書き換えることなら、エージェントはそうします。リワードハッキングはバグではなく、私たちが定義した目標の正確な最適化の結果です。ハーネスエンジニアリング連載第6回では、採点基準の緩和やassertionの削除といったよくある形、権限の隔離が消してくれる半分、そして牽制指標の設計まで、リワードハッキングへの対応を整理しました。
2026-08-12 · 9 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트ハーネス指紋とバージョン管理 — 記録なき変更を追跡可能にする
プロンプトのコミットもモデル変更もないのに成功率が動いたなら、何をロールバックすべきでしょうか。ハーネスエンジニアリング連載第7回は、ハーネスを構成するすべての決定を正規化したハッシュひとつに要約するハーネス指紋を扱います。指紋に何を入れて何を外すか、なぜ指紋が同じでなければ比較が成立しないのか、そして指紋の履歴でリグレッションを二分探索してロールバックする方法まで整理しました。
2026-08-12 · 9 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트韓国の開発ブログ名文キュレーション 3 — AIとML実務、直接開いて確認した14本
AIとMLを実務で扱う韓国語記事から、具体的で再現可能な14本を選びました。LangChainによるRAGパイプラインの全工程、埋め込みとベクトル類似度から見た意味検索の原理、ベクトルデータベース7種の比較、pgvectorからQdrantへの移行記録、OllamaからvLLMへ移してスループットを上げた過程、LLMサービングの指標のトレードオフ、使用量トラッカーの自作記、Transformer論文のレビューとコード実装、BERTの整理
2026-08-12 · 24 分で読めます #curation#큐레이션#ai#llm#ragコンテキスト予算 — 何を入れるかではなく何を外すかが設計です
コンテキストウィンドウにはまだ余裕があるのに、エージェントの正確さは落ちていきます。コンテキストは有限の注意予算であり、ツールのスキーマもその予算を食います。ハーネスエンジニアリング連載第2回では、プロンプト累積をプレイブックに変える方法、ドロップポリシーとコンパクションの基準、サブエージェント委任の本当のコストまで、コンテキスト予算の設計を整理しました。
2026-08-12 · 10 分で読めます #llm#agent#harness-engineering#하네스엔지니어링#AI에이전트テキスト生成オープンモデルをサイズ別に選ぶ
オープンなテキスト生成モデルを選ぶとき、サイズは性能の等級ではなく配置の制約です。この記事はオンデバイス向けの小型、GPU1枚に載せる中型、サーバが必要な大型に分け、各区分で実際に確認したモデルのパラメータ、コンテキスト、ライセンスを整理し、MoEのメモリ計算がなぜ違うのか、コンテキスト拡張がなぜ無料ではないのか、カードが要求する実行条件を無視すると何が壊れるのかを説明します。オープンモデルガイドシリーズ第2回です。
2026-08-12 · 11 分で読めます #ai#llm#huggingface#open-source-llm#text-generationライセンスと配備: 類型の読み方と量子化配布物の出所確認
オープンモデルのlicenseフィールドに書かれた短い識別子は目次にすぎず、実際の条件は全文にあります。この記事は2026-08-12に実際に出会ったライセンス類型を整理し、コミュニティライセンスと非商用条件が何を求めるのか、ゲートの掛かったリポジトリが配備パイプラインでなぜ問題になるのか、そしてGGUFのような量子化配布物の出所をどう確認すべきかを説明します。オープンモデルガイドシリーズ最終回の第8回です。
2026-08-12 · 12 分で読めます #ai#llm#huggingface#open-source-llm#licenseコードモデルの選び方: 補完と対話、FIM、ライセンス
コードモデルは、エディタ内でカーソル位置を埋める補完用と、質問に答える対話型という別の製品です。この記事は2026-08-12に確認したオープンなコードモデルのパラメータ、コンテキスト、FIM対応の記載、ライセンスを整理し、ベースモデルに対話をさせるとなぜ失敗するのか、コードモデルでライセンスがなぜ特に慎重を要するのかを説明します。オープンモデルガイドシリーズ第7回です。
2026-08-12 · 12 分で読めます #ai#llm#huggingface#open-source-llm#code-llm韓国語に対応するオープンモデルとトークナイザのコスト
韓国語対応という表記は、その言語を処理するという意味であって上手だという保証ではありません。この記事は2026-08-12に確認した韓国語特化・バイリンガル・多言語のオープンモデルのカード値を整理し、トークナイザが韓国語をどう分割するかがなぜそのままコストとコンテキスト消費になるのか、そしてそれを自分で測る方法を説明します。韓国語モデルで特に分かれるライセンス類型も扱います。オープンモデルガイドシリーズ第4回です。
2026-08-12 · 11 分で読めます #ai#llm#huggingface#open-source-llm#korean-nlp