タグ: #ai
GPU・LLM・MLOps・Kubernetes、そしてマインドセット · 214 件
同じ会社の二つのプロジェクトがAI寄与に正反対の結論を出した理由
OpenJDKは2026年4月に生成AIで作った寄与を全面的に禁止し、同じオラクル傘下のGraalVMは同じ時期にAIコーディングアシスタントの使用を明示的に許可しました。二つのプロジェクトは同じ寄与者協定を使っています。この記事は三つの文書を並べて読みます。OpenJDKの原文、GraalVMの方針ファイル、そして両方が参照したLinuxカーネルの文書です。結論は、この違いがAIに対する態度の違いではなく、レビューの負担を誰に請求する
2026-08-09 · 15 分で読めます #culture#open-source#ai#policy#code-review摩擦が消えると目利きが残るのではなく、目利きを育てる道が消えます
2026年8月に話題になったエッセイ Taste Is All That Is Left は、作ることが安くなるにつれて、何を作る価値があるのかを判断する能力だけが希少になったと言います。この記事はその診断に同意しつつ、もう一歩踏み込みます。目利きは努力という濾過装置の副産物であり、濾過装置が消えれば目利きが自動的に残るのではなく、目利きを育てていた経路が一緒に消えます。ですから必要なのは摩擦を意図的に復元する具体的な習慣であり、個人と
2026-08-09 · 14 分で読めます #career#craft#ai#code-review#mentoringLLMができないのは証明ではなく前提を立てることです
ICML 2026の立場論文 Position: LLMs can not jump は、生成AIが帰納をすでにマスターし演繹も急速に征服しつつある一方で、新しい説明仮説を作り出すアブダクションには構造的に到達できないと主張します。この記事はその主張を要約する代わりに、それが事実だと仮定したときに、いま私たちが作っているシステムの設計をどう変えるべきかを扱います。仮説空間をどこから供給するのか、提案と反証をなぜ分離すべきなのか、そしてこ
2026-08-09 · 15 分で読めます #ai#llm#reasoning#abduction#research評価駆動開発で最初に較正すべきなのは審査者です
Airbnbエンジニアリングが2026年7月に公開した評価駆動開発の振り返りは、評価セットを先に書けという話ではなく、採点する側のモデルがまず計測器として認められなければならないという話に近いものです。この記事は、審査者モデルをゴールデンセット50〜100件で較正する手順、一致度を単純な正確度ではなくカッパで測るべき理由、そして較正されていない審査者がどうやってチーム全体を誤った方向へ最適化させてしまうのかを、実行可能なコードとともに整
2026-08-09 · 16 分で読めます #ai#llm#eval-driven-development#llm-as-judge#evaluationコードは難しい部分ではなかったという言葉が、なぜあれほど腹立たしいのか
2026年8月にHacker Newsの上位を占めたあるエッセイは、コードはもともと難しい部分ではなかったという言葉がすべてのプログラマーへの侮辱だと主張します。この記事はその反論に同意しつつ、理由を別のところに見ます。あの文が腹立たしいのは間違っているからではなく、コードという単語の意味を途中ですり替えるからです。コードを三つの層に割れば、双方の主張がそれぞれどこで真なのかが見え、自分のチームが実際どの層に時間を使っているのかも測れま
2026-08-09 · 15 分で読めます #career#craft#ai#engineering-culture#skills任せることで失うもの — 自動化が実力を削る仕方は一様ではありません
電卓を使って罪悪感を覚える人はいませんが、AIに書かせた文書を送った後は、たいていの人が少し落ち着かなくなります。その非対称性がこの記事の問いです。オフロードが純粋な利得である領域、実際に能力を削ると測定された領域、そして今の知識労働の大半が置かれている曖昧な中間を分けて見ていきます。航空分野の自動化依存研究は通念と違うものを発見し、自動化バイアス研究は訓練では防げないと語ります。退屈を任せることと判断を任せることがなぜ別種の決定なのか
2026-08-02 · 29 分で読めます #humanities#ai#cognition#automation#skill機械がくれる慰めは本物か — 問いを変えるべき理由
人は実際にAIと会話した後、気分が良くなります。それを錯覚だと切り捨てるのは、失礼であるだけでなく不正確です。この記事は、応答性がなぜケアのように感じられるのか、チャットボットを使ったメンタルヘルス研究が実際に何を示し、何を示していないのかを、臨床試験の設計まで踏み込んで検討します。そして本当に問うべきなのは「この慰めは本物か」ではなく「何を代替しているのか」だと提案します。補完としての慰めと代替としての慰めは、同じ行動でありながら、ま
2026-08-02 · 31 分で読めます #humanities#ai#psychology#loneliness#relationships道具か、相手か — 意識の問いを保留にしたままでも言えること
人がAIの前でまず手に取る問いは「これに意識はあるのか」です。最も難しい問いであり、おそらく最も役に立つ問いではありません。この記事はその問いを閉じずに脇に置き、観察できることから始めます。道具が文章で答え始めたとき何が変わったのか、擬人化がなぜシステムではなく私たちについての事実なのか、イライザ効果が示すものと示さないものは何か、そして答えがどちらに転んでも変わらない一つの非対称性について書きます。
2026-08-02 · 29 分で読めます #humanities#ai#philosophy#cognition#technology26Bモデルを2GBのRAMで動かす原理 — 常駐メモリとワーキングセットは同じ数字ではない
2026年7月29日にShow HNへ上がったTurboFieldfareは、Gemma 4 26B-A4BをMシリーズのMacで約2GBのRAMで動かすと主張しています。ディスクには14.3GBが入り、RAMに常駐するのは1.35GBの共有コアだけで、トークンごとに必要なエキスパートの重みをSSDから読み込みます。この記事はその数字たちを自分で導出して検証します — 4ビットのグループ64量子化がなぜ重みあたり4.5ビットになって14
2026-07-31 · 20 分で読めます #ai#llm#quantization#apple-silicon#moe500ドルでファインチューニングした9Bがフロンティアに勝った条件 — そしてその条件がどれだけ狭いか
2026年7月28日、Hacker Newsで336点を獲得した記事があります。FermisenseがQwen3.5-9BをGRPOで約500ドル分のGPU時間だけ学習させ、同じツールと同じ採点器を使った五つのフロンティア構成を電子商取引カタログ検収の課題で上回ったという報告です。達成可能スコアの87.3%対、最高フロンティア76.9%。1,000件の処理コストは約0.50ドル対、19ドルから172ドルでした。この記事はその結果を否定も
2026-07-31 · 19 分で読めます #ai#llm#fine-tuning#reinforcement-learning#inference-costGPT-5.6とコストパフォーマンスの限界 — 曲線の上で自分のワークロードの位置を見つける方法
OpenAIが2026年7月30日にGPT-5.6 Lunaの価格を80%、Terraを20%下げました。7月9日の正式リリースから3週間後で、最上位のSolの価格は据え置きです。Lunaは100万トークンあたり入力1ドル・出力6ドルから、入力0.20ドル・出力1.20ドルになりました。この記事は値下げ幅を紹介する代わりに曲線を計算します — 値下げ後の三つのティアの単価比が両軸ともちょうど25対10対1に固定され、系列の中ではトークン
2026-07-31 · 20 分で読めます #ai#llm#openai#inference-cost#prompt-cachingGCCのAI方針とオープンソースの選択 — 15行という境界線は何を守ろうとしているのか
2026年7月29日、GCC運営委員会がAI方針作業部会の勧告を受け入れました。核心は、法的に重要な貢献にLLM生成コンテンツが含まれる、またはそれに由来する場合は受け付けないというもので、その基準線はGNUメンテナーガイドラインのおよそ15行です。ただしテストケースは例外で、研究・分析・バグ発見・パッチレビューにLLMを使うこと自体は制限せず、AI補助作業にはAssisted-byトレーラーを要求します。この記事は方針の実際の要求事項
2026-07-31 · 23 分で読めます #ai#open-source#gcc#licensing#governance偽の著者名を持つ論文が口頭発表に採択された — AI時代のピアレビューにおけるシステム的失敗の分析
2026年7月30日、二人のレビュアーが今夏担当した機械学習系学会の投稿22本のうち15本で、捏造された引用、実在しない著者、または明白なLLM生成の痕跡を見つけたと公開しました。うち二本は実在する論文の著者名を架空の名前に差し替えて引用しており、リジェクト意見と組織委員会への直接通報にもかかわらず、「幻覚の参考文献だけ直せばよい」という条件で口頭発表に採択されました。この記事は怒りではなくシステムの失敗としてこの事件を読みます。フラグ
2026-07-31 · 25 分で読めます #ai#peer-review#research-integrity#llm#academiaリファクタリングの経済学、コストはいつ回収されるか — 変更頻度で計算する方法
2026年7月30日にmartinfowler.comに掲載されたThe Economic Benefit of Refactoringは、約1万7千行のモジュールを15段階でリファクタリングしながら、同じ変更要求を毎回繰り返し実行し、入力トークンが159,564個から27,360個へと83パーセント減少することを測定しました。興味深い実験ですが、著者自身が単一の実験であり、グリーンフィールドのアプリ一つに限られると釘を刺しています。こ
2026-07-31 · 29 分で読めます #refactoring#engineering#technical-debt#ai#metricsGemini Robotics 2とロボット基盤モデル — 全身制御が実際に変えるもの
2026年7月30日、Google DeepMindがGemini Robotics 2を公開し、ヒューマノイドのつま先から指先までを一つのビジョン・ランゲージ・アクションモデルで制御すると発表しました。一緒に公開された数字は興味深いことに自慢ではなく現状の正直な記録に近いものです — 電球を緩めるのに92パーセント、締めるのに36パーセント、床から物を拾うのに45.7パーセント。この記事はVLAが実際に何なのか、全身制御がなぜ上半身操
2026-07-31 · 25 分で読めます #ai#robotics#vla#foundation-models#evaluation蒸留で転移するものとしないもの — DeepSeekをGPT-OSSに蒸留したら検閲は付いてこなかった
2026年7月30日にShow HNへ上がったCTGTの実験は、DeepSeek V4 Flashを教師、GPT-OSSを生徒として金融推論能力を蒸留したところ、能力は移ってきたのに政治的検閲は移ってこなかったと報告しています。対応ペア152組で教師はセンシティブな質問と対照群のあいだに45.45点の検閲ギャップを示しましたが、生徒は0.43点と3.94点でベースラインにとどまりました。この記事はその実験ひとつを拡大せず、出発点としてだ
2026-07-31 · 22 分で読めます #ai#llm#distillation#alignment#open-weightsAIが6月のたった1か月で2年分のChromeバグを直した方法 — 1,072という数字の読み方
2026年7月30日にGoogleが発表した内容によれば、6月にリリースされたChrome 149と150の2バージョンだけで1,072件のセキュリティバグを修正し、これは過去2年間・23のマイルストーンで修正した1,036件を上回ります。その中には13年以上コードベースに潜んでいたサンドボックスエスケープのバグもありました。この記事は見出しの数字ではなくメカニズムを見ます — 2023年のLLMベースのファズターゲット生成から、202
2026-07-31 · 22 分で読めます #ai#security#chrome#fuzzing#vulnerabilityAIエージェントを本番で運用するということ — 冪等性、予算、そして自信満々の誤答
エージェントをプロトタイプから本番へ移すとき、遅れて見つかる運用面があります。リトライされたツール呼び出しの冪等性、予算とステップ上限、非決定的な制御フローの可観測性、ツール単位の権限境界、そしてエージェントが自信満々に間違えたときのエスカレーション経路です。最近GeekNewsのAsk GNに投稿された分析は、ベンチマークのトレース6,780件から重複ツール実行8,042件を見つけ、そのうち159件は状態を変えるツールが実際に重複リソ
2026-07-31 · 29 分で読めます #ai#agents#observability#reliability#mcpプロンプトで3D CADを作るということ — メッシュとB-rep、そして制約条件というボトルネック
GeekNewsのShow GNに、プロンプトで3D CADモデルを作るツールCAIDが投稿されました。作った本人が自ら明かした限界がこの分野全体の状態を正確に要約しています — 寸法の自動検証がなく、公差とDFMと加工性を判断できず、出力物をそのまま製造に使ってはいけない検証済みプロトタイプにすぎないということです。エンジニアリングの視点からの問いは一つです。CADはパラメトリックで制約ベースなのに、メッシュを生成することと編集可能な
2026-07-31 · 22 分で読めます #ai#cad#llm#manufacturing#geometry社内ナレッジベースをLLMで作るということ — 権限認識検索、鮮度、そして公開前の評価セット
Cerebrasが2026年7月15日に公開した社内ナレッジベース構築記は、1日15,000件を超える問い合わせを人間と自動化とエージェントが一緒に投げるシステムの内部構造を明らかにしています。しかし社内ナレッジベースでチームが実際に過小評価しがちなのは、チャンキングやリランキングではなく、権限、鮮度、削除伝播、そして真実源の衝突です。HR文書を漏らす検索はないほうがましで、すでに廃止されたランブックを自信満々に引用する検索はウィキより
2026-07-31 · 26 分で読めます #ai#rag#enterprise-search#llm#platform-engineering