tag

#LLM

このタグが付いた記事

Index

count=90
  1. AI / ML

    PydanticAI 2.55.0 公開、Conversation 型と統一キャッシュ設定

    PydanticAI 2.55.0 が 10 月 9 日公開。会話状態を跨いで持ち運べる Conversation 型と、プロバイダ横断で有効化できる cache 設定が入った。Postgres 製のステップ / メディアストアや Claude Haiku 5.5 サポートも追加されている。

    github.com ↗
  2. AI / ML

    Anthropic Python SDK v1.12.0、Haiku 5.5 と型付きツール呼び出しを追加

    Anthropic 公式 Python SDK v1.12.0 が 10 月 7 日に公開されました。新モデル claude-haiku-5-5 を正式サポートし、コンピュータ操作・ブラウザツールの呼び出しに型が付与。Managed Agents の web_fetch に url_sources、/v1/models にライフサイクルフィールドが入り、API 側で露出した新機能を SDK から扱えるようになっています。

    github.com ↗
  3. AI / ML

    Claude Haiku 5.5 公開、価格 75% 減

    Anthropic が小型モデルの新世代 Claude Haiku 5.5 を公開。Haiku 4.5 比で平均 75% 安く、effort 設定にも対応して用途に応じた品質・コストの調整が可能になった。

    anthropic.com ↗
  4. AI / ML

    Meta、Muse Spark で未解決の数学 5 問を解答

    Meta は Muse Spark 1.1 / 1.2 の Thinking Mode を用いて確率論・偏微分方程式・群論など 6 分野で数学者と共著論文を公開し、うち 5 本は各分野の未解決問題への解答と位置付けました。

    runtimewire.com ↗
  5. AI / ML

    Google、新フロンティア「Gemini 4 Argon」を発表

    Google DeepMind は 9 月 30 日に Gemini 4 Argon を公開した。1M トークンの出力枠と長時間の推論を売りに、Google AI Ultra と API から段階ロールアウトする。

    blog.google ↗
  6. AI / ML

    Anthropic、Sonnet 5.5 を発表 30% 高速化と最大 30% 低コスト

    Anthropic が Claude 5.5 ファミリー第 2 弾となる Sonnet 5.5 を公開しました。従来の Sonnet 5 と比べて出力が 30% 以上高速化し、同じ処理を最大 30% 少ないトークンで完了できるため実質コストが下がります。価格自体は Sonnet 5 と同一で、Claude Code や AWS・Google Cloud・Azure でも即日利用できます。

    anthropic.com ↗
  7. AI / ML

    Anthropic、Claude Opus 5.5 を投入 通常業務で 40% コスト削減

    Anthropic は 9 月 22 日、次世代フラッグシップ Claude Opus 5.5 を公開しました。長時間走るエージェント型コーディングと知識作業を主眼に据え、Opus 5 比で入出力単価を 20% 引き下げ、キャッシュ読取は 60% 減。1M トークン文脈を維持し、AWS・GCP・Azure から利用できます。

    techcrunch.com ↗
  8. AI / ML

    OpenAI、GPT-6 Sol と Luna を半額で公開 API 料金は恒久値下げ

    OpenAI は 9 月 22 日、GPT-6 系列の中位・下位モデル Sol と Luna を公開し、API 料金を GPT-5.6 世代のプロモーション価格からさらに半額以下に引き下げました。フラッグシップ Astra の学習手法を継承しつつコーディングとエージェント精度を底上げしたと説明されています。

    techcrunch.com ↗
  9. AI / ML

    xAI、2.1 兆パラメータの Grok 4.7 を公開 コーディング特化で待ち行列なし

    xAI は 9 月 21 日、コーディングと知識作業向けの推論モデル Grok 4.7 を公開しました。パラメータ数は前世代 1.5 兆から 40% 増の 2.1 兆で、Grok アプリ・Cursor・Grok Build・xAI API から待ち行列なしで即時利用可能。入力 $2/百万トークンの価格は据え置きで、倍速の Fast バリアントも提供されます。

  10. AI / ML

    OpenAI、IAS に数学助言グループ設置 100超の未解決問題を解決と発表

    OpenAI は 9 月 21 日、プリンストン高等研究所 (IAS) に独立助言グループを設置。内部モデルが Navier-Stokes 方程式に続き 100 件以上の長年の未解決数学問題を解決したと発表しました。ゴワース、ウィッテン、ヴァキルら 9 人の著名数学者が参加します。

    openai.com ↗
  11. AI / ML

    StepFun、600B MoE の Step 5 Preview を公開 オープンウェイトは 10 月 15 日

    中国の StepFun が 9 月 20 日、総パラメータ 600B / アクティブ 27B の疎な MoE フラッグシップ「Step 5 Preview」を公開しました。1M トークン文脈と入力 $1 / 出力 $2.70(1M 当たり)の API 提供が同日開始され、フルウェイトは 10 月 15 日にオープンリリース予定と告知しています。

    pandaily.com ↗
  12. AI / ML

    OpenAI、法務特化「Astra for Law」を発表

    OpenAI が GPT-6 Astra を米国法務向けに調整した「Astra for Law」を発表。専用の法務検索インデックス、書式やプライバシー設定、26 種類のパートナー・プラグインを備え、まずは Trusted Access で選定した米国法律事務所へ提供します。

    openai.com ↗
  13. AI / ML

    Claude Code の週次上限、9/14 から実質 17% 減

    Anthropic は 9/14 から Claude Code の週次上限を「May 以前比で +25%」の恒久値に固定。5 月から続いた +50% の暫定枠と比べると実質 17% の削減となる。

  14. AI / ML

    Sakana AI、Fugu Max と Fugu Ultra v2 を公開 マルチエージェント志向

    東京拠点の Sakana AI が 9 月 11 日、マルチエージェントオーケストレーションモデルの Fugu Max と Fugu Ultra v2 を公開しました。Ultra v2 は複雑推論と自律研究で性能を伸ばし、Max は入力 100 万トークン 2 ドル・出力 6 ドルでフロンティア勢の出力単価を 40〜60% 下回ります。Nvidia Nemotron などオープンウェイトも取り込みます。

    sakana.ai ↗
  15. AI / ML

    Anthropic、7 領域の Claude 悪用を報告する 9 月脅威インテリジェンスを公開

    Anthropic は 9 月 10 日、Claude を用いた悪用を 7 領域で無効化したと報告書を公開しました。ロシア Midnight Blizzard 系列のウクライナ狙い自動化攻撃、湖南省長沙の中国系グループによる約 50 組織への攻撃などを列挙し、8 か月分の対応をまとめています。

    anthropic.com ↗
  16. AI / ML

    DeepSeek、V4.1 Flash 限定ベータ公開 マルチモーダル新アーキ

    DeepSeekが中間モデルV4.1 Flashの限定ベータを公開。新アーキで画像も基本入力として扱い、9月10日前後に正式リリース予定。beta料金はV4 Flashと同水準。

    technode.com ↗
  17. AI / ML

    Sumitomo・Sakana AI・SCSKが日本産AI普及で包括提携

    住友商事とSCSK、Sakana AIの3社が包括業務提携。住友のクライアント約10万社にSakana AIのモデルを届け、金融・製造・重要インフラでの導入を進める。

    asia.nikkei.com ↗
  18. AI / ML

    OpenAI、1 万エージェントで Navier–Stokes 問題の証明を 88 時間で導出と発表

    OpenAI は 9 月 8 日、内部の AI モデルが約 1 万の並列エージェントを協調させ、Clay 数学研究所のミレニアム懸賞問題 Navier–Stokes 方程式の有限時間特異点の証明を 88 時間で導いたと発表しました。証明の Lean 形式化も同時公開されていますが、査読は未実施です。

    openai.com ↗
  19. AI / ML

    AI 大手 4 社が新モデル連発、CNBC が「モデル疲れ」を報告

    Anthropic・Google・Meta・OpenAI が 1 週間のうちに相次いで新 LLM を投入した状況を、CNBC が 9 月 6 日付の記事で「モデル疲れ (model fatigue)」と表現し、企業の IT 部門が比較検討に追われている実情を伝えた。

    cnbc.com ↗
  20. AI / ML

    Microsoft、MAI-Transcribe-2 を公開 60 言語 FLEURS 首位・音声 1 時間 0.10 ドル

    Microsoft AI は 9 月 3 日、音声認識モデル MAI-Transcribe-2 を発表しました。60 言語の FLEURS ベンチマークで首位となる平均単語誤り率 5.2%、話者分離・単語単位タイムスタンプ・スタイル指定に対応しつつ、価格は音声 1 時間あたり 0.10 ドルとし、OpenAI・Google・ElevenLabs の同種サービスを下回る水準に設定しました。

    microsoft.ai ↗
  21. AI / ML

    Meta、Muse Spark 1.3 を公開 1M コンテキストのエージェント型コーディングモデル

    Meta は 9 月 2 日、コーディング・エージェント特化型モデル Muse Spark 1.3 を発表しました。1M トークンのコンテキストウィンドウを維持しつつ、Muse Spark 1.2 比でツール呼び出しが約 20%、トークン消費が約 25% 削減。価格は据え置きで Muse Code と Meta Model API 経由で即日提供されました。

  22. AI / ML

    OpenAI、GPT-6 Astra を Daybreak 参加組織に限定リリース ChatGPT 全プランへ順次展開

    OpenAI は 9 月 3 日、次期フロンティアモデル GPT-6 Astra をサイバーセキュリティ連合 Daybreak 参加組織向けに限定リリースしました。ChatGPT Plus / Pro / Business / Enterprise、および OpenAI API と AWS には 9 月 5 日から順次展開される予定です。

    9to5mac.com ↗
  23. AI / ML

    Google、Gemini 3.8 Flash 公開 6 週で 3 度目の Flash 更新

    Google は 9 月 2 日、Flash ティアの最新モデル Gemini 3.8 Flash を公開。Terminal-Bench 2.1 で 90.8% と 3.7 Flash から大きく前進し、AI Studio と Gemini Enterprise Agent Platform で一般提供を開始しました。サイバーセキュリティ特化の Cyber 変種も併せて発表しています。

    9to5google.com ↗
  24. AI / ML

    Anthropic、Claude Fable 5.1 / Mythos 5.1 を公開 キャッシュ読み取りコスト 75% 減

    Anthropic は 9 月 1 日、コーディング・知識労働・長時間タスク向けに刷新した Claude Fable 5.1 と、制限付きアクセスで提供する Mythos 5.1 を発表。プロンプトキャッシュ読み取り単価を 100 万トークンあたり 1.00 ドルから 0.25 ドルへ 75% 引き下げ、Fable 5 比で通常ワークロード約 25%、エージェント用途で最大 45% のコスト削減を主張しています。

    anthropic.com ↗
  25. AI / ML

    OpenAI、Astraを「Critical」認定 限定提供へ

    OpenAI が次期モデル Astra を自社 Preparedness Framework の Critical サイバー能力レベルに初認定。攻撃的サイバー機能は cybersecurity coalition「Daybreak」参加組織のみに限定して提供する。

    cnbc.com ↗
  26. AI / ML

    AI チャットボット、海外プロパガンダに強い NPR × NewsGuard 検証で誤情報反証率が検索を上回る

    NPR と NewsGuard は 8 月 30 日、中国・イラン・ロシア発の 30 件の偽情報を ChatGPT / Gemini / Copilot / Meta AI / Grok / Claude の 6 種主要チャットボットで検証した結果を公表。約 4 分の 3 で正しく反証し、Google / Bing / DuckDuckGo / Yandex の検索結果よりも高いスコアを示した。

    npr.org ↗
  27. Tech 政策

    Sony Music と Warner Chappell が Anthropic を提訴 楽曲歌詞の無断学習と海賊版利用を告発

    Sony Music Publishing と Warner Chappell Music など 35 の音楽出版社が 8 月 28 日、Claude の学習に楽曲歌詞を無断利用したとして Anthropic を米カリフォルニア北部地区連邦地裁に提訴。故意侵害 1 作品あたり最大 15 万ドルの法定損害賠償を請求している。

    techcrunch.com ↗
  28. AI / ML

    Nvidia、Hugging Face を約 129 億ドルで買収へ オープンソース AI ハブを傘下に、OpenAI・Anthropic 追撃の足場

    Nvidia が Hugging Face を約 129 億ドル (約 1.9 兆円) で買収する方向で最終調整に入ったと 8 月 26 日から複数媒体が報じました。オープンソースの LLM / 拡散モデルを公開する最大のハブを取り込むことで、閉源の OpenAI・Anthropic に対する開放系エコシステムの中核を Nvidia が自ら握る形になります。両社は 2023 年のシリーズ D (評価額 45 億ドル) 以来の資本関係で、今回はほぼ 3 倍の値付け。The Information はディール成立、Business Insider は「合意間近だが未署名」と温度差があり、公式アナウンスはまだありません。

    techcrunch.com ↗
  29. AI / ML

    Z.ai、正体不明モデル『Ox Alpha』を GLM-5.3-Flash として MIT 公開 320B/A18B のマルチモーダル MoE

    Z.ai は 8 月 26 日、OpenRouter と OpenCode に 8 月 20 日から匿名で登場していた無料モデル『Ox Alpha』が、GLM-5 系初のネイティブマルチモーダルモデル GLM-5.3-Flash であることを認めました。320B パラメータの MoE (アクティブ 18B)、1,048,576 トークンのコンテキスト、画像・動画入力に対応し、モデルウェイトを MIT ライセンスで Hugging Face に公開しています。

  30. AI / ML

    Google の開放型モデル Gemma、累計 10 億 DL 到達 派生 10 万件超

    Google DeepMind の開放型モデル群 Gemma が、公開約 2 年で累計 10 億ダウンロードに到達した。外部開発者による派生モデルは 10 万件を超え、Google は代表的なプロジェクトを集約する Awesome Gemma リポジトリを GitHub で公開した。

    blog.google ↗
  31. AI / ML

    Alibaba、Qwen 3.8-27B の重みを Apache 2.0 で公開 262K トークン対応

    Alibaba Qwen チームが 8 月 14 日、270 億パラメータのマルチモーダル密モデル Qwen 3.8-27B をオープンウェイトで公開。ネイティブ 262K コンテキスト、Apache 2.0 で商用利用可、コンシューマ GPU で動作。

  32. AI / ML

    Apple、中国向け AI モデルを Alibaba と共同開発 — 外国企業初認可

    Apple が中国市場向けに独自開発した LLM を Alibaba と共同で仕上げ、中国政府から外国企業として初めて自社 AI モデルの提供承認を得た。Apple Intelligence の中国展開に向けた重要な布石となる。

    macrumors.com ↗
  33. AI / ML

    Z.ai、GLM-5.3 を公開 — ポストトレのみでオープン最強コーディング、サイバー能力は想定超え

    中国の Z.ai は 8 月 14 日、大規模言語モデル GLM-5.3 を公開しました。ベースモデルは 743B の GLM-5.2 のまま据え置き、性能向上はすべてポストトレの拡大 (タスク環境の量・種類・訓練長) に由来します。長時間コーディング指標の Terminal-Bench 3.0 が 4.6 から 28.3 に跳ね上がる一方、サイバーセキュリティ能力が Z.ai の当初想定を上回って伸びたため、モデル重みの公開はセーフティ評価後 (約 2 週間後) に延期されました。

  34. AI / ML

    Google DeepMind、Gemini 3.7 Flash を公開 コーディング特化で 3.6 の半額 0.75 ドル/1M 導入価格

    Google DeepMind は 8 月 13 日、Gemini 3.7 Flash を公開しました。3.6 Flash からわずか 3 週間での投入で、コアの推論基盤にアルゴリズム改善を加え、コーディング/エージェント用途で顕著な性能向上を打ち出しています。導入価格は入力 0.75 ドル/1M・出力 3.75 ドル/1M と 3.6 Flash 発表時の半額。1M トークン文脈と可変 thinking 設定は据え置きです。

    blog.google ↗
  35. AI / ML

    Meta、単体 GPU で動く 30B オープンモデル Muse Glimmer を Apache 2.0 で公開

    Meta Superintelligence Labs は 8 月 10 日、30B パラメータのエージェント特化オープンモデル Muse Glimmer を Apache 2.0 で公開。4bit 量子化により 24GB VRAM の単体コンシューマ GPU / Mac 上でオフライン動作するよう最適化されている。

  36. 開発ツール

    rust-lang/rust、LLM 貢献ポリシーを採択

    Rust プロジェクトの 5 チームは 8 月 5 日、rust-lang/rust モノレポにおける LLM 利用の指針を採択しました。中核は『refine, not create』— LLM で回答・分析・要約・確認・提案・レビューは可、生成 (create) は不可。許容場面でも LLM 使用の開示を必須化。PR 著者、レビュアー、issue の起票者・コメンテーターに適用され、Rust プロジェクト全体の公式立場ではなく該当 5 チーム限定のルールとしています。

  37. AI / ML

    Alibaba、Qwen3.8-Max を公開 2.4 兆パラメータの MoE 来週オープンウェイト化

    Alibaba が 8 月 3 日、フラッグシップモデル Qwen3.8-Max を発表しました。総パラメータ 2.4 兆・アクティブ 95B の MoE 構成で、コンテキスト長は最大 100 万トークン。同社は来週のオープンウェイト公開と、より小型の Qwen3.8-27B の同時リリースも予告しています。

    scmp.com ↗
  38. AI / ML

    OpenAI、次期モデル「Astra」を披露 未解決の数学 10 問を Lean 4 で形式証明

    OpenAI は 8 月 1 日、次期主力モデルとする「Astra」の内部版が数学・理論計算機科学の 10 分野で未解決問題を解いたと公表した。全結果は Lean 4 の機械検証可能な証明として GitHub で公開されている。

    openai.com ↗
  39. 開発ツール

    MCP 仕様 2026-07-28 版が Release Candidate に、core を stateless 化しセッション概念を廃止

    Model Context Protocol の 2026-07-28 版 Release Candidate が公開。core を stateless 化し、`initialize` とセッションの概念を廃止した。ラウンドロビン LB 越しに任意サーバーインスタンスが任意リクエストを処理できるようになり、リモート MCP のスケール障壁が消える。

  40. Tech 政策

    Anthropic Amodei「オープンウェイト禁止に反対」 高性能モデルへの安全性テスト義務化を提唱

    Anthropic CEO Dario Amodei が 7 月 27 日、自社ブログで「オープンウェイトモデルの分類的禁止は主張していない」と明言。米 25 社「オープンウェイト連合」書簡を受けた形で立場を整理し、全高性能モデルへの安全性テスト義務化を提唱した。

    anthropic.com ↗
  41. セキュリティ

    Microsoft、初のサイバー特化 LLM「MAI-Cyber-1-Flash」と MDASH を投入

    Microsoft が 7 月 27 日、脆弱性探索特化 LLM「MAI-Cyber-1-Flash」とエージェント型サイバー防御ハーネス「MDASH」を発表。Anthropic Mythos・OpenAI・Google の同種モデルに真っ向勝負する構図。

    techcrunch.com ↗
  42. AI / ML

    Moonshot、Kimi K3 の 2.8T パラメータ全ウェイトを本日 UTC 0 時に公開

    中国 Moonshot AI が旗艦モデル Kimi K3 の完全ウェイトを 7 月 27 日 UTC 0 時 (JST 9 時) に公開。2.8T パラメータの Sparse MoE を MXFP4 で量子化しても約 1.4TB を要する史上最大級のオープンウェイトリリース。

    kimi.com ↗
  43. AI / ML

    Anthropic、Claude Opus 5 を公開。Fable 5 の半額で近い性能

    Anthropic が 7 月 24 日、日常利用向けを狙った Claude Opus 5 を公開。Fable 5 に近いフロンティア性能を半額の 5 ドル / 100 万入力トークンで提供し、コーディングとビジネス自動化のベンチで大幅改善を主張した。

    anthropic.com ↗
  44. AI / ML

    Reddit、Google の AI 学習利用停止検討で株 9% 安

    Wall Street Journal は 7 月 22 日、Reddit が Google との AI 学習データライセンス契約の更新交渉に難航し、Google のクローリング遮断も選択肢に検討していると報じた。年 6,000 万ドル規模とされる同契約は 2024 年締結。Reddit 株は 22 日に約 9% 下落した。

    qz.com ↗
  45. AI / ML

    Google、Gemini 3.6 Flash とサイバー特化モデルを公開

    Google DeepMind が 7 月 21 日、Gemini 3.6 Flash と 3.5 Flash-Lite、脆弱性発見に特化した 3.5 Flash Cyber の 3 モデルを同時公開。トークン使用量を 17% 削減し、Gemini 3.5 Pro の広範リリースと 4 系プレトレーニング開始も予告した。

    techcrunch.com ↗
  46. AI / ML

    Alibaba、Qwen 3.8-Max を WAIC でプレビュー公開

    Alibaba クラウド Qwen チームは 7 月 19 日、上海の WAIC 2026 でパラメータ数 2.4 兆の多モーダル基盤モデル「Qwen 3.8-Max-Preview」を公開しました。Moonshot Kimi K3 に続く中国発フロンティア級モデルで、コーディングやエージェント制御で従来モデルを上回るとしています。

  47. AI / ML

    Gemini 3.5 Pro また延期、コード性能を優先で「Flash」先行投入検討

    Google DeepMind が旗艦モデル Gemini 3.5 Pro の広範なリリースを再度延期したと 9to5Google が 7 月 16 日に報じました。コーディング性能と長尺推論が社内目標に届かず、代わりに軽量版 Flash の先行投入が検討されているといいます。

    9to5google.com ↗
  48. AI / ML

    Meta、コード特化 Muse Spark 1.1 を公開

    Meta Superintelligence Labs は 7 月 9 日、コーディングとエージェント処理に特化した新モデル「Muse Spark 1.1」を公開した。Meta AI 責任者の Alexandr Wang は複数のエージェント系ベンチマークで GPT-5.5 や Claude Opus 4.8 に並ぶ性能とし、API 料金は入力 100 万トークンあたり 1.25 ドル、出力 4.25 ドル。

    cnbc.com ↗
  49. AI / ML

    Anthropic、Claude 利用制限を全ユーザーへ即日リセット GPT-5.6 公開と同日

    Anthropic は 7月9日 (米国時間)、Claude ユーザー全員に対し 5 時間ごと・週次のレートリミットを即日リセットした。OpenAI が GPT-5.6 と ChatGPT Work を発表した同日というタイミングで、Opus 4.8 が subagent を過剰生成して枠を消費していた不具合修正も併記。競合との消耗戦を象徴する動きになった。

    itmedia.co.jp ↗
  50. AI / ML

    OpenAI「GPT-5.6 Sol/Terra/Luna」7月9日プレビュー公開 ⇒ Sol は $5/$30、サイバー特化

    OpenAI は GPT-5.6 シリーズの三モデル「Sol / Terra / Luna」のプレビューを公開し、7月9日 (米国時間) から広範な一般提供を開始すると発表。6月の 20 社限定プレビュー (既報 6月26日) を経て、米政府主導の顧客別承認から標準リリースに移行します。

    openai.com ↗
  51. AI / ML

    xAI・Cursor 共同開発「Grok 4.5」7月9日一般公開 ⇒ Opus 級を $2/$6 で提供

    Elon Musk 率いる xAI は Cursor と共同開発したフラグシップ AI モデル「Grok 4.5」を 7月9日 (米国時間) に一般公開すると発表。6月の $600 億買収合意後の初の共作で、Anthropic Claude Opus 4.8 級性能を入力 $2 / 出力 $6 per 1M tokens の低価格で提供します。

    bloomberg.com ↗
  52. AI / ML

    中国製 AI モデル、OpenRouter で最大 46% ⇒ DeepSeek 17.6% 首位、米企業のトークン消費が中国系へ大きくシフト

    CNBC が 7 月 7 日に報じた OpenRouter 集計データによると、米国企業が同ルーティング基盤で消費するトークンのうち、中国製 AI モデルが 2 月 8 日以降 30% 超を維持し、直近では最大 46% に達しました。前 12 か月平均は 11% で、DeepSeek 単独では 17.6% を占め首位に立ちます。オープンウェイト中国モデルの価格が米国製の 6-9 割安である点が最大要因です。

    cnbc.com ↗
  53. AI / ML

    Tencent、Hunyuan「Hy3」を Apache 2.0 で公開 ⇒ 295B MoE / 21B active / 256K context

    Tencent は 7月6日、Hunyuan シリーズの新型オープンモデル「Hy3」を Apache 2.0 ライセンスで公開しました。総 295B パラメータの MoE で 21B active、256K コンテキストの hybrid fast/slow-thinking 型。初日から Hugging Face・ModelScope で配布され、OpenRouter でも 7月21日頃まで無償 API 呼び出しが可能。Preview 版比で hallucination 12.5% ⇒ 5.4% に低下と主張しています。

    venturebeat.com ↗
  54. AI / ML

    Anthropic Claude Fable 5、7月7日から usage credits へ切替 ⇒ Pro/Max の一時同梱終了

    Anthropic は 7月1日に再展開した Claude Fable 5 について、Pro / Max / Team / 一部 Enterprise 向けに提供していた「週次上限の 50% まで利用可」の同梱期間を 7月7日で終了しました。7月8日以降、Fable 5 は usage credits (メータ課金) 経由でのみ利用でき、API 料金は入力 $10 / 出力 $50 (per MTok)、現行モデル中最も高価な位置付けとなります。

  55. セキュリティ

    新型モジュラー型マルウェア「Avalon」、CrownX ランサム機能と LLM 経由の C2 を統合

    The Hacker News は 7月3日、これまで未報告のモジュラー型マルウェアフレームワーク「Avalon」を報じました。認証情報窃取・横移動・回復妨害・ランサム化 (CrownX) をワンストップで実行し、C2 は攻撃者の自然言語を Groq の公開 LLM API でシェルコマンドに変換する新設計です。

  56. AI / ML

    Meta の次期基盤モデル「Watermelon」、GPT-5.5 に追いつく ⇒ Wang CAO が社内 town hall で説明

    Meta の Alexandr Wang チーフ AI 責任者は 7月2日の社内 town hall で、訓練中の次期モデル「Watermelon」が主要ベンチマークで OpenAI GPT-5.5 に並んだと従業員に伝えました。前モデル Avocado と比べて計算量は 10 倍規模で、コーディングと agentic 能力の底上げを狙います。

  57. セキュリティ

    Palo Alto Unit 42 が "phantom squatting" 警告 LLM が創作した架空ドメインを攻撃者が先取り登録

    Palo Alto Networks Unit 42 は LLM が幻覚で吐き出す実在しないドメインを攻撃者が先回りで登録しフィッシング拠点化する新手法 "phantom squatting" を報告しました。913 ブランドを対象とした調査で 210万 URL が生成され、うち約 25万件が未登録で狙われうる状態にあります。

  58. AI / ML

    Meituan、1.6T パラメータの LongCat-2.0 を OSS 公開 ⇒ 国産チップで学習

    中国 Meituan が agentic coding 向け 1.6 兆パラメータのオープンモデル LongCat-2.0 を公開。事前学習・推論ともに国産 AI アクセラレータで完結したと主張し、SWE-bench Pro で GPT-5.5 を上回る数値も報告。

  59. AI / ML

    Anthropic、Claude Sonnet 5 を投入 ⇒ エージェント運用の低価格化を狙う

    Anthropic が中位モデル Sonnet 5 を発表。エージェント性能で Opus 4.8 に迫りつつ、入力 2 ドル / 出力 10 ドル (100 万トークン) の導入価格で agent ワークロードのコスト削減を狙う。

    techcrunch.com ↗
  60. AI / ML

    Sakana AI「Sakana Fugu」公開 複数モデルを束ね Mythos 超え謳う

    東京の Sakana AI が複数 AI モデルを協調動作させるマルチエージェントシステム「Sakana Fugu」と上位版「Fugu Ultra」を 6 月 22 日に一般提供開始。一部ベンチマークで Claude Mythos Preview や Fable 5 を上回ると主張する。

    sakana.ai ↗
  61. AI / ML

    元 OpenAI 組「In the Weights」公開、AI 知名度を可視化

    TechCrunch は 6 月 20 日、元 OpenAI の Thomas Dimson 氏と Joey Flynn 氏が立ち上げた「In the Weights」を取り上げました。Web 検索を介さず Grok / Gemini / GPT / Claude / Llama 等が自分や任意の人物をどれだけ「思い出せる」かを採点する、LLM 時代のエゴサ的サービスです。

    techcrunch.com ↗
  62. AI / ML

    Z.ai が GLM-5.2 をオープンウェイト公開、コーディングで GPT-5.5 を上回る

    中国 Z.ai が 6 月 16 日、長期コーディングタスク向けに最適化した 753B パラメータの LLM「GLM-5.2」を MIT ライセンスでオープン公開し、Artificial Analysis のオープンウェイト総合首位に立ちました。

  63. AI / ML

    IBM、LLM 駆動の進化アルゴリズム OpenEvolve で量子誤り訂正符号 465 件を発見

    IBM Research は 6 月 13 日、LLM を仮説生成器に据えた進化アルゴリズム フレームワーク「OpenEvolve」を公開し、これを使って量子誤り訂正 (QEC) 符号の候補 465 件を発見したと発表しました。AlphaEvolve や FunSearch の系譜に連なる手法で、ライブラリは GitHub にオープンソース公開されています。

  64. AI / ML

    Mistral AI、€30 億調達協議で評価額 €200 億 欧州 AI の主役狙う

    仏 Mistral AI が新たに €30 億 (約 $35 億) を調達する協議に入ったとブルームバーグが 6 月 12 日に報じました。評価額は約 €200 億で、2025 年 9 月の Series C 時点 €117 億から半年余りで約 2 倍。米中勢との計算資源競争に投入する見込みです。

    techcrunch.com ↗
  65. AI / ML

    Anthropic、Mythos 級「Claude Fable 5」を一般公開 SWE-Bench Pro で 80.3%

    Anthropic は 6 月 9 日、これまで限定公開だった Mythos 級モデルを一般化した「Claude Fable 5」を発表。SWE-Bench Pro で 80.3% を達成し、サイバー / 生物・化学領域では Claude Opus 4.8 へ自動フォールバックする安全機構を内蔵する。

    anthropic.com ↗
  66. AI / ML

    Microsoft、自社製推論モデル MAI-Thinking-1 を公開

    Microsoft AI が Build 2026 で初の自社製推論モデル MAI-Thinking-1 を発表。OpenAI 由来の蒸留に頼らず一からトレーニングし、AIME 2026 で 94.5%、Sonnet 4.6 を上回る人手評価結果を示した。

    microsoft.ai ↗
  67. AI / ML

    MiniMax、中国A株上場へ ARR 3億ドル超で猛追

    中国の AI スタートアップ MiniMax が上海証券取引所への A 株上場に向けた指導届出を提出。ARR は 3 億ドルを超え、Hong Kong に続く 2 拠点目の上場で AI 大規模モデル分野の A 株第 1 号を Zhipu と競う。

    bloomberg.com ↗
  68. AI / ML

    リコー、図表入り日本語 LLM 評価ベンチ公開

    リコーは図表を含む日本語業務文書に対する LLM の多段推論能力を評価するベンチマーク JDocQA Reasoning Benchmark を無償公開。全 1,287 問、20 種類以上の図表サブセットを内包する。

    jp.ricoh.com ↗
  69. セキュリティ

    marimo 侵害、LLM 主導で内部 DB 流出

    Sysdig は CVE-2026-39987 経由で marimo を侵害した攻撃者が、LLM エージェントを主役に 4 段ピボットを 1 時間で完走させ、内部 PostgreSQL を盗み出した事例を初公表した。

  70. AI / ML

    Claude Opus 4.8 公開、コーディング性能と正直さ強化

    Anthropic は Claude Opus 4.7 の後継となる Claude Opus 4.8 を公開。エージェントコーディングが 69.2% に向上し、自己進捗の正直さも改善。価格は据え置き。

    anthropic.com ↗
  71. AI / ML

    DeepSeek、V4-Pro の API 価格 75% 引き下げを恒久化

    DeepSeek が 5 月 23 日、旗艦モデル V4-Pro の 75% 値下げを 5 月末で終了せず恒久化すると発表。API 単価は最大 4 分の 1 となり、AI の価格競争が新たな局面に入りました。

    engadget.com ↗
  72. AI / ML

    Anthropic、Glasswing 初月で重大脆弱性 10,000+ 件を確認 — Mythos Preview のスキャン結果公開

    Anthropic は 5 月 22 日、4 月発表の Project Glasswing の初期アップデートを公開し、Claude Mythos Preview と約 50 のパートナーが運用開始からおよそ 1 ヶ月で重大度 High / Critical の脆弱性 10,000 件超を発見したと明らかにした。OpenBSD で 27 年間見過ごされていたバグや FFmpeg の 16 年もののバグ、Firefox 150 で修正された 271 件などが具体例として挙げられている。

    anthropic.com ↗
  73. AI / ML

    Google、Gemini 3.5 ファミリー始動 — まず 3.5 Flash 公開、Pro 超え+4倍速で $1.5/$9 価格

    Google は I/O 2026 で次世代モデル群 Gemini 3.5 を発表し、最初の出荷モデル『3.5 Flash』を即日公開した。前世代 3.1 Pro をコーディング・エージェント系ベンチで上回りつつ出力速度は 4 倍。3.5 Pro は来月投入予定。

    blog.google ↗
  74. AI / ML

    東芝、人事システム「Generalist」V8 を提供開始 — MCP 対応で LLM と業務データ連携

    東芝デジタルソリューションズは統合人事給与システム Generalist/HR/PR の新バージョン V8 を 5 月 19 日に提供開始。Model Context Protocol (MCP) 対応で社内 LLM と業務データを安全に接続でき、自然言語で検索条件を提案する人財検索 AI 機能も搭載する。

    nikkei.com ↗
  75. セキュリティ

    Ollama に重大 OOB read 脆弱性 CVE-2026-7482『Bleeding Llama』⇒ 約 30 万台のサーバにメモリ漏えいリスク

    Cyera が 5 月初旬に公表したローカル LLM 実行基盤 Ollama の脆弱性 CVE-2026-7482『Bleeding Llama』が、5 月 10 日に The Hacker News などで本格的に報じられました。GGUF テンソル解析処理のヒープ OOB read で、未認証リモート攻撃者がプロセスメモリを丸ごと漏えいさせることが可能。インターネット公開中の約 30 万台が影響を受けると見られ、修正版は 0.17.1。

  76. AI / ML

    OpenAI、ChatGPT 標準を「GPT-5.5 Instant」へ刷新 ⇒ 幻覚を 52.5% 削減

    OpenAI は 5 月 5 日、ChatGPT の標準モデルを GPT-5.5 Instant に刷新したと発表。医療・法律・金融など高リスク領域の幻覚を GPT-5.3 比で 52.5% 削減し、過去会話・ファイル・Gmail を参照する強化パーソナライズと、絵文字を控えた簡潔な応答を打ち出しました。

    techcrunch.com ↗
  77. AI / ML

    xAI、Grok 4.3 と『Custom Voices』を公開 1 分の音声でクローン作成

    xAI が 5 月 2 日に Grok 4.3 を公開し、約 1 分の音声から 2 分以内にクローン音声を生成する『Custom Voices』機能を同時投入。28 言語・80 種以上のプリセット音声と同じ TTS / 音声エージェント API から呼び出せ、xAI コンソール上では追加課金なしで利用可能。

    venturebeat.com ↗
  78. AI / ML

    Reddit、AI 検索の週間 8000 万人到達 Q1 売上は前年比 69% 増 6.63 億ドル

    Reddit が 5 月 1 日に発表した 2026 年 Q1 決算で、検索の週間アクティブユーザーが 8000 万人 (前年比 +30%) に到達した。同社の AI 検索エンジン Reddit Answers の週間利用者は 1 年で 1500 万人へ拡大、売上は 6.63 億ドル (前年比 +69%)、広告売上 6.25 億ドル (同 +74%) と Wall Street 予想を上回った。

    techcrunch.com ↗
  79. Tech 政策

    中国・杭州中級法院、AI 置換目的の解雇は違法と判断 LLM 導入で減給拒否の社員勝訴

    中国・浙江省の杭州中級人民法院が 4 月 30 日、コスト削減のみを目的に従業員を AI に置き換えて解雇することは違法とする判断を示したと報道された。LLM 導入で業務が自動化された QA 監督の Zhou 氏が大幅減給と配置転換を拒んで解雇された事案で、下級審の違法判決を維持。AI 導入だけでは労働契約終了の正当事由とならないと明確化した。

  80. AI / ML

    主要 LLM は『日本文化』に偏る 欧州チームが 24 言語で検証、ITmedia が報道

    スペインのバスク大学と英カーディフ大学の研究チームが、GPT-4o-mini など 8 つの主要 LLM が文化を語る際に日本に強く偏る傾向を実証した論文を公開した。24 言語 31,680 問のベンチマーク『CROQ』で検証したところ、事前学習段階では各国を均等に参照していたモデルが、人間向けの安全・有用化チューニング後に日本と米国へ集中する分布へ変化したという。ITmedia が 4 月 30 日に内容を報じた。

    itmedia.co.jp ↗
  81. AI / ML

    NVIDIA、マルチモーダル MoE モデル Nemotron 3 Nano Omni を公開

    NVIDIA が 4 月 28 日(米時間)、テキスト・画像・動画・音声を 1 つの推論ループで扱うオープンマルチモーダル基盤モデル Nemotron 3 Nano Omni を公開した。Mamba と Transformer を組み合わせた Hybrid MoE 構成により、総 30B パラメーターから推論時に 3B のみを活性化し、128 個のエキスパートから 6 個へ動的にルーティングする。重み・データ・学習レシピのいずれも開放し、Hugging Face と build.nvidia.com から直接利用できる。

  82. AI / ML

    Mistral、128B モデル Medium 3.5 と Vibe Remote Agents 公開

    Mistral AI は 4 月 29 日、フラグシップ密モデル Mistral Medium 3.5(128B、256k コンテキスト)と、クラウド上で長時間コーディングを並列実行する Vibe Remote Agents を公開した。SWE-Bench Verified 77.6% を記録し、改変済み MIT のオープンウェイトとして Hugging Face で配布する。

    mistral.ai ↗
  83. セキュリティ

    LLM 推論基盤 LMDeploy に SSRF 脆弱性 ⇒ 公開 13 時間で実環境悪用

    OpenMMLab の LLM 推論サーバ LMDeploy に Server-Side Request Forgery 脆弱性 CVE-2026-33626 が公開された。Sysdig のハニーポットには 13 時間以内に攻撃が到達。

  84. AI / ML

    DeepSeek V4 Preview 公開 ⇒ 1M 文脈と MoE 両建てでフロンティアに肉薄

    中国 DeepSeek が V4-Pro / V4-Flash をプレビュー公開。1M トークン文脈と MoE、MIT ライセンスでの Hugging Face 配布が特徴。

    techcrunch.com ↗
  85. AI / ML

    OpenAI、GPT-5.5 を公開 ⇒ 1M 文脈とエージェント特化

    OpenAI が 4 月 23 日に GPT-5.5 を公開。1M トークン文脈と複数ツール連携を活かしたエージェント用途に特化し、API 価格は GPT-5.4 比で倍の 5 / 30 ドルに設定された。

    openai.com ↗
  86. セキュリティ

    Ollama の量子化エンジンに未認証メモリ漏洩、CVE-2026-5757 で公表

    CERT/CC が Ollama の量子化エンジンにある未認証のリモート情報漏洩脆弱性 CVE-2026-5757 を公表。GGUF ヘッダの改竄でヒープメモリを読み出し、レジストリ API で外部に送出できる。

    kb.cert.org ↗
  87. ハードウェア

    Google、第 8 世代 TPU を学習用と推論用に分割 ⇒ TPU 8t / 8i を発表

    Google Cloud Next 2026 で発表された第 8 世代 TPU は、学習向けの TPU 8t と推論向けの TPU 8i の 2 SKU 構成。自社開発の Axion ARM CPU をホストに据え、Ironwood 比で大幅な性能向上を謳う。

    blog.google ↗
  88. セキュリティ

    Cohere の Python サンドボックス Terrarium に CVSS 9.3 の脱出脆弱性

    Cohere AI が公開する Python サンドボックス Terrarium に、ホスト上での root 権限コード実行を許す重大な脱出脆弱性 CVE-2026-5752 が報告された。

  89. AI / ML

    OpenAI、画像生成「Images 2.0」を発表 多言語テキスト描画が大幅向上

    OpenAI が ChatGPT の画像生成を刷新する「Images 2.0」を 4 月 21 日に公開。推論モード搭載で 2K 出力に対応し、日本語など非ラテン文字の描画精度が大幅に向上した。

    techcrunch.com ↗
  90. AI / ML

    Anthropic、最強モデル「Claude Mythos」と Project Glasswing を発表

    Anthropic が公開を見送る未公開フロンティアモデル Claude Mythos と、重要インフラ防御を狙う Project Glasswing を発表。50 組織に gated access を提供する。

    anthropic.com ↗