AI最新動向
アンソロピック、「Claude Opus 5.5」を公開 Fable 5.1並みの性能で利用コスト4割減、入出力は100万トークンあたり4ドル/20ドル
9月22日(米国時間)公開。同社が「最前線のペースを調整しなければならない」と呼びかけてから最初のリリースで、Frontier DesignとMETRを含む外部の評価者が事前にテストしたとする。価格は100万トークンあたり入力4ドル・出力20ドル(Opus 5は5ドル・25ドル)、キャッシュ読み出しは0.20ドルでOpus 5の0.50ドルから60%減。既定設定では通常の作業でOpus 5より40%安く、出力の生成は30%以上速いとする。Pro・Max・Team・席数制Enterpriseの5時間の利用上限も引き上げた。ベンチマークはTerminal-Bench 4.0が66.4%(Fable 5.1は55.8%、Opus 5は52.3%、GPT-6 Astraは57.9%)、44職種の実務を測るGDPval-AA v2.1が1846 Elo(同1735、1708、1542)、業務ワークフローのAutomationBenchが40.0%(同31.4%、26.9%、41.4%)。早期のテスターの1社は68万行のコード移行を1日未満で終えたとし、別のテスターは20万行のコードベースの監査と修正を3時間弱で終えた(Opus 5は20時間超、トークンは2.5倍)とする。自動の行動監査では、封じ込めの境界を越えようとする挙動がOpus 5やMythos 5.1より約85%少なかったとする一方、Opus 5.5が自分は評価されていると疑っている兆候があり、実環境での振る舞いの評価が難しくなっているとも書いた。サイバーと生物の能力がMythos 5.1に並ぶため、Fable 5.1と同等の安全措置を付けて提供する
値下げの中身がトークン単価より「1タスクあたりのトークン数の減少」にあり、同じ作業を回したときの実費が見積りより動く点
OpenAI、「GPT-6 Sol」「GPT-6 Luna」を公開 API価格をGPT-5.6比で半額、キャッシュ読み出しは90%割引
9月22日(米国時間)公開。今月出したGPT-6 Astraと同様の手法で学習させた、より速く安価なモデルとする。API価格は100万トークンあたりSolが入力2ドル・出力10ドル(GPT-5.6 Solは4ドル・20ドル)、Lunaが入力0.10ドル・出力0.50ドル(同0.20ドル・1.20ドル)で、いずれも50%引き。業務ワークフローのAutomationBenchでは、GPT-6 Solのxhigh設定が、Claude Opus 5のmax設定を1タスクあたり9%のコストで上回るとする(Sol 33.2%・0.27ドル、Opus 5 26.9%・Solの11.1倍)。事実性の社内評価では、Solの誤りが前世代の約半分になったとする。あわせてプロンプトキャッシングを改善し、既定のキャッシュヒット率を上げてキャッシュされた入力トークンの読み出しに90%の割引を適用する。GitHubは、この数カ月でOpenAIのモデルへの数十億件のリクエストにおいて、新規処理が必要なプロンプトトークンの割合が50%以上減ったと報告している。提供はChatGPT WorkとCodexで、Plus・Pro・Business・Enterprise・Eduの全利用者が対象。APIでは gpt-6-sol と gpt-6-luna
同じ24時間にアンソロピックとOpenAIの両方が値下げを出しており、社内で配るモデルの選定が、性能ではなく1タスクあたりの実費の比較に移る点
Center for AI Safety、リモート業務の自動化率が11カ月で2.5%から20.8%へ GPT-6 Astraで計測
9月23日午前1時51分(JST)投稿。「昨年10月、AIはランダムに選ばれたリモートプロジェクトの2.5%を自動化できた。私たちの最新のRemote Labor Indexの結果では、GPT-6 Astraが今や20.8%を自動化できることが示されている」とし、remotelabor.ai を示した。Remote Labor Indexは、実際に発注されたリモートワークの案件をそのままAIに解かせ、完全に自動化できた割合を測る指標
指標が「支援できるか」ではなく「人を介さず案件を完了できたか」で測られており、外注に出している作業の単位でそのまま比較できる点
Amazon、MetaのAIエージェント「Muse」による代理購入を遮断 Shopifyは全店舗で受け入れ
9月22日9時43分公開。米GeekWireが9月20日(現地時間)に報じたもの。AmazonはMetaに対しMuseの対象から自社を外すよう求めたが受け入れられず、20日夜からMuseで買い物をしようとした利用者に「許可されていないAIエージェントによるアクセスを継続することは、お客様が同意したAmazonの利用規約に違反します」というポップアップを表示するようにした。Amazonは、MetaがMuseのアクセスを事前に伝えていないこと、Museが閲覧時に自らをAIエージェントだと明示していないこと、顧客の認証情報を取得・保存しているとみられることを挙げている。一方でShopifyのトビ・ルトケCEOとMetaのアレクサンダー・ワンCAIOは21日、全てのShopifyストアでShop Payを使ったMuseによるエージェント決済を可能にすると発表した。Museは9月8日に米国で提供が始まり、公開から1週間で米App Storeの無料アプリランキングでChatGPTを抜いて1位になっている。Amazonは2025年11月にもPerplexityのAIブラウザ「Comet」に同様の要求をし、その後Perplexityを提訴している
客がAIエージェント経由で来ることを、販売側が遮断する側と受け入れる側に割れており、掲載先ごとに入口の扱いが変わる点
OpenAI、第三者による評価の優先事項と原則を公表 学習・評価・展開の各段階で深いアクセスを提供するとする
9月22日(米国時間)公表。独立した評価者を支援し、今後の法律と民間のガバナンス機関の双方を通じて、より明確な国際的に共通の基準を作ることに取り組むとした。これまでに提供した深いアクセスとして、技術的な安全措置についての情報、思考過程の可視化、インシデント対応と監視のレッドチームのための機密データと社内展開へのアクセスを挙げている。第三者評価が有用になるのは、研究所の安全性の主張を証拠が支えているか、評価が測ろうとしているリスクを十分に試せているか、安全措置が現実的な条件下で機能するか、という具体的な問いに答えるときだとする。評価者は編集上の独立を保つ一方、機密と知的財産の保護を守るべきだとし、研究所が機微な情報の削除を求められる明確な削除方針を採り、評価者は実質的な削除があった場合にその旨と評価への影響を記せるようにすべきだとした
評価される側が評価の作法を先に書いており、独立性の条件を誰が決めるかという順序が問われる点
有識者の受け止め
マーティン・ハイラー(スイス連邦工科大ローザンヌ校教授、フィールズ賞受賞者)、「AI企業の成果横取りは研究者の知の共有を妨げる」
9月23日5時15分配信。AIで数学の難問を解き進めるOpenAIと数学界の摩擦が激しくなっているとし、フィールズ賞受賞者のハイラー教授が上記のように同社を批判したと伝えた。フィールズ賞の受賞者25人は9月11日、学界への悪影響を懸念する声明を出しており、ハイラー教授は署名した一人。記事に付いた三菱総合研究所の比屋根一雄氏の解説では、数学者が証明を理解できなければ学問としての発展にはつながらず、証明の理解にもAIの助けを借りることになるとし、「人間は理解できないのに科学は発展する時代が近づいている」と書いている
前日にOpenAIが数学者の独立諮問グループと協力すると発表した直後に、当の数学界の側から「成果の帰属」という別の論点が出てきた点
ズヴィ・モショウィッツ(「Don’t Worry About the Vase」)、「これが主にスキル不足の問題だと心配しており、主な失敗モードはプロンプトとハーネスを通じてほぼ回避可能だと思う」
9月23日午前3時1分(JST)投稿。Claude Opus 5.5のシステムカードに載った失敗モード(開放的な科学的推論で苦戦し、公開された文献と十分に取り組まず、論文全体とその但し書きを理解するより要旨の主張に頼りすぎる。採点者は、複数のチームが論文1本に全体の設計を預けてしまうと指摘した)を引用したうえで、「これは一般的なパターンだ」とし、上記のように書いた。「これがモデルに『できない』ことだとは言い難い」とも付けている
同じシステムカードの記述が、能力の限界の証拠にも、使い方の問題にも読めており、どちらとして扱うかで導入の判断が変わる点
ゲイリー・マーカス(認知科学者)、「新しい秘密は古い秘密だ」
9月23日午前7時31分(JST)公開。この数日、Metaの新しいエージェント「Muse」が話題を集めていることを受け、Metaがエージェントを作ろうとしたのはこれが初めてではないと書いた。2015年、当時Facebookだった同社が大きく打ち出した「Project M」を挙げ、Facebookにとって運用が高価だったため約1万人にしか展開されず一般には広がらなかったこと、そして最終的に裏に人間がいたことが漏れたことを指摘し、中に人が隠れていたチェス指し人形「メカニカル・ターク」になぞらえた。記事の前提には、Museの通話が実際にはコールセンターの人間によって行われているとする404 Mediaの報道がある
自動化の割合を外から検証できない製品について、過去の同じ会社の前例が判断材料として持ち出されている点
AI活用事例
ファミリーマート、AIが案を出したスイーツを初めて販売 案出しを「2週間→1日」に短縮し、約1000品の提案から絞り込み
9月22日公開。過去2年分のID-POSデータ、デザート分類の発注と売上、客層、時間帯とリピートの分析、過去の企画の実績データに加え、市場のトレンドを入れるためスイーツ白書、方向性の指針としてグループの政策資料をAIに読み込ませた。片手で食べられること、一品の中で食感が異なることなど過去に売れ行きが好調だった商品の要因、商品のテーマ、制約条件を入力したところ、AIが約1000品を提案した。担当者がプリン、ダブルシュー、カヌレなど数案に絞り込み、第1弾の「おいものカヌレ〜キャラメルソースがけ〜」を9月22日から数量限定で販売する。価格も、過去のデータで300円を超えるとトライアル率が下がる傾向が出たため285円とした。2027年2月までに10品近くを展開する予定。AIが提案した中からキャラメルソースが中から出る構造の菓子については、自社工場の設備と技術では難しかったため担当者の判断で変えている
案出しの時間が短くなった分、実現可否の判定という担当者側の作業が残り、そこが新しい詰まりになる点
キユーピー、工場シミュレーションモデルの開発工数を8割削減 専用言語とローカルGUIの制約をどう越えたか
9月22日8時公開。生産ラインをシミュレーションで分析する専門チームが、シーメンス製の工場シミュレーションソフト「Tecnomatix Plant Simulation」を使っている。生成AIによる高度化と効率化には3つの課題があった。専用言語「SimTalk」が広く普及した言語ではなく汎用のLLMでは正しいコードを生成しにくいこと、同ソフトがGUI操作を前提としたローカル環境でしか動かずAIが生成したコードを検証しにくいこと、専門チームの解決手法をチーム全員と組織へ広げる道筋が見えにくいこと
普及していない専用言語と、外から触れないローカルのソフトという組み合わせが、専用システムを抱える現場に共通している点




