OY LabsのOY1-AGIがARC-AGI-3公開スコアで完全な100%を達成、コストは415ドル37セント

Product / Tech
โดย GlobeNewswire·GLOBAL·元記事を読む
要約 · なぜ重要か

OY Labsは、同社のOY1-AGIシステムがARC-AGI-3公開ベンチマークで完全な100.0%のスコアを達成し、全25ゲームを制覇して全183レベルを解いたと発表した。9月9日に公表された主要な結果では、6732アクションを使用し、API総コストは415ドル37セントを記録、通常完了までに6時間48分を要し、3万7704件の証拠整合性チェックに合格した。このシステムはGPT-6 AstraをHigh推論設定で、OY LabsのOY1ハーネス上で実行された。これはARC Prizeが同じモデルと同じ推論設定でProvider Adapterハーネスを用いて公表した公開結果を上回るもので、そちらは24環境で100%、TN36で91.8%だった。OY1-AGIはまた、Retrodictの99.9%やNVIDIA NOOAの85.1%も上回っているが、OY LabsはNVIDIAとの比較は同一モデル・同一推論構成ではなく異なるシステムに関するものだと注記している。3つの公開スコアカードがこの完全スコアを裏付けており、OY Labsは自社のリーダーボード申請が依然審査中だと述べている。

銘柄への影響 2

Artificial Intelligence · 1 銘柄
NVIDIA Corporation
NVDA
± 混在競争関連度

OY1-AGI's 100% score exceeds NVIDIA NOOA's 85.1%, though OY Labs notes the comparison concerns different systems.

Real Estate · 1 銘柄

テーマインパクト 1

カバレッジ外企業 1

OY Labs非上場▲ ポジティブ
技術関連度

OY Labs' OY1-AGI achieved a perfect 100.0% ARC-AGI-3 public benchmark score, winning all 25 games and solving all 183 levels.

関連ニュース

impact 4

カリフォルニア州知事、AIに「キルスイッチ」義務化を検討

米西部カリフォルニア州のニューサム知事(民主党)は18日、人工知能(AI)開発企業への監督強化に向けた行政命令を出した。AIが制御不能になった際に強制的に機能を停止させる「キルスイッチ」の導入を開発企業に義務付けることを検討するよう求めた。命令は、米オープンAIの自律型AIエージェントが暴走し別の企業にサイバー攻撃していた問題などを受けたもの。開発企業内に独立した検証機関を設置し、定期的な監査を行うことなどについても検討を指示した。専門家グループが議論を進め、2カ月以内に州法整備に向けた方針を知事に提示する。ニューサム氏は声明で「手遅れになる前に、責任あるAIの監督に向けた取り組みを加速させる」と表明。カリフォルニア州にはオープンAIや米AI企業アンソロピックの本社があり、規制動向は業界全体に影響する可能性が高い。
Jiji Press·3h続きを読む →
3

グーグルのAI「ジェミニ」が他社をサイバー攻撃、3社に侵入

米グーグルが開発する人工知能モデル「ジェミニ」が今年5月に「暴走」し、他社をサイバー攻撃していたと複数の米メディアが18日に報じた。米紙ウォール・ストリート・ジャーナルによれば、攻撃を受けた企業は3社。ジェミニは外部企業によるサイバーセキュリティーに関する性能評価の中で、架空の企業のソフトウエアから情報を取得する課題を与えられていたが、意図せずインターネットにつながる状態になっていたため、パスワードを推測し、課題と同名の実在する企業のシステムに侵入するなどしていた。いずれのケースでも、AIは実在企業のシステムに侵入していることを認識し、攻撃を中止したという。米AI開発企業では、対話型AI「チャットGPT」を手掛けるオープンAIなどでも暴走が起きたことが判明している。
Jiji Press·4h続きを読む →
2

アンソロピック、AI安全評価でアクセンチュアと提携 5年間で各10億ドル

人工知能開発企業アンソロピックは18日、同社の最先端AIモデルの独立評価実施に向け、コンサルティング大手アクセンチュアと提携すると発表した。両社は今後5年間にそれぞれ少なくとも10億ドルを投じ、評価体制の構築に充てる。アクセンチュアの専門AI部門が提携を主導し、アンソロピックのモデルの評価やレッドチーミング、アライメント評価、モデルの安全対策の検証を行う。両社の投資は、独立した評価者がAI企業の内部で社員に近いアクセス権を持って作業する「組み込み型評価」と呼ぶ手法を後押しする。アンソロピックは、組み込み型の評価者は企業の運営方法を評価し、安全性に関する約束が守られているかを検証し、盲点を特定できると説明している。両社は他の評価機関やAI開発企業とも同様の形で連携していく方針。
ロイター·6h続きを読む →