Why Tejal Patwardhan stopped underestimating the models - Episode 21
44分 23秒
OpenAI研究者が語るAIモデル評価の未来:飽和するベンチマークと「Frontier Evals」の重要性
この記事は動画の内容を元にAIが生成したものです。正確な情報は元の動画をご確認ください。
ポイント
- •OpenAIの研究者が、従来のベンチマークでは測りきれない最先端AIモデルの能力評価の課題と未来について語ります
- •モデルの真の能力を把握し社会がAIの急激な進歩に備えるため、「Frontier Evals」の構築と重要性を解説します
- •数学での推論能力の飛躍は、AIが専門的な仕事や科学に適用される可能性を示す「プルーフポイント」であると理解できます
はじめに:AI進化の最前線で求められる新たな評価軸
皆さん、こんにちは。OpenAIポッドキャストへようこそ。本日のエピソードでは、研究主任のTejal Patwardhan氏をお招きし、従来のベンチマークが飽和する中で「Frontier Evals(フロンティア評価)」を構築する必要性についてお話を伺います。Tejal Patwardhan氏は、「ベンチマークは一般的に良くない」と述べ、モデルを人々の実際の仕事に役立つようにするにはどうすれば良いのか、という問いを投げかけます。彼女たちは、人間基準が難しいため、モデルがそれを超えられるか不安を感じていたそうですが、「モデルを過小評価すべきではない」と考えています。
OpenAIでの歩みと評価への情熱
Tejal Patwardhan氏は2023年秋にOpenAIに参加しました。これはChatGPTがリリースされ、GPT-4が登場し、OpenAIがSuperalignmentチームを発足させた直後のことでした。彼女は、モデルの能力が向上する様子を目の当たりにし、次世代モデルがどのようなものになるかを検討する中で立ち上がった「Preparedness(準備)チーム」に参加しました。彼女が参加した直後から推論モデルの初期結果が出始め、非常にエキサイティングな時期でした。これらのモデルが本格的に普及した場合、将来の能力がどうなるか、そしてその未来にどう備えるべきかを深く考察したそうです。彼女たちは、脅威モデリングや、どのような評価を実行すべきか、このようなモデルをどのようにリリースすべきかについて多くの作業を行いました。Tejal氏にとって、評価はモデルが何ができるかを測定し、理解し、その進歩を人々が実際にその能力を採用し利用するずっと前に把握できる方法であるため、非常に魅力的です。
「Capability Overhang」と世界の準備
「Capability Overhang(能力の潜在的過剰)」とは、モデルが特定の能力を備えていても、文化的、法的、規制上の障壁により、人々がそれらの能力を実際に利用するまでには長い時間がかかるという考え方を指します。評価を通じてモデルの開発と測定を支援することで、このテクノロジーが何を実現できるかを理解し、「未来を先取りして見る」ことができます。また、これにより世界を「何が起こっているのか」に対して準備させることが重要だとTejal氏は考えています。
彼女がOpenAIで働き始めた当初、Preparedness Evalsに取り組むことに特に興奮したのは、これらのモデルが非常に有能になっていくと感じていたからです。しかし、彼女の友人たちはChatGPTの出力を見て「幻覚を起こしているし、あまり賢くないし、AIの寄せ集めのように読める」と、その力を理解していませんでした。しかし、それは「今」の話であり、変化の傾き(slope)が非常に急であるため、予想よりもはるかに速く変化が起こる可能性があるのです。したがって、OpenAIができる最大の貢献の一つは、進捗状況を測定し、世界と共有することだとTejal氏は語ります。なぜなら、人々がモデルの能力を実際に理解し、体感するまでには、しばしばこのCapability Overhangが存在するからです。これが、彼女がすべての評価を非常に重要だと考える理由の一つです。
推論能力のブレークスルー:数学からの飛躍
推論能力の進化は、非常にエキサイティングな瞬間でした。多くの人々がその重要性に気づくまでには1年ほどの時間を要しましたが、モデルに「より長く考える時間」を与えることで、モデルのサイズが大きくなっていないにもかかわらず、より良い結果が得られることを理解したことは、非常に興味深い経験だったとAndrew Mayne氏は振り返ります。
Tejal氏も、初期の実験について触れています。例えば、Nat McAleese氏が行った実験では、モデルは純粋に数学で訓練されていましたが、生物学、化学、物理学の問題を含むベンチマークであるGPQAで評価したところ、非常に優れた結果を出しました。これは「より賢いモデルははるかに賢い」ということを示唆していました。当時、Nat氏は「もしこの進歩が続けば、6ヶ月以内に数学の訓練だけで科学において人間レベルのパフォーマンスを達成するだろう」という予測を立てていました。当時、これは「私が今まで見た中で最も賢いものの一つであり、これほど推論するモデルは見たことがない」と評されるほど、非常に驚くべき発見でした。しかし、後にGPQAが博士号レベルの生物学、化学、物理学の問題であったにもかかわらず、「プロフェッショナルレベルの評価が必要だ」と、求められる基準を常に引き上げていったとTejal氏は語ります。
なぜ数学がAI研究の「プルーフポイント」となったのか
OpenAIから出てくる多くの研究が数学に焦点を当てていることについて、Andrew Mayne氏は疑問を呈します。Tejal氏は、数学がある意味でより客観的に検証可能であるため、初期の研究で有用であったと説明します。数学は、RL(強化学習)を行い、推論パラダイムをスケールアップするのが比較的容易だった分野でした。また、数学は科学の中核となる分野の一つでもあります。しかし、数学に焦点を当ててきたのは、偶然の側面も大きいとTejal氏は語ります。それは必ずしも研究で最終的に目指すものではありません。
OpenAIは現在、「もし数学でこれができるのであれば、他の種類の科学、専門的な仕事、そして個人レベルで人間にとって役立つ能力にもスケールアップできるのか」ということを考えています。そのため、数学は「最終目標」というよりは、AIの能力を示す「プルーフポイント(証明点)」であるとTejal氏は位置づけています。
まとめ:AIモデル評価のフロンティアを切り拓く
本記事では、OpenAIの研究主任であるTejal Patwardhan氏が語るAIモデル評価の現状と未来について掘り下げました。従来のベンチマークが飽和し、モデルの真の能力を測りきれなくなる中で、「Frontier Evals」という新たな評価手法の必要性が浮き彫りになりました。また、AIの急速な進化、特に推論能力のブレークスルー、そしてその過程で数学が果たした「プルーフポイント」としての役割も明らかにしました。Tejal氏の言葉は、AIの進歩がもたらす未来を正しく理解し、社会がその変化に準備するためには、モデルの能力を正確に測定し、その情報を共有していくことの重要性を強く示唆しています。AI技術が社会に深く浸透していく中で、その力を理解し、適切に導くための評価の役割は、今後ますます重要になっていくでしょう。
参考動画: https://www.youtube.com/watch?v=CFqjjKp9Y-Q