すべての言語
共有
過去 1 年間に AI を実際に使用したことのある人なら誰でも同じように感じているでしょう。AI はますます高価になっています。以前は、月額 20 ドルのサブスクリプションでは十分に支出できなかったかもしれませんが、エージェントやバイブコーディングが人気になって以来、トークンは湯水のように燃え上がっています。コーディングエージェントは午後中ずっとうろうろしており、請求書は山積みでした。そのため、誰もが徐々に、このタスクを実行する価値があるかどうか、このコードは AI によって書き換えられるべきかどうかについて注意を払うようになりました。多くのアイデアが浮かぶとすぐに、「これには何個のトークンがかかりますか?」という文によって元に戻されました。
AI は誰もが心ゆくまで作成して使用できるようにするはずですが、代わりにメーター制で請求し、できるだけ節約することが重要になりました。
テキスト、画像、ビデオの 3 つの AI モデルをすべて 1 セントも費やすことなく使用できる会社が登場しました。 7 日間のトライアルではありませんし、使い切ることしかできないクレジットも付与されませんが、それを制御するには十分です。これがAI時代の「電脳菩薩」なのか?
6 月 1 日、Agnes AI という新興チームは、テキスト、写真、ビデオの 3 つのモデルの API トークンを無料で作成しました。このニュースが出るやいなや、数日のうちに十数組の団体が詰めかけた。無料になってからわずか 1 週間で、Agnes-2.0-Flash のコール量は 1 兆 (1T) トークン以上に急増しました。 Agnes-Image-2.1-flash は 200 万枚以上の写真を生成しました。 Agnes-Video-2.0 では 200 万秒を超えるビデオも制作されました。最初に来たのは、ほぼ全員が、それを「体験」するために一晩でやって来たオタクたちでした。
しかしすぐに、グループのスタイルは変わりました。
数分間のビデオを生成するためにこれを使用する人もいれば、ワークフローを一致させて完全なマテリアル セットを作成するために使用する人もいます。また、2 人の娘の成長のクリップを AI ナレーション付きの短いビデオにカットする人もいます。過去の価格では、おそらくこの種の数分のビデオを試してみようとは思わないでしょう。実はこれが「無料」の最も興味深い点です。本当に解放されるのは、節約したお金ではなく、高すぎて試す勇気がなかったために試さなかったアイデアです。
さらに珍しいのは、ほとんどの企業が 1 つのモデル フォームのみに焦点を当てている中、アグネスはテキスト、写真、ビデオを組み合わせて作成することを選択し、それらはすべて無料であることです。
興奮は続きます。今週、Agnes AI は 1M の超長いコンテキストと 4K の超鮮明な写真モデルを更新します。
もちろん、次のような疑問も生じます。無料ということは、モデルが十分ではないということなのでしょうか?多くの人に使ってもらうために、どうやってコストを抑えているのでしょうか?お金が集まらなかったら、どうやってチームは生き残れるのでしょうか?
そして最も重要なのは、これを行った Agnes AI チームの目的は何ですか?
これらの質問を念頭に置いて、Geek Park は Agnes AI の創設者であるBruce Yang と話をしました。以下は会話の要約です:
価格が高いモデルの方が優れていますが、価格が低いモデルのパフォーマンスは劣ります。これは大きな誤解です。 DeepSeek は非常に安価でもあり、実際には多くの指標においてより高価なモデルと同じくらい優れています。
<リ>無料トークンによって実際にロックが解除されるのは、節約されたわずかなお金ではなく、高すぎて試す勇気がなかったためにまったく試さなかったアイデアです。ユーザーの可能性がコストによって制限されるべきではありません。
<リ>ハーネス制約により、モデル間のギャップは実際には小さくなっています。ハーネスの役割は、第一に、モデル間のギャップを弱めること、第二に、モデルのアップグレードと最適化をより方向性のあるものにすることです。
<リ>私たちは今、フリーフラッグを掲げる最初の人になり、テーブルに着く最初の人になり、重要なプレーヤーになる最初の人になりたいと考えています。
<リ>10 年前、中国語も英語もわからなければ、文盲だったかもしれません。 10 年後、AI を理解していなければ、文盲になっているかもしれません。実際のところ、AIが怖いのではなく、AIを理解していない人がAIを理解している人を恐れていて、いつでも取って代わられるのではないかと感じているのです。

アグネス AI |出典:公式ウェブサイト
<セクション> <セクション> <セクション> <セクション> <セクション> <セクション> <セクション> <セクション>Geek Park: 私自身と Agnes AI チームを紹介させてください。
ブルース ヤン: まず、私自身の経験について話させてください。私は15歳で海外へ行き、シンガポールのラッフルズ研究所の高校に通いました。その後、カリフォルニア大学バークレー校に入学し、コンピューターサイエンスと数学を専攻しました。幸いなことに、私はチューリング賞を受賞した2人のリチャード・カープとデイビッド・パターソンに師事しました。当時オペレーティング システムを教えてくれた Ion Stoica は、現在 Databricks の創設者です。その後、シリコンバレーで働き、マイクロソフトやリンクトインで働き、シリコンバレーで起業し、中国に戻り、現在はシンガポールにいます。中盤にチャンスがあった。感染症流行中の国のロックダウン中に、私は博士号取得のため勉強するためにシンガポールに戻りました。シンガポール国立大学コンピューティング学部で AI の博士号を取得しました。この経験は私に多くのインスピレーションを与えてくれました。また、それはアグネスの設立にとって非常に重要なルートでもありました。
Agnes は、2024 年末か 2025 年の初め頃に本格的にスタートする予定です。非常に若い会社です。私たちは当初からモデルに取り組んできましたが、昨年はアプリケーションにさらに取り組んでいました。モデルがまだそれほど優れていなかったので、最初に独自のハーネス (現在のエージェント) を作成し、次にエージェント上の機能をゆっくりと最適化しました。当初は「Yusanjia」の外部 API に依存して機能を実現していましたが、常にコストが高く、特にユーザー数が 1,000 万人を超える規模になった後は手が届かなくなったため、自社開発モデルの推進を加速し、いわゆる国産代替を行いました。昨年末までに、話題は製品と国内代替品に関するものになりました。
今年の初めまでに、このモデルがかなりうまくいっていることがわかりました。一部のクローズドソース モデルと比較すると、それでもいくつかの点で利点がありました。そこで私たちは大胆な努力をし、今年モデル API の公開を開始し、小規模からフル モードにスケールアップしました。今、私たちは大きな一歩を踏み出し、すべてのモードを無料にします。 6月1日に発表されてからわずか3日が経ち、現在正式にリリースされています。すでに十数のグループがあり、各グループには数百人が所属しており、全員がオタク ユーザーです。昨日、私たちのトークン消費量が1,000億を超えました。 3日でこの数字に達するのも悪くはなく、週末までに3~4倍になる可能性もあります。今のところは想定内のようです。
Geek Park: 中国だけでなく、世界中の人が無料で聞けたら大興奮するでしょう。しかし、誰もが疑問に思うでしょう。無料なのは、その機能がそれほど強力ではないからではないでしょうか? 3 つのモデルの現在のレベルはどれくらいですか?
Bruce Yang:これは誤解だと思います。これは無料モデルだけでなく、低価格で費用対効果の高いモデルにも当てはまります。いつも思うのですが、高いモデルの方が良くて、安いモデルは性能が悪いからこんなに下げられているのです。しかしご存知のように、DeepSeek も非常に安価です。実際、多くの指標において、より高価なモデルと同じくらい優れています。
私たちのモデルは現在無料ですが、パフォーマンスに妥協はありません。現在の結果から判断すると、私たちのテキスト モデルは、PinchBench や ClawEval などのいくつかのエージェント シナリオにおいて、世界の AI ラボのトップ 10 に入っています。画像とビデオのモデルは、世界で最も権威のあるブラインド評価リストである人工分析で、世界のトップ 10 の AI ラボにも含まれています。
モデルはまだ最適化中であり、今月、そしておそらくその後は毎月更新される予定です。 私たち自身に対する要件は、主要な SOTA モデルがすぐに同じ強さに達するとは限りませんが、すぐに追いつき、 同じ世代内に留まる必要があることです。たとえば、新しいバージョンがリリースされると、以前のバージョンの機能を実現できます。これは簡単ではありませんが、無料なので多くのユーザーに支持されると思います。
Geek Park: あなたは自分のモデルにとても自信があるのですから、Agnes モデルで作成したデモをみんなに見せて説明してみてはいかがでしょうか。
Bruce Yang: 私たちのモデルについてはオンラインで多くのレビューがありました。調べてみたところ、 その95% は当社が提供したものではないことがわかりました。無料化が発表された初日には、ユーザーによる自発的なプロモーションが数多く行われました。レビューは非常に適切であり、私たちの問題のいくつかを指摘していましたが、全体的には誰もが私たちの能力を認めていました。
たとえば、この種のパーティクル エフェクトは、Gemini が最初に登場したとき、テキスト モデルの機能をテストするための重要な指標でした。別の友人はテキスト モデルを使用してオペレーティング システムを作成しました。また、その中で飛行するミニゲームもありました。
テキストに加えて、写真やビデオ、特に写真もOKです。情報密度の高い一部のコンテンツを最適化するという点で、良い仕事ができました。もちろん、Nano Banana や GPT と比較すると、画像モデルにはまだ距離があり、高密度テキストの詳細が完全に最適化されていない部分もありますが、全体的には国内モデルの中で比較的高いと考えるべきです。
ビデオに関しては、オーディオとビデオの同時制作をサポートしています。キャラクターはビデオ内で話すことができます。中国語と英語の両方がサポートされています。いくつかの細かい部分はまだ最適化する必要があります。おそらく今月後半にはビデオモデルの次期バージョンを発売する予定です。目標はHappyHorseのステージに近づくことですが、Seedanceとはまだ差があります。しかし、一般的に言えば、商業モデルとして、無料であることは商業的価値がないことを意味するものではありません。私たちは多くのクローズドソース モデルの機能を実現しており、多くの商用可能性も解放できます。
Geek Park: 先ほど示されたタスクは、単一のモデルによってエンドツーエンドで完了したものですか? それとも複数のエージェントの協力が必要ですか?
Bruce Yang:私たちが提供する API には、テキスト、画像、ビデオの 3 つのモデルしかありません。現時点では、これら 3 つの API は統合されていません。多くの人が設定時に混乱する可能性があるため、来週まとめてリリースしたいと考えています。多くのハーネスは画像やビデオの直接アップロードまたはダウンロードをサポートしていないため、スキルとしてロードする必要があります。これで 3 つの異なるモデルになりました。ご覧いただくコンテンツは基本的にハーネスをベースに完成しております。ハーネスは、当社独自の Agnes ハーネス、または Codex、OpenClaw、または Claude Code のいずれかを使用できます。単一モデルを接続すると、機能を実現できます。
現在、ハーネス作業をサポートするために複数のテキスト モデルや複数の画像またはビデオ モデルを使用していません。ただし、ハーネスの実行プロセス中、ハーネス自体の理解、ニーズ、依存関係により、ハーネスを実装するために特定の時点で複数のエージェントが派遣されることがあります。私たちはこれをサポートできます。
Geek Park: 現在の人気のあるモデルやツールと比較して、これらのタスクを完了するためのコンピューティング電力コストにはどのくらいの違いがありますか?
ブルース・ヤン: まず、引用について話しましょう。今は無料ですが、無料になる前から見積りがあり、トークンプランもまだあります。テキスト モデルに関しては、一般に出力トークンのみがコストにリンクされ、入力トークンはモデル会社にとって基本的にコストがかかりません。
私たちが入力したトークンは 100 万あたり 0.15 米ドルで、これは GPT や Anthropic の約 1/100 であり、DeepSeek のフラッシュ バージョンよりも約半分安いです。それでもある程度の利益は得ています。写真は 1,000 枚あたり 3 ドル、つまり 1 枚あたり 0.003 ドルですが、これは誇張されています。ビデオの実際の料金は 1 分あたり約 0.3 米ドルで、これは 1 秒あたり約 1 セントに相当します。このコストは、市場の主力モデルの約100分の1です。
これは元の引用です。今なら無料なので誰でも無料で使えます。 QPS (1 秒あたりのクエリ/リクエスト数) と RPM (1 分あたりのリクエスト数) はわずかに制限されていますが、それでも多くの制限があり、1 分あたり 20 回リクエストできます。通常の個人開発者は、リソースの量が不足する状況にまだ遭遇したことがありません。
Geek Park: 無料だと人々はチームを維持できるかどうか心配しますか?特にアグネスは巨大企業ではないため、3 つのモデルすべてを実行するチームはほとんどありません。 3 種類のモデルをすべて一緒に実行する必要があるのはなぜですか?
ブルース・ヤン: 確かにプレッシャーはあります。私たちの科学研究チームにはすでに100人以上のメンバーがいます。現在、テキスト、写真、ビデオの点でグローバル モデル リストのトップ 10 にランクインしている Lab 企業はそれほど多くありません。海外ではGoogleやOpenAI、国内ではAlibabaやByteかもしれません。他の 3 つを実行している企業は多くありません。
私たちは最初はそれについてあまり考えていませんでした。自社のハーネス製品はもともと文字、写真、動画に対応しており、使い勝手のバランスが取れているため、まずは国産品に置き換えることから始めます。このプロセスで、3 つのモデル間に実際に相乗効果があることがわかりました。
Nano Banana が登場したとき、彼らはある点について言及しました。 Nano Banana の指示追従能力が非常に高いのは、ビジュアルコンテンツ分析に当時のフラッグシップモデル Gemini 2.5 Pro を使用しているためであり、プロンプトワードの反転能力が非常に強力です。ビデオモデルについても同様です。実際にトレーニングしたことがある人なら誰でも、最初の前提としてテキストと画像のモデルが強力でなければならないことがわかるでしょう。ビデオ モデルには大量のデータも必要で、その多くは映画やテレビのスライスから得られます。スライスした後、ビデオのこの部分をテキストで適切に説明する必要があります。これらの説明は、リバース トレーニングに使用できます。このプロセスもテキスト モデルに大きく依存します。したがって、実際には 3 つのモデルにはトレーニング中に特定の依存関係があります。 AR を使用し始めた画像モデルなど、理解と生成を組み合わせる能力が必要な、いくつかの新しいルートが含まれています。
一般的に言えば、理由は 2 つあります。まず、実際の使用ニーズから始めます。多くの個人企業や小規模ワークショップでは、異なる企業の 3 つのインターフェイスを構成するのは非常に困難です。これらを組み合わせてオムニモード API を作成できれば、コストと使用のしきい値をより適切に削減できます。第二に、トレーニング間に相乗効果が生まれます。マルチモーダルテキスト理解モデルが優れていればいるほど、画像やビデオの生成をサポートできるようになります。この 2 つは互いに補完し合います。マルチモーダル シーンでは多くの新しいデータが生成されるため、データを合成してさらにトレーニングするのに非常に役立ちます。特に、画像とビデオのモデルには、迅速な単語の拡張を支援するテキスト ハーネスが必要です。
3 つのモデルを統合し、ユーザーが継続的に探索できるシナリオを作成することによってのみ、次のモデルのアップグレードの方向性を理解することができます。
別の観点から見ると、3 つのモデルを同時にトレーニングする場合と 1 つだけをトレーニングする場合の違いは、各企業のビジョンと認識に依存します。 Anthropic と OpenAI のビジョンは、最強のテキスト モデルを使用して機能の質的な変化を達成し、AGI をできるだけ早く実現することです。しかし、私たちの AGI に対する理解は少し異なります。私たちは、当社の AGI が最も幅広いユーザーによって、最も大規模なシナリオで使用され、より広範な AGI となることを願っています。このルートでは、すべてのモデルで最強のモデルがあるわけではないかもしれませんが、私たちは最前線、おそらくはトップ 10 に留まり、世代に遅れを取らないようにする必要があります。同時に、モデルの機能が相互に補完し合い、共に進歩することを期待しています。また、より多くのユーザーに当社の製品を利用していただき、エコシステムを構築していただきたいと考えています。エコシステムによって私たちの進歩を促進し、市場の需要を理解し、使用の敷居を下げる方法を理解しましょう。
ビジョン、出発点、技術的なルートが異なるため、他の人が選択しない可能性のあるルートを選択しますが、これはパフォーマンスのダウングレードや妥協を意味するものではありません。私たちはこれからも世界の最前線であり続けます。
Geek Park: テキスト、画像生成、ビデオ制作を行う才能のある人材を結集できるあなたの魅力は何ですか?
ブルース ヤン:実際には 4 つのチームがあります。テキスト用に 1 つのチーム、写真用に 1 つ、ビデオ用に 1 つのチームがあります。各チームには十数人がいます。パフォーマンスの最適化を専門とするチームもあります。さらにコストを削減する方法。実際、コストという言葉はあまり適切ではありません。効率が良くなるかもしれません。トレーニング フェーズと推論フェーズの両方で、推論コストの 1% などの驚異的な数字を達成するにはどうすればよいでしょうか。
私たちの中心となるロジックの 1 つは、初日から強い制約を伴う最適化問題を実行しているということですが、私たちの制約は他の制約とは異なります。多くの人は、自分の能力を向上させるのに十分なリソースを提供することを制限しています。しかし、初日の私たちにとって、リソース自体はそれほど大きくありませんでした。そのため、3 つの垂直カテゴリにまたがり、GPU、コーデックス レベル、アルゴリズム レベルのいずれからでも、可能な限り最小のパラメーターを使用してユーザー満足度とパフォーマンスの最も完璧な一致を達成するパフォーマンスの最適化を専門とするチームが必要です。私たちが最初にこれを始めたとき、実際には何もわかりませんでした。
あなたが言及したカリスマ性については、シンガポール チームであれ国内チームであれ、ほとんどのモデル企業がこれら 2 つの地域に存在していないため、実際には私たちは後発です。しかし、ある程度成功の兆しを見せると、地元の優秀な学生が多数集まりました。シンガポールの NUS と NTU の多くの学生、そして南京大学、東達大学、中国科学技術大学、浙江大学、さらには清華大学の国内チームが当社への参加を選択しました。
科学研究チーム全体の人数は現在 100 人近くです。彼らは皆賢くて優秀で、素晴らしいビジョンに向かって一生懸命働いています。 6 月 1 日、私たちは過去に蓄積した機能といくつかの科学的研究結果を発表するという大きな動きを開始しました。来週、いくつかの新しい発見をオープンソース化する予定です。 チームは非常に意欲的で、AI 時代の受信者だけでなく構築者にもなりたいと考えています。これが当社の企業文化です。
<セクション>Geek Park: あなたの意見では、どのようなシナリオで 3 種類のモデルが実際に生産および商品化され、稼働して収益を得ることができると思いますか?明確なシナリオはありますか?
Bruce Yang:先ほども言いましたが、有料モデルや高価なモデルが必ずしも優れているわけではありません。私たちのモデルを試したグループの生徒たちは、Gemini や Claude と比較しても、有料の SOTA モデルと同じくらい優れていると述べました。もちろん、私たちは心の中ではまだギャップがあることを知っています。このような誤解があるため、単純に価格を下げることはもはや意味がありません。価格を下げると、多くの人は性能が足りないからだと考え、下げても使わないでしょう。彼らはむしろ玉三佳を使いたいからです。
この行き詰まりを打破し、固定観念を変える方法は、誰もが大胆に試してみて、その過程で驚きを見つけることです。オープンから 3 日後には、十数のグループと数千人の友人が集まりました。実際には、はるかに多くの機能がありますが、コードをスキャンしてグループに参加するユーザーはわずか 10% 程度です。 QR コードは、公式 Web サイトの API キーの下にあります。
フィードバックから、有料の上級モデルを使用している機能のほとんどを実現できます。特に複雑な命令に従う場合や特に長期にわたるエージェント タスクなど、いくつかの欠陥がある場合でも、ツール呼び出しの機能の一部など、次のバージョン (おそらく来週) でこれらを補い、最適化することができます。つまり、 大きなロジックは現在誰もが使用しているシナリオの 90% を実装できるということです。
どこに重点を置く必要があるかというと、エージェント機能の最適化により多くの時間を費やしてきました。これが、私が PinchBench と ClawEval に注目する理由です。次のバージョンではコーディングがさらに最適化されます。たとえば、現在、SWE をプレイし、コーディング機能をアップグレードしています。 SWEも世界トップ10に入ることを期待しています。現時点ではまだチャンスはある。テキストに関しては、ユーザーが最も頻繁に使用するエージェントとコーディングに重点を置いています。絵としてはかなりの実力があると思います。 GPTイメージモデルとのギャップはありますが、国産モデルの中ではまだ許容範囲です。ビデオの差は少し大きく、Seedance や HappyHorse とは差がありますが、無料であろうと元の価格であろうと、価格性能比はまったく問題ありません。今月の次のバージョンを楽しみにしています。それが近いといいですね。
3 つのモデルを要約すると、たとえ一部の SOTA クローズドソース モデルとのギャップがまだあるとしても、私たちはその距離を縮める方法を知っており、クローズドソース モデルに限りなく近づくという使命を持って常に科学研究を推進していきます。
Geek Park: エージェントの熱い波がなければ、トークンの問題はそれほど注目を集めないかもしれません。しかし今では、 トークンが出てくるとすぐに、 一度にすべてを使ってしまうことになります。
Bruce Yang: はい、コーディングにはエージェント ハーネス、いわゆる OpenClaw、Hermes、Codex、Claude Code があります。実際、それらのアーキテクチャは非常に似ています。ハーネスの制約により、モデル間のギャップは実際には小さくなっています。
少し前に馬具の感触を確かめるために新疆へ乗馬に行ったので、何頭かの馬に乗りました。最初の馬はとても従順でしたが、それほど速くはありませんでした。 2番目の馬はとても速かったですが、あまり従順ではありませんでしたが、手綱を握ったとき、その差はそれほど大きくないことがわかりました。速く走れない人はあぶみを蹴ることで速く走れます。指示に従わない人でも、手綱を引くことで従順になることができます。したがって、ハーネスの役割は、第一に、モデル間のギャップを弱めること、第二に、モデルのアップグレードと最適化をより方向性のあるものにすることです。
私たちがもっとしなければならないことは、ハーネスなしで野生の馬を訓練することではなく、ハーネスを使って馬を訓練することです。ハーネスを装着すると、実際に多くの方向と寸法が圧縮され、進行方向が非常に明確になります。私が乗っていない、速くて従順な馬もいます。ガイドさんが乗っています。それは千マイルの馬であり、私とは何の関係もありません。 SOTAモデルに相当します。私が今しなければならないことは、馬具に基づいて才能の劣る馬を訓練し、SOTA モデルに限りなく近づけることです。
ギークパーク: ハーネスを体験するために、乗馬体験に行きましたが、これも素晴らしかったです。 Claude Code が非常に強力なのは、Anthropic のモデルが優れているからだけでなく、そのハーネス全体が非常によくできており、学ぶ価値のあるものがたくさんあるからでもあります。
Bruce Yang: OpenClaw と比較して、Claude Code には 2 つの大きな利点があると思います。 1 つ目はメモリの処理と圧縮で、OpenClaw よりもはるかに優れています。長期記憶機能の最適化が数多く行われています。 2 つ目は KV キャッシュの最適化です。これにより、トークンの使用量が削減され、トークン ヒット キャッシュが改善されます。
モデル会社にとって、ヒット キャッシュのコストは基本的にゼロです。ユーザーは課金されますが、モデル会社にとってはゼロコストであり、入力トークンもゼロコストです。一部の企業がキャッシュされたトークンと入力トークンの価格をこれほど低くできる理由が何度もわかります。なぜなら、全員のコスト項目は主に出力トークンと出力レイヤーにあるからです。
Geek Park: 6 月 1 日に無料になって以来、12 を超えるグループが作成されました。現在の状況はどうですか?ユーザーは無料トークンをどのように使用しますか?
Bruce Yang: 彼らは、いくつかのストレス テスト方法、使用シナリオ、さまざまなハーネスに適応するための設定、エラー ログなど、独自の製品を作成するときに見つけることができなかった多くの問題を見つけるのに役立ちました。以前は 7 ~ 8 人のテスト チームがありましたが、今ではグループ内の多くのアクティブ ユーザーが、彼らが見つけられなかった問題を見つけるのに協力してくれ、非常に良い提案をくれました。開発エンジニアや運用保守エンジニアも多く、ゲートウェイの行き詰まった点も指摘していただきました。
第二に、私をさらに感動させたのは、多くのシーンを発見したことです。このモデルは 10 秒しかサポートしていないため、ビデオ モデルを使用して行う処理は数十秒、5 秒、10 秒であることがわかります。ただし、ユーザーは私たちのために特別に作成された独自のハーネスとスキルを使用し、数分、3 ~ 5 分のビデオを作成してグループに送信する ComfyUI ワークフローを作成する人もいます。
あるユーザーが 2 人の娘の成長を映した短いビデオを投稿し、TTS を使用して非常に感動的な引用を追加してビデオをまとめているのを見ました。私の最初の反応は驚きでした。これは私たちのモデルによって行われたのでしょうか?かなり良いと思いました。多くの人が 5 分間の動画を作成します。当社の無料モデルを使用しない場合は、コストを理由に試用しない可能性があります。私たちは新たなシナリオ、新たな権利を切り開いています。当社には「ユーザーの可能性をコストで制限してはいけない」という言葉があります。私たちはユーザーに自分の可能性を解き放つ権利を与えます。
もう 1 つ、非常に感動的な点があります。私たちは当初、デフォルトでアクセスするモデルはすべて有名なモデルであり、ランキングも良好であるという内容の電子メールを OpenClaw に書こうとしました。私たちのモデルを含めることはできますか?
Geek Park: OpenClaw は何と言っていますか?
Bruce Yang: 私は、不明なモデルへのアクセスは許可しておらず、アクセスしないという電子メールに返信しました。ということで、今日GitHubでOpenClawとAgnesを検索してみました。 6 月 1 日から 3 日まで、なぜ Agnes AI がサポートされていないのか、なぜ自分で設定する必要があるのかを尋ねるコメントが毎日数十件ありました。そこで私たちはいくつかの情報を共有し、非常に感動的なフィードバックを受け取りました。
Geek Park: 以前、シリコンベースのリクイディティのヤン・パン氏とチャットしたところ、彼は私に提案をしてくれました。200 ドルのバージョンを購読してください。トークンが無制限になれば、野心はより大きくなることがわかります。
ブルース・ヤン:はい、私たちもそう考えています。実際、同社は無料サービスを推進する前に、次に何をすべきか、無料後にどのようなビジネスモデルになるのかを完全に把握していませんでした。大まかなアイデアしかありませんでした。しかし、私たちは大きな理解を持っています。価格を無料に引き下げるなど、何かを極端に進めると、エコシステム全体に新たな開放モードが開かれることは間違いありません。それはパラダイムシフトであり、多くのシナリオが噴出するでしょう。これらのシナリオについて今考える必要はありません。大衆の力は無限であるため、多くのユーザーが私たちの思考を改善するのに役立ちます。これは私たちがすでに見たもので、いくつかの種はすでに開花しています。
ギーク・パーク: 誰かが無料で売春をするだけでなく、あなたの無料トークンをより多くの人に転送して自分自身に請求するために転送ステーションのようなものを設置するのではないかと心配していますか?このような二流業者の出現を心配していませんか?
Bruce Yang:RPM (1 分あたりのリクエスト数) を 1 分あたり約 20 回に制限しています。もちろん個人ユーザーにとっては問題ありませんが、 企業ユーザーにとってはさらに困難になります。 20 RPM の製品を 10 人のユーザーに提供すると、彼らは伸びを感じるでしょう。そのため、企業ユーザー向けには、今後も有料モデルが存在する可能性があります。もちろん価格も非常に安いです。最初に POC とパイロットを行うために無料のものを使用できます。
Geek Park: CLI 環境では、個人の経済性を最大化するために、どのタスクに報酬を支払う必要があり、どのタスクにアグネス フリー モデルを使用する必要がありますか?
ブルース・ヤン:オタクでない限り、ほとんどの人はそうでしょう。もう少し慎重になったほうがよいユーザーには 2 つのタイプがあると思います。最初のカテゴリは、複数の Codex インスタンスを必要とし、3 ~ 4 時間連続して実行するような完全なマニアです。現在、これに対するサポートはありません。もちろん、私たちはそれを最適化しており、この長距離の複数インスタンスのシナリオに向けてコーディング ハーネスを使用して最適化しています。 2 番目のカテゴリーは、ショート プレーを作るのが非常にプロフェッショナルです。使えないわけではなく、特に複雑な動きや一貫性が求められるシーンなど、一部の上位モデルと併用できる場合があります。
さらに、私たちのモデルは現在、市場に出ているシナリオの 95% 以上を解決できるはずであり、十数の WeChat グループでも検証されています。ユーザーの約 80% は、これまでに見た他のモデルと似ていると答えます。質問をするユーザーもいます。これらの質問は 2 つのカテゴリに分類され、1 つはすぐに解決できるもの、もう 1 つは一時的に解決できないものです。質問してくるユーザーの10~20%のうち、すぐに解決できる人が80%を占めます。このように計算すると、未解決で解決方法がわからないシナリオや問題は 1% 程度しかありません。さらに、利用基準を無料に引き下げました。これは非常に人気のある方向性であり、試す価値があると思います。
Geek Park: アグネスは、どのようにして 3 つのモーダル モデルのコストを削減して無料にしたのですか?数千億枚のトークンがわずか 3 日で完売しました。
ブルース・ヤン:はい。 Moreover, the hundreds of billions of tokens are only 1/5 of our reserve cards, which can be multiplied by 5 times based on daily consumption. I have also prepared a second batch of cards. You can boldly collect them until we can no longer collect them.
The logic is this. First, what we are doing is an optimization problem, but the constraints are different from others. Most mainstream companies believe in scaling law, which means that parameters and data can be improved equally if computing power permits. But it does not answer the question of how big the marginal benefit is: in many cases, when the parameters are increased by 10 times, the benchmark only increases by a few percentage points; and most of them are now reverse distillation. For example, Gemini uses Pro to distill Fast, and the parameters are reduced by 10 times. The difference on most lists is not big.
So we made an important assumption on the first day. We will not do models above 200B. We will only optimize models within 200B and find a suitable range within them. Relying on environmental stability, synthetic data and online data of our own products to continuously expand, and then expanding on similar issues in list data, this area is now very mature, and we will soon open source some synthetic data methods.
On top of this, we only focus on two key points: agent and coding, hoping to be as good as the SOTA model. Strategic abandonment of other areas is not unimportant, but it is not the first step to solve. Because tokens are now consumed on a large scale, it must be a coding harness or a white-collar office harness.
In addition, there is a slightly advanced attempt. We published an article on the official website about how to approximate the effect of a larger model by cyclically calling Transformer layers without increasing parameters and depth. This is called recurrent depth transformer. In small-scale verification, the PPL in one cycle dropped by 10%, which is equivalent to a 10% increase in parameter utilization; calling the same MoE model multiple times can better utilize the capabilities of each unit parameter. This is the next step to focus on. The long-term vision is to continuously optimize performance within 200B and approach SOTA. Resources are limited, but it seems to be quite effective so far.
Pictures and videos are different. They have not broken through the scaling law. Basically, the more data, the better the effect. Many products fail to achieve results, not because of capability issues, but because of data issues, and synthetic data is very complex. For example, if you want 100 million videos, it may take several months to crawl and cut them by yourself. By the time you finish, the opportunity has passed.
So how do you get the data you want in the shortest time? What kind of pipeline is used to train this data? How to let the picture model empower the video model? Should I choose DiT or auto regression as the technical route in the process? There are actually many small know-hows here, which are more important than a one-time big concept upgrade. A bit like Yann Dubois, a person in charge of post-training at OpenAI, said that training models is actually more like a manual job, not a conclusion that can be systematically derived.
In the past year or so, hundreds of our scientific research colleagues have made a lot of innovations and given full play to the power of academia and open source, so we are also feeding back to the open source ecosystem. For example, the previous paper on recurrent depth transformer has been open sourced; next week we will open source a VAE module that allows us to optimize text in images; later on in the video model, the most important thing is how to synthesize data, and we will gradually open source it.
This ecosystem is still very helpful to us. Many raw materials and many dishes are actually available, but do you have a big enough and strong enough team, and do you have enough confidence to invest and cook this dish? I think we've had a pretty good burn so far.
Geek Park: What is the business thinking behind “Token Free”?
Bruce Yang: I have a rough idea, but I haven’t thought it all through. I can share some. Let’s talk about numbers first. We made hundreds of billions of tokens in just a few days. I took a look and found that the current number one on OpenRouter is DeepSeek V4 Flash, with about 3 trillion tokens a week. I did some math and found that if we reach this kind of weekly usage, our actual server cost will be around a few million yuan, which is not a big number at all. A very important reason is that we have compressed the cost to the extreme. I don’t see anyone in the market currently who can achieve our cost, which is a bit exaggerated.
How free do you want it to be this time? The goal is to reach twice the size of OpenRouter’s first place. If there are new users after the doubling, we may continue to support it, depending on our financing situation; but within the doubling, we can fully support it. At present, our team is as big as OpenRouter ranking first. It is mainly provided to individual consumers. We have not made any large-scale publicity to enterprise consumers for the time being. You can do POC, but the RPM given is not that big. If the volume reaches twice the size of the largest model on OpenRouter, it can be supported for free. Because rather than saving this cost, we hope that more users will experience our model, like our model, and become our loyal users, which is very worthwhile.
We have several ideas on how to commercialize it next.
The first is enterprise users. It’s tiring to make sales, but it will be much faster if you open a free platform for him to try and let him take the initiative to come to us. This is a very important commercialization path for us.
Second, we see that OpenAI and Anthropic’s fastest growing business-side products are their harnesses, namely Claude Code and Codex, so we will soon launch our own harness products. This is a bit of a hiccup first, but this is also a very important commercialization path.
Third, for geeks with particularly large usage, this is not the focus. We will upgrade to a better model. When it reaches a very SOTA and top three in the market, we can consider charging a small range, or give priority to paying users. After paying for a period of time, we can still make it free. But these are not the highest priority, the first two have higher priority.
极客公园:今天是「Token 免费」,下一步会出现「给用户钱让他们用 Token」吗?
Bruce:有这种可能性。但总体来说,在 AI 时代,想保持一两年的门槛和壁垒是很困难的。我们现在趁着有这个能力,全模态模型都能达到可用状态、能达到全球模型榜单前十的 Lab,率先打出免费的旗帜,希望先把愿景推出来,因为这个行为背后跟我们的愿景是符合的。能完全匹配全模态、同样能力又免费的,目前市场上公司不多,大部分公司选择在某一个领域发力,其他领域虽然也在慢慢发力,但需要时间。
所以我们想借这个机会尽快先上牌桌、先成为一个重要玩家。我们后面也有后手,别人匹配我们时,我们还有别的招没出,harness 产品就是我们现在正紧锣密鼓准备的,具体什么时间点、推什么样的产品暂时还不能说,但后面还有新的增长曲线。
极客公园:大厂会跟进吗?例如把过去的模型也免费出去?
Bruce:看他们多快能匹配,我觉得有难度,毕竟已经有那么多用户在付费了。我们作为新参与者,没有那么多包袱,没有那么多企业用户和规模性付费用户,所以可以快速掉头;但对很多公司来说船大难掉头,整个规划、预算、年度计划都要调整,大公司的决策路径没有那么快。
<セクション> <セクション> <セクション> <セクション> <セクション> <セクション> <セクション> <セクション>极客公园:刚才说到很多普通用户用免费 token 生成和女儿回忆的影像。这是不是你和团队的一种情结,希望把 AI 作为工具免费给大家,让大家释放创造力、让生活更美好?
Bruce Yang:我先介绍一下我的背景。我从小在国内一个四线城市长大,初中靠竞赛和中考成绩拿到奖学金,去了新加坡莱佛士书院,相当于新加坡最好的高中。在那里我认识了很多来自东南亚、家庭不富裕但成绩很好的同学,有了很多新认知。我参加新加坡全国的数学、物理、化学竞赛都是金牌、全国前几名,也进了学生会。 靠这份经历,我拿着leadership奖学金去了 UC Berkeley 读书。
整个硅谷有两所学校,有人说富人的孩子去 Stanford,穷人的孩子去 Berkeley。 Berkeley 的同学很像一个社会,不是那么标准的精英,但每个人都很聪明、有很多想法,很纯粹、很干净。
之后我在硅谷创业,这次回新加坡读博也拿了总统奖学金。我运气非常好,来自四线城市、父母也不富裕,但一路都有奖学金和支持。今天的很多成绩都是当时的积累,加上一颗不服输的心,虽是后来者,也愿意挑战现在的市场玩家。 但 AI 现在变得没那么平权了,因为成本,很多有创意的人都在意 token 消耗,不敢大规模用,反而没那么有创造力、没那么有效率。
回想我的经历,无论是莱佛士那些拿奖学金的同学,还是学费不贵、让加州很多普通家庭聪明孩子都能去的 Berkeley,这颗种子是我自己得到的,我也到了一个时间点要回报社会,把火种传下去,就是平权:能力的平权、价值的平权。
在这个时代,AI 平权是最核心的。 10 年前你不会中文、英文可能是文盲;10 年之后,不懂 AI 可能就是文盲。
我硅谷的朋友很多很反 AI、害怕 AI。其实不是害怕 AI,而是不懂 AI 的人怕懂 AI 的人,觉得自己随时会被替代。解决的办法不是压制 AI,而是让它变成一种更平权的能力,让每个人都知道如何借 AI 创造更多。这也是我们公司很重要的愿景,让世界级的 AI 属于每一个人。我们能做的可能微不足道,但这个愿景非常长久、持久。
极客公园:很多大厂已经不开源了,但是你们还在做开源。除了 AI 平权,背后还有哪些思考?
Bruce Yang:现在很多公司在尝试做开源,但只开源了参数、没开源方法。既开源参数又开源方法的,就是 DeepSeek,所以我对 DeepSeek 非常 respect。梁文峰确实是在做 AGI,如果你现在问我,全世界这么多做 AI 的人最崇拜谁,我肯定还是梁文峰,一年前是,现在还是,他有大局观、大格局。我们也是一样的想法。如果开源了模型,但模型太大没法自己部署,又不开源方法,那更多只是证明自己有这个能力、证明自己的模型跟别人不一样、可以被别人蒸馏调用,并没有为社区反馈太多信息。
所以我们很想做的是,如果真能做到一些别人做不到的成绩,还是想把方法论开源出去。无论是上周开源的 recurrent depth transformer,还是下周要开源的、让图片文字更清晰的 VAE,还是后面告诉大家训练视频模型最大的卡点其实是如何快速合成数据,这些能力我们都会想着分享出去。
一方面是想证明我们有能力创新,不希望大家认为我们只是个跟随者;另一方面,得益于人、也反馈于人,希望能在开源社区、开源生态里成长,也希望能反馈给社区。我们各个群里很多小伙伴都在帮我们写 skills,很多我们自己都没写,但你现在搜 GitHub「Agnes 模型」,很多 skill 都写出来了。我知道的群里小伙伴大概就写了四五个,还不断在 OpenClaw 的 issue 里催更,问为什么不支持 Agnes。
极客公园:催更 Peter(OpenClaw 创始人)是吧?
Bruce:对,催更 Peter,而且好几个还是中文的催更 Peter。 这样的生态是大家比较希望看到、比较期待的,这也是为什么我觉得国内的 AI 现在在领跑全球。
极客公园:如果让你给大家传递一个信息,token 都免费了、门槛已经降到很低,普通人在这样的时代应该怎么做、应该有什么样的态度?
Bruce Yang:越早拥抱 AI,越能理解 AI 的世界,而 AI 世界和非 AI 世界是不一样的。我在 NUS 读博时上过一门机器人课,博士课程,我拿了全班第一名。教授 David 第一天就跟我们说,你们可以用 AI,但要说明自己是怎么用的,最好把提示词写出来。结果那门课,我读博时已经比同龄人大 10 岁,花的时间其实不多,但无论做项目、做研究、写论文还是做演示,我都大规模用 AI,居然在大部分同学都比我小 10 岁、可能更有精力的情况下拿了全班第一。这说明如何充分发挥 AI 很重要,AI 能发挥的维度可能远超我们的理解,尤其这波 harness、Codex,包括理解屏幕、做很多新的 skills、对接 MCP 插件,已经在完全改变这个世界了。
我身边有些朋友在做 AI 应用,我们自己也做过一段时间,现在不是公司重点。我有个很重要的观点,当一个产品越做越复杂,它就不是一个 AI native 的产品。因为 AI native 的产品大部分是越做越简单,越来越依赖模型;短期内可能会部分依赖 harness,但这种依赖会不断迭代、可能越来越少。
所以更先进的 AI 认知、更早地接触 AI 产品,再加上免费的资源让大家大胆尝试,我们就把门槛降得很低。很多人不敢尝试,就是怕费太多 token、太多时间;如果 token 都免费了,每天都可以尝试、不断和 AI 互动。 AI 本身是双向的,不一定需要一份操作手册。这样你可以越来越全面地理解 AI 的每一个角落、它的边界在哪里、它的脾性在哪里,这才是新时代的 AI 平权。
有时候我们用 AI 去改造传统业务,有点像把马车装得更豪华、让马跑得更快;但真正 AI native 逻辑,其实是换一辆汽车,是彻底改变对行业的认知。这种认知有些地方比较根深蒂固,我们希望通过免费的、足够多的 token,让大家在这个转变中更快地适应新时代。
我们后面还会出大量的场景和案例,让大家快速上手,包括给没试过 vibe coding 的同学,把我们的一些提示词和生成效果都分享出来;以及如何连接大家想用的 harness。最简单的我们自己也提供了 harness,叫 Agnes super agent,现在还没做得那么好,但已经可以尝试。
如果你自己有 harness,比如 Codex、Claude Code、OpenClaw、Hermes,都可以快速对接。这些资源我们都会快速分享出来。我们的逻辑就是让大家无门槛上手,而且是真免费、没有任何套路。案例和提示词都会慢慢分享出去,让大家无论已经是极客,还是想快速开始 vibe coding,都能快速体验起来。