【Fable5越え?】 Kimi K3について語ろう

23レス / 最終更新 2026/07/23 14:51

1 ID:B09PP718JG7QHAT0
情報共有、色々話そうぜ。
コードを貼るのはやめてね。
2 ID:B09PP718JG7QHAT0 sage ⚐ 0
Deepseekショックと同じ衝撃波起こるかな。
3 ID:VY4N3VT6V9Z0CKJ0 sage ⚐ 1
K3単独で株式市場は揺れないんじゃね。中国のオープンウェイトモデルが米国のフロンティアへ追いつく、っていう認識は民衆で固定化されると思う。
7月27日が楽しみだわ。
4 ID:M3Z1JYWBPG40ZBQB ⚐ 1
(1Mトークン当たり)
Kimi K3
→ キャッシュ済み入力0.30ドル、通常入力3ドル、出力15ドル
GPT-5.6 Sol
→ 入力5ドル、出力30ドル

単純単価ではK3の方が安価だけど、K3の方が同問題で多くトークン消費するなら、単価差はもっと縮まるだろうなあ。
5 ID:H69R7W3ASB1MZS7E ⚐ 1
体感だけど、
Fable 5: 少ない指示で曖昧な要求を理解して完成度の高い成果を出す作業
GPT-5.6 Sol: ターミナル、科学、サイバーセキュリティ、並列エージェントによる問題解決
K3: フロントエンド生成
がそれぞれの特長。
(Solの複数エージェントはultraモードだからズルいところあるけど、難度の高いタスクを完遂させる能力が成熟してる)
6 ID:VY4N3VT6V9Z0CKJ0 ⚐ 1
K3 Max推論で軽くやってみたけど、GPTよりもトークンの消費重かった。将来的に推論量の選択肢が増えれば使いやすいと思う。
予想以上にツール使用とコーディングは良いし、長時間タスクならフロンティアモデルに近い感触がある。

これの影響で、結果的に米国モデルの価格が下がってくれたらいいけど。
7 ID:V54P59ZQZS1KVDKY sage ⚐ 0
なんで中国はこれ公開したんだ?
8 ID:9C2QY66CYMDP7AZ2 sage ⚐ 2
>>7
クローズド市場ではOpenAIとAnthropicに勝てないからじゃない?慈悲じゃなくて、世界展開の戦略かな。
GPUへのアクセスを制限されても、中国は最先端モデルを作れるっていうメッセージになるし、計算資源の制約が結果的にアルゴリズムの革新を促したところはあると思う。
モデルだけじゃなく中国製GPUとか、中国製のAIスタックが世界的に採用されれば中国市場に長期的な影響力が生まれるし、米国政府との手続きが標準になりそうなOpenAIとAnthropicの状況と対比できるから。(米国は最高性能を囲い込んでて、中国は世界に無料で配布してくれている)
そもそも中国だけでもDeepSeek,Alibaba,Zhipu,MiniMaxとあるから、国内で主導権を失わないためでもあると思う。
10 ID:877DW1620DNA4JVE sage ⚐ 0
中国ってそんなに計算資源不足してるんだな
11 ID:1A630GV1D8JMMAA3 sage ⚐ 0
セーフガード無しなのヤバい
12 ID:B09PP718JG7QHAT0 sage ⚐ 0
Kimi って何が由来かと思ったら、Moonshot AIの創設者・楊植麟氏の使っているニックネームから取られた名称らしい。
https://kimiyoung.github.io/
13 ID:80H4AJVDH4TCPBEV ⚐ 0
(https://platform.kimi.ai/docs/guide/use-thinking-effort)
原文:"K3 always reasons and may return reasoning_content; more reasoning-effort levels are coming soon."
日本語訳:"K3は常に推論を行い、reasoning_content を返すことがあります。より多くの reasoning-effort レベルが近日登場予定です。"

現状はmaxのみだけど、後々追加されていくみたいね。

https://files.catbox.moe/217btb.png
14 ID:V54P59ZQZS1KVDKY sage ⚐ 3
こういうサブスクって、実際どれくらいのトークン/タスク分使用できるのか不透明すぎないか?
契約させておいて、後から制限渋くするの良くないと思うわ。
15 ID:V2J1VQ45A5QRSZXX sage ⚐ 0
大きなコードベースだと限界感じるところはある

ただ、間違いなくFable5に近い、Opus4.8よりは賢い。
16 ID:C1NYMBA5KVW7BVHR ⚐ 1
(https://arena.ai/leaderboard/code/webdev)
LMArenaのWebDevではKimi K3が現状1位です。
投票者は2つの成果物を短時間で比較するから、ソフトウェアよりもデザインコンテストに近い気が。
人間投票が中心である限り機能を網羅的にテストする保証はないし、Web開発能力じゃなくてフロントエンド生成能力が、このアリーナでは高かった、というだけです。したがってリーダーボード上位でも本番運用できるシステムを作れるとは限らない。
プロンプトが具体的で"良質"なものもあれば、「かっこいいサイトを作れ」のように曖昧なものもあるので、要求を勝手に補完する能力が有利になる。
絶対採点ではなくモデルA/Bの比較なので、相手のモデルが弱かったら勝つし、デザインは強いが機能が弱い相手なら評価軸に左右されてしまう。
LMArenaの順位はモデルの評判、マーケティングに影響するから、複数アカウントによる投票、そもそもこのアリーナで好まれるUIを学習している可能性もあるので、企業や支持者がモデルの特徴を利用して投票する可能性も高い。
公平な比較にはトークンバジェット、思考時間、コンテキスト長、色々な要素を揃える必要があるが、アリーナではされていないので、勝率が高いが10倍高価なモデルと、ほぼ同等で低価格なモデルは全く違う選択肢となること=費用対効果をWebDevの順位で判断できないことに注意してほしい。

https://files.catbox.moe/vnqjzn.png
18 ID:9C2QY66CYMDP7AZ2 sage ⚐ 0
Moonshot AIは他の企業と違って、早期収益化を急ぐ局面でも技術理想主義を示してきていて、AGIを十年単位の研究開発と捉えていることが分かる。
K2以降の中心テーマは、質問に答えるというチャットボット能力だけでなく、ツールを使ってタスクを完了する能力。
特に、モデルが長時間にわたって作業を続けるには何が必要か、の方向に強く寄ってると考えられる。
19 ID:9C2QY66CYMDP7AZ2 sage ⚐ 0
楊氏は突飛な単一アルゴリズムより、スケーリングによって知能を高める考えを強調していて、より大きな学習を安定、効率的に成立させるために、基礎部分を改良するというもの。
20 ID:KV5C0FBBQWCXWSSF ⚐ 0
連邦機関、国防・情報機関、政府請負企業ではK3を含む中国製モデルの利用が制限される予感がする。
すでに議会では、DeepSeekを契機に、敵対国で開発されたAIを政府機関から排除する No Adversarial AI Act が超党派で提出されているし、下院の対中共特別委員会と国土安全保障委員会は、4月の時点でMoonshot AI名指しで、米企業が中国製オープンウェイトモデルを組み込むことの安全保障リスクを調査してるから、K3はこの動きを加速させる材料になりそう。
K3は米中AI交渉の主要議題になるだろうね。
このままK3が世界で広く採用されれば米国からしたら問題だから、米国は米国で、「米国の価値観に基づく」オープンウェイトモデルを出せばいいんだけど。
21 ID:N9MVQP7X5V08VE6T ⚐ 0
Deepseekが安すぎるのも相まって、K3は高く感じるなあ。サブスクもCodexほど寛大じゃないし…
22 ID:4ESWCMKBWADDXP4Z ⚐ 0
推論事業者、オープンソースのメンテナーと技術仕様を調整中だと明記されてるから、発表時点で公開作業は完全に終了してなかったことか。
ウェイトは出ても、主要ランタイムで安定して動かないという状態が起きそう。K2.5でも公開直後はnightyビルドが必要と案内されていた事から、Moonshot AIは、推論環境が成熟する前でもウェイトを公開すると思う。先にウェイトを公開して、実行環境は後から改善するだろうね。
23 ID:3YE6X6SH2T5F55Q0 ⚐ 0
2月にMoonshot AIが数百の不正アカウントを使い、Claudeと340万回以上やりとりしたとの発表があった。米科学技術政策局のマイケル・クラツィオス局長は、MoonshotがK3開発のためにFableを蒸留したとの情報を持っており、複数の米国モデルを対象に大規模蒸留を行う内部システムも構築したと述べている。(ただし、その情報の中身は公開されていない)

Fable5は6月9日に公開され、6月12日に一時停止、7月1日に再公開された。Kimi K3の公開は7月17日。利用可能期間は合計で約3週間しかないが、K3の基礎学習が既に終了していれば、出力を収集し、教師あり微調整、強化学習を行うことも技術的に不可能ではない。

ただ、Moonshot AIの340万回以上のアクセスを発表したのは2月23日で、Fable5の公開は6月9日。したがって、2月の資料が証明しているのは、Moonshot AIが以前のClaudeモデルから能力を抽出しようとした可能性であり、Fable5がK3に使われたことを示すものではない。

米政府は情報を持っていると述べているが、証拠はまだ示していないし、Moonshot AIはReutersの取材に直ちには回答せず、中国大使館は主張を否定している。コーディング試験でK3がFable5と近い成績を出したこと自体は蒸留の証明にはならないし、Moonshot AI自身も、総合能力ではFable5には及ばないと説明している。