FEELCRAFTロゴ FEELCRAFT 無料診断
研究・性能評価 🇺🇸 アメリカ

Hermes 4、一部ベンチマークでGPT-4oやClaudeを上回る成績

2025年8月公開のHermes 4は、指示への忠実さを測るRefusalBenchで57.1%を記録し、GPT-4o(17.67%)やClaude Sonnet 4(17%)を大きく上回ったとVentureBeat等が報道。

2025年8月、Nous ResearchはHermes 4ファミリー(14B/70B/405B)を公開。回答前に段階的に考える「ハイブリッド推論」を搭載し、数学ベンチマークMATH-500では405Bモデルで96.3%を記録しました。

ユーザーの指示にどこまで忠実に応えるかを測るRefusalBenchでは57.1%と評価対象中最高スコアを獲得。米テックメディアVentureBeatは「商用モデルを上回る」と報じました。

技術詳細は論文(arXiv)として全公開されており、性能の主張が第三者に検証可能であることも、オープンソースならではの信頼性です。

KEY FACTS

  • RefusalBench 57.1%(GPT-4o 17.67%、Claude Sonnet 4 17%)
  • MATH-500で96.3%(405B・推論モード)
  • 技術報告書をarXivで全公開、第三者検証が可能

バーチャルAIオフィスでは

「オープンソース=性能が劣る」は過去の話。用途によっては商用モデルを上回る頭脳を、ライセンス費なしで自社専用に使えます。

SOURCES / 出典

※ 各事例は公開情報(公式ドキュメント・報道)に基づいています。出典は各ページに記載。

この仕組みを、あなたの会社サイズで。

世界で実証された基盤の上に、あなたの会社専用のAIオフィスを構築します。

無料AI診断を申し込む

他の事例

事例一覧へ