研究・性能評価 🇺🇸 アメリカ
Hermes 4、一部ベンチマークでGPT-4oやClaudeを上回る成績
2025年8月公開のHermes 4は、指示への忠実さを測るRefusalBenchで57.1%を記録し、GPT-4o(17.67%)やClaude Sonnet 4(17%)を大きく上回ったとVentureBeat等が報道。
2025年8月、Nous ResearchはHermes 4ファミリー(14B/70B/405B)を公開。回答前に段階的に考える「ハイブリッド推論」を搭載し、数学ベンチマークMATH-500では405Bモデルで96.3%を記録しました。
ユーザーの指示にどこまで忠実に応えるかを測るRefusalBenchでは57.1%と評価対象中最高スコアを獲得。米テックメディアVentureBeatは「商用モデルを上回る」と報じました。
技術詳細は論文(arXiv)として全公開されており、性能の主張が第三者に検証可能であることも、オープンソースならではの信頼性です。
KEY FACTS
- RefusalBench 57.1%(GPT-4o 17.67%、Claude Sonnet 4 17%)
- MATH-500で96.3%(405B・推論モード)
- 技術報告書をarXivで全公開、第三者検証が可能
バーチャルAIオフィスでは
「オープンソース=性能が劣る」は過去の話。用途によっては商用モデルを上回る頭脳を、ライセンス費なしで自社専用に使えます。
SOURCES / 出典
※ 各事例は公開情報(公式ドキュメント・報道)に基づいています。出典は各ページに記載。