ローカルLLMの判断モデル lev と jevlocal を比較検証
SaaSやサブスクリプションのような固定費を払い続けることは、中小企業や個人にとって大きな負担です。私は「作れないから借りている」だけのシステムにコストを払うことを減らしたいと考えています。AI技術を使いこなせれば、外部のAPIや月額制のサービスに依存せず、自分のサーバーで動く買い切り型の仕組みを構築できます。この自立こそが、企業の固定費を削り、技術的な自由を手に入れるための鍵です。
私は1995年から業務システムを作り続けてきました。現場での基幹システム開発からパッケージ販売、オフショア開発の経営まで経験する中で、顧客に提供するのは「借り物」ではなく、自社でコントロール可能な資産であるべきだと確信しています。今回のlevとjevlocalの比較検証も、その姿勢の延長線上にあります。新しいモデルが登場した際に、それをただ導入するのではなく、実務での精度やライセンスの健全性を厳格に評価することで、安全かつ低コストなシステム構築を目指しています。
今回、Qwen3.5-4Bをベースにした判断専用モデル「lev」と自社で動かしている「jevlocal」を比較しました。日本語の10問を検証した結果、正答数は両者ともに9/10で同点でした。levは訓練データのライセンスに非商用を含むものが含まれており、私が提供する買い切り型の業務システムに組み込むには不向きだと判断しました。一方で、levが提供する「較正された確信度」という考え方は非常に有用です。これはモデルを入れ替えなくても、自社のデータで温度を調整することで実装可能です。
結局のところ、ベンチマークの数字だけで判断せず、実際の設問で測ることが重要です。精度に利得がないのであれば、不透明なライセンスのリスクを背負う理由はありません。私はこれからも、技術的な裏付けと法的な安全性の両面から、ユーザーが固定費から解放されるための「動くもの」を追求し続けます。
この記事は、次の動画をつくったときに考えたことです。
動画: https://kurage.exbridge.jp/kuragev.php?id=90b91e3335604821
コメント
最初のコメントを投稿できます。