StemSplitについて
プロフェッショナルなオーディオ分離を誰でも利用可能に。
私たちのミッション
誰もがプロフェッショナルなオーディオツールにアクセスできるべきだと信じています。ベッドルームプロデューサー、カラオケ愛好家、コンテンツクリエイター — StemSplitはスタジオ予算なしでスタジオ品質の結果を提供。私たちは公開で開発しており、ユーザーの提案が直接ロードマップを形成します。
サービス対象
- 音楽プロデューサーとDJ
- カラオケ愛好家
- コンテンツクリエイターとYouTuber
- ポッドキャスターとオーディオエディター
- 音楽教育者と学生
- オーディオアプリを開発するエンジニア
本格的な技術で構築
StemSplitはHTDemucsを使っています。Meta Researchが開発しNeurIPS 2022で発表した最先端のハイブリッドトランスフォーマーモデルです。研究者が使うのと同じモデルを、わかりやすいWeb画面から利用できます。
HTDemucsモデル
HTDemucsは波形領域とスペクトログラム領域を同時に扱うハイブリッドのトランスフォーマー/畳み込みモデルです。この二重領域のアプローチが、Demucs v3やSpleeterのようなCNNのみの旧モデルより精度で勝る理由です。
ONNXエクスポート
モデルは機械学習の相互運用向け公開規格であるONNX形式に書き出しています。PyTorchなしで動くため、より軽く速く持ち運べます。ONNXの重みはHuggingFaceで公開しており、誰でも使えます。
最大6ステム
標準モードは音声をボーカル・ドラム・ベース・その他に分けます。6ステムモデルはさらにギターとピアノを分離します。単一ステムをより高い精度で抜き出す微調整版(htdemucs_ft)も利用できます。
GPUは不要
処理はすべてクラウドで行います。ファイルをアップロードし、こちらでサーバー側に推論を走らせ、分離したステムをダウンロードします。ソフトのインストールも手元のGPUも不要です。
誰が作ったか
StemSplitは、ひとりの開発者が同じ不満に何度もぶつかった末に作りました。既存のボーカル除去ツールは、解約を忘れがちな月額サブスクの裏に隠れるか、また使いたくなる前に期限切れになるクレジットか、どちらかでした。
目標は単純です。すでに存在していてよいはずの道具を作ること。使った分だけ公正に払い、残高は期限切れにならず、品質が十分で別サービスを3つ試す必要がないこと。
インディーのプロダクトです。VCの資金もグロースチームも営業電話もありません。動く道具を正直な価格で、自分も使うひとりが保守しています。ロードマップはユーザー起点です。提案があれば、本当に読みます。
公開開発
開発はオープンに進めています。パッケージはGitHub、PyPI、npm、HuggingFaceに公開しています。ベンチマークの手法も公開です。壊れたら直し、その修正も見える形にしています。
Webサイトだけではない
StemSplitは開発者向けプラットフォームでもあります。Webアプリを動かすのと同じ分離エンジンを、複数の配布経路から利用できます。
REST API
ステム分離へのプログラムからのフルアクセスです。ジョブ送信、状態確認、結果ダウンロード。StemSplitの上に自前ツールを載せる開発者が使っています。
Pythonパッケージ
PyPIのstemsplit-pythonです。ローカルで分離するか、PythonスクリプトやデータパイプラインからAPIを呼び出せます。
CLIツール
Homebrewのstemsplitです。ターミナルからコマンド一つで音源を分離します。一括処理やシェルスクリプトに向いています。
n8nノード
npmのn8n-nodes-stemsplitです。n8nの自動化ワークフローにドラッグ&ドロップでステム分離を入れられます。コードは不要です。
MCPサーバー
npmのstemsplit-mcpです。ステム分離を、ClaudeやGPTなどのAIエージェントがModel Context Protocol経由で直接呼べるツールとして公開します。
Zapier連携
Zapier経由でStemSplitを数千のアプリにつなげます。Google Driveへのアップロード、新しいメール、フォーム送信などから分離を起動できます。
公開された評価手法
複数のHTDemucsモデル変種を実際の楽曲で評価するベンチマークデータセットをHuggingFaceで公開しました。評価は音源分離品質の学術標準指標である信号対歪み比(SDR)に加え、ジャンルやステム種別ごとの試聴も使っています。
HuggingFaceでベンチマークデータセットを見るEvaluation metric
SDRとは
SDR(Signal-to-Distortion Ratio)は、モデルが目的の音源をミックスからどれだけきれいに分離したかをデシベルで測ります。高いほど良好です。この課題の学術標準であるSiSEC Music Separationベンチマークと同じ指標です。
Typical SDR scores (HTDemucs)
Source: StemSplit benchmark dataset on HuggingFace. Higher SDR = cleaner separation.
この課金にした理由
多くの音声ツールがサブスクなのは、ビジネスに都合がよいからです。ほとんどログインしない人からも予測可能な売上が立ちます。私たちはその運営は望んでいません。
StemSplitは使った分だけのクレジットです。処理時間の分を買い、期限は切れません。月に1曲なら1曲分。アルバムをまとめて処理するならその分。上げるプランもなく、上位プランの後ろに隠した機能もありません。
無料枠は新規ユーザーに5分を渡し、本物を試してもらいます。透かし付きプレビューでも30秒クリップでもありません。実際の出力が丸ごと5分です。
私たちが信じること
シンプルさ第一
複雑な技術は使いやすくあるべき。アップロード、処理、ダウンロード — それだけ。
透明な料金
サブスクなし、期限切れクレジットなし。使った分だけ、使った時に支払い。
公開開発
私たちはコミュニティと共に公開で開発しています。あなたの提案とフィードバックは単に聞かれるだけでなく — それが私たちのロードマップです。