Project

公開中

Jev Voice Decision

日本語音声 → ローカルSTT → Jevによる型付き判断 → Python処理。文章を生成しないAI「Jev」の判断を、普通のコードの分岐にそのまま使う様子を一画面で見せるデモです。

  • Python
  • Parakeet JA
  • Jev / TypeSafe
  • pywebview
  • MIT License
Jev Voice Decisionの画面。INPUT・TRANSCRIPT・JEV DECISIONS・ACTIONの4枚のカードが横に並び、架空のコメントが感想と判定されてフィードバックへ振り分けられている

なにをするもの?

マイクで話した日本語をPCの中のSTT(NVIDIA Parakeet JA)で文字にし、その文字起こし結果だけをTypeSafeのモデル「Jev」に送ります。Jevは文章ではなく、用意した選択肢や尺度に対する判断を確率つきで返すモデルです。

返ってきた判断をどう扱うかは、AIではなくPythonに書いた規則が決めます。質問で返答が必要なら質問キューへ、要望なら要望リストへ、感想ならフィードバックへ。同じ判断が入れば、必ず同じアクションになります。

音声そのものは外に送らず、音声も文字起こしもJevの応答も保存しません。題材は架空のライブ配信のコメントです。

Jevに聞いている3つのこと

  • 主な意図(Choice)

    質問・感想・要望・その他のどれか。全選択肢の確率分布と確信度が返ります

  • 返答が必要か(Noul)

    「はい」である確率が0〜1で返ります

  • 優先度(Score)

    4段階の状況記述のどこか。確率で重みづけした位置と各段階の確率分布が返ります

主な意図の確信度がデモ用の閾値を下回ったときは、アクションを決めずに判断保留として手動確認へ回します。分からないときに無理に決めない、という扱いをコード側で持てるのがJevの出力の特徴です。

Rapid Demo

架空の日本語コメント200件を続けてJevへ送り、判断とアクションが次々に切り替わる様子を見せるモードもあります。結果は事前に用意せず、毎回実際のAPIへ送ります。約30秒の紹介動画はGitHubのReleaseに置いています。

現在地

Text ModeとVoice Mode、Rapid Demoまで動く状態で公開しています。作った経緯と、Jevを使ってみて分かったことは開発記事にまとめています。

GitHub

ソースコードはMIT Licenseで公開しています。動かし方と設計はREADMEにまとめてあります。