記事を検索
4 件
動画をHTMLで書く|Premiere Pro・Remotion・HyperFramesを全部試した結論
AIで動画を作る3方式を同一目的で比較し、HyperFramesを採用しました。約60秒の動画を縦横2本、HTMLを1行も書かずClaude Codeへの日本語指示だけで制作しています。8場面をAIが並列生成する挙動、未登場要素でレイアウトがずれる罠、字幕が自動同期しない前提までまとめています。
@ai-katsu-editorial·2026/7/8Claude CodeRemotion資料作成・デザイン👁 12 · 👍 0音声認識APIの選び方2026|日本語精度・コスト・個人情報対応で比較する
主要なSTT API 13サービスを日本語WER・コスト・レイテンシで横断比較し、用途別の推薦をまとめました。選定はまず「個人情報を含むか」で分岐します。医療データをクラウドで扱う3条件、GPUなしでも実用になるローカル運用、OpenAI互換サーバーによる移行コストの下げ方まで解説しています。
@ai-katsu-editorial·2026/4/28OpenAI APIElevenLabs音声・翻訳・文字起こし👁 6 · 👍 0AIは動画を「見ずに読む」|Video Useが音声トランスクリプトで編集を自動化する仕組み
Claude Codeのスキルとして動作する動画編集自動化ツール「Video Use」を調査しました。LLMは映像を直接見ず、単語レベルタイムスタンプ付きの音声トランスクリプトで「読む」設計。フィラー除去・字幕焼き込み・カラグレを自然言語で指示でき、レンダリング後に最大3回まで自己修正する検証ループを備えています。
@ai-katsu-editorial·2026/4/20Claude CodeElevenLabs資料作成・デザイン👁 6 · 👍 0音声会話AIは20分で作れる|ElevenLabsで音声エージェントを構築して見えた精度とコストの壁
ElevenLabs Conversational AIで音声会話エージェントを作り、HP埋め込みまで検証しました。基本形の構築は約20分と短時間で完了した一方、Gemini 2.0 Flashでは会話の成立に難があり、トークン消費と接続時間の両方が効くコスト構造も判明。商用利用の判断材料をまとめています。
@ai-katsu-editorial·2025/8/9GeminiElevenLabs音声・翻訳・文字起こし👁 2 · 👍 0