خانه
هوش نو
تبدیل گفتار به متن فارسی

تبدیل گفتار به متن فارسی با هوش مصنوعی

فایل صوتی یا ویدیویی را داخل کادر رها می‌کنی و متنِ گفته‌شده را تحویل می‌گیری. کاری که دستی ساعت‌ها طول می‌کشد، اینجا در چند دقیقه انجام می‌شود.

حداکثر حجم فایل
۲۵ مگابایت
فرمت‌های ورودی
۷ فرمت
نوع ورودی
صوت و ویدیو
خروجی
متن قابل ویرایش

سه مرحله تا متن

  1. فایل را رها کن فایل صوتی یا ویدیویی را داخل کادر بکش و رها کن، یا از روی سیستم انتخابش کن. سقف حجم هر فایل ۲۵ مگابایت است.
  2. تبدیل را بزن متنِ گفته‌شده از روی فایل نوشته می‌شود. برای فایل‌های طولانی‌تر، پردازش کمی بیشتر طول می‌کشد.
  3. بازخوانی کن خروجی قابل ویرایش است. نام‌های خاص، اصطلاحات تخصصی و کلمات انگلیسی را در همین مرحله اصلاح کن.

فرمت‌های پذیرفته‌شده

  • mp3
  • mp4
  • mpeg
  • mpga
  • m4a
  • wav
  • webm

چرا پیاده‌سازی دستی این‌قدر وقت می‌برد

قاعده‌ی شناخته‌شده در کار تولید محتوا این است که پیاده‌سازی دستیِ یک فایل صوتی چند برابرِ مدت خودِ فایل طول می‌کشد — چون مدام باید نگه داری، برگردی و دوباره گوش کنی.

وقتی متن اولیه را ماشین می‌نویسد، کار تو از «تایپ کردن» به «بازخوانی و اصلاح» تغییر می‌کند، و آن خیلی سریع‌تر است.

ورودی: هفت فرمت و سقف ۲۵ مگابایت

ابزار هفت فرمت را می‌پذیرد: mp3، mp4، mpeg، mpga، m4a، wav و webm. اینکه mp4 و webm هم در فهرست‌اند یعنی لازم نیست ابتدا صدای ویدیو را جدا کنی؛ خودِ فایل ویدیویی را می‌شود مستقیم داد.

سقف حجم هر فایل ۲۵ مگابایت است. اگر ضبط جلسه‌ات از این بزرگ‌تر است، دو راه ساده داری: فایل را با کیفیت پایین‌تر و به‌صورت mp3 ذخیره کن، یا آن را به چند بخش کوتاه‌تر تقسیم کن و هر بخش را جداگانه تبدیل کن. برای صدای گفتار، mp3 با نرخ بیت پایین معمولاً بدون افت محسوسِ دقت، حجم را چند برابر کم می‌کند.

کاربردهای رایج

پیاده‌سازی مصاحبه برای روزنامه‌نگاران و پژوهشگران؛ صورت‌جلسه از فایل ضبط‌شده‌ی جلسه؛ تبدیل پادکست به مقاله؛ و ساخت زیرنویس برای ویدیوهای آموزشی.

برای دانشجویان هم کاربرد مستقیم دارد: ضبط کلاس و تبدیلش به متنی که بشود در آن جستجو کرد.

چطور بهترین نتیجه را بگیریم

کیفیت صدا مهم‌ترین عامل است. صدایی که در آن گوینده نزدیک میکروفن بوده و صدای زمینه کم است، نتیجه‌ی به‌مراتب تمیزتری می‌دهد.

اگر در فایل چند نفر هم‌زمان حرف می‌زنند، انتظار داشته باش که بازخوانی بیشتری لازم شود — این محدودیتِ ذاتیِ هر سیستم تبدیل گفتار به متن است، نه ایرادِ یک ابزار خاص.

اگر امکانش هست، پیش از ضبط چند ثانیه سکوت بگذار و بعد شروع کن؛ همچنین ضبط در اتاقی با فرش و پرده صدای بازتاب کمتری دارد تا اتاقی خالی با سطوح سخت. این دو کارِ ساده تفاوت محسوسی در دقت خروجی می‌سازند.

چه چیزهایی دقت را پایین می‌آورند

اصطلاحات تخصصی، نام‌های خاص و کلمات انگلیسی که وسط جمله‌ی فارسی می‌آیند، سخت‌ترین بخشِ کار برای هر سیستم تبدیل گفتار به متن هستند. اگر متن تو پر از نام محصول یا اصطلاح فنی است، انتظار داشته باش همان‌ها را دستی اصلاح کنی.

لهجه‌ی غلیظ، حرف زدن خیلی سریع، و قطع‌وصل شدن صدا در تماس اینترنتی هم اثر مستقیم دارند. هیچ‌کدام از این‌ها ابزار را بی‌فایده نمی‌کنند، ولی تعیین می‌کنند که بازخوانی‌ات چند دقیقه طول بکشد یا چند ثانیه.

سوالات متداول

چه فرمت‌هایی را می‌توانم آپلود کنم؟

هفت فرمت: mp3، mp4، mpeg، mpga، m4a، wav و webm. فایل ویدیویی را هم می‌توانی مستقیم بدهی و لازم نیست صدایش را جدا کنی.

حداکثر حجم فایل چقدر است؟

۲۵ مگابایت. برای فایل بزرگ‌تر، آن را به‌صورت mp3 با کیفیت پایین‌تر ذخیره کن یا به چند بخش کوتاه‌تر تقسیمش کن.

آیا فارسی را درست تشخیص می‌دهد؟

بله، این ابزار برای زبان فارسی استفاده می‌شود. مثل هر سیستم تبدیل گفتار به متن، کیفیت خروجی مستقیماً به کیفیت صدای ورودی بستگی دارد.

خروجی را می‌توانم ویرایش کنم؟

بله، متن خروجی قابل ویرایش است و می‌توانی پیش از استفاده اصلاحش کنی.

همین حالا امتحانش کن

رابط کاربری فارسی، پرداخت ریالی، و بدون نیاز به ابزار تغییر آی‌پی.

رفتن به تبدیل گفتار به متن فارسی