← بازگشت به پروژه‌ها
02 / PROJECTS

VoxText | اپلیکیشن هوش مصنوعی تبدیل صدا، تصویر و ویدئو به متن

توسعه اپلیکیشن دسکتاپ VoxText برای تبدیل صدا، تصویر و ویدئو به متن با استفاده از فناوری‌های هوش مصنوعی و پردازش زبان، با پشتیبانی از زبان‌های فارسی و انگلیسی و امکان اجرای کاملاً آفلاین.

پایتون و هوش مصنوعی
فناوری‌ها
Python AI Speech Recognition OCR NLP Desktop Application
تجاری
توضیحات
VoxText یک اپلیکیشن دسکتاپ مبتنی بر Python و هوش مصنوعی است که با هدف ساده‌سازی فرآیند استخراج و تبدیل اطلاعات صوتی و تصویری به متن طراحی و توسعه داده شده است.

این برنامه امکان ضبط مستقیم صدا و تبدیل آن به متن، تبدیل فایل‌های صوتی، استخراج متن از تصاویر با استفاده از OCR و استخراج متن از صدای فایل‌های ویدئویی را فراهم می‌کند. همچنین کاربران می‌توانند خروجی پردازش‌شده را در قالب فایل‌های Word (.docx) و Text (.txt) ذخیره کنند.

یکی از ویژگی‌های اصلی VoxText، تمرکز بر پردازش آفلاین است، به این معنی که پس از نصب و آماده‌سازی برنامه، پردازش اطلاعات بدون وابستگی به سرویس‌های آنلاین انجام می‌شود. این رویکرد علاوه بر کاهش وابستگی به سرویس‌های ابری، امکان استفاده از برنامه را در محیط‌هایی با دسترسی محدود یا بدون اینترنت فراهم می‌کند.

VoxText برای استفاده در سناریوهای مختلفی مانند تبدیل جلسات و فایل‌های صوتی به متن، استخراج متن از تصاویر، تهیه متن از ویدئوها و دیجیتالی‌کردن محتوای متنی طراحی شده و از زبان‌های فارسی و انگلیسی پشتیبانی می‌کند.

در این پروژه، علاوه بر پیاده‌سازی بخش‌های مربوط به پردازش و تشخیص محتوا، تمرکز ویژه‌ای بر ایجاد یک نرم‌افزار قابل نصب و استفاده برای کاربر نهایی، تجربه کاربری ساده و امکان اجرای مستقل برنامه قرار گرفته است.

قابلیت‌های اصلی
🎙️ ضبط مستقیم صدا و تبدیل گفتار به متن
🎧 تبدیل فایل‌های صوتی به متن
📷 استخراج متن از تصاویر با OCR
🎬 استخراج متن از صدای ویدئو
🇮🇷 پشتیبانی از زبان فارسی
🇬🇧 پشتیبانی از زبان انگلیسی
🔌 قابلیت استفاده به‌صورت آفلاین
📄 خروجی Word و TXT
🖥️ ارائه نسخه قابل نصب برای Windows