ट्रान्सक्रिप्टिनेटर ऑडिओ रेकॉर्ड करतो किंवा इम्पोर्ट करतो, त्याचे ट्रान्सक्रिप्शन करतो, कोण बोलत आहे हे ओळखतो आणि — पर्यायाने — बोललेल्या गोष्टींचे कृती करण्यायोग्य नोट्समध्ये रूपांतर करण्यास तुम्हाला मदत करतो. सर्व संवेदनशील माहिती तुमच्या डिव्हाइसवरच राहते.
सुरुवातीपासून शेवटपर्यंत डिव्हाइसवरच. ऑडिओ कधीही तुमच्या फोनमधून बाहेर जात नाही. ट्रान्सक्रिप्शन स्थानिक पातळीवर ओपन-सोर्स व्हिस्पर मॉडेल्सवर चालते. स्पीकर ओळखण्यासाठी पायनोट डायरायझेशन आणि ३डी-स्पीकर एम्बेडिंग मॉडेल्सचा वापर केला जातो — हे देखील स्थानिक पातळीवरच चालते. तुम्ही एअरप्लेन मोडवर असताना ट्रान्सक्रिप्टिनेटर वापरू शकता; नेटवर्कची आवश्यकता असलेली एकमेव पायरी म्हणजे एकदाच मॉडेल डाउनलोड करणे.
केवळ आवाजच नाही, तर विविध आवाज शिकतो. एकदा स्पीकरचे नाव सांगा — "ती माझी सहकारी डाना आहे" — आणि भविष्यात ती जिथे कुठे बोलेल, त्या प्रत्येक रेकॉर्डिंगमध्ये ट्रान्सक्रिप्टिनेटर तिला आपोआप लेबल लावतो. व्हॉइस प्रोफाइल्स केवळ तुमच्या डिव्हाइसवरच संग्रहित केले जातात आणि कधीही अपलोड केले जात नाहीत.
तुमचा क्वालिटी टियर निवडा. ट्रान्सक्रिप्शनचे तीन स्तर उपलब्ध आहेत: फास्ट (व्हिस्पर बेस, ~२०० MB), बॅलन्स्ड (व्हिस्पर स्मॉल, ~६०० MB), आणि ॲक्युरेट (व्हिस्पर मीडियम, ~१.५ GB). एक ग्लोबल प्रेफरन्स सेट करा, किंवा
एका टॅपमध्ये कोणत्याही एका रेकॉर्डिंगचे वेगळ्या स्तरासह रिट्रान्सक्राइब करा.
तुमचे स्वतःचे नियम तयार करा. बोललेल्या वाक्यांशांना संरचित एक्स्ट्रॅक्शन कार्ड्समध्ये रूपांतरित करा, ज्यावर तुम्ही नंतर कार्यवाही करू शकता. "मांजराला कुरवाळा" म्हणा आणि एक टू-डू मिळवा. "मंगळवारी ३ वाजता भेटूया" म्हणा आणि एक कॅलेंडर इव्हेंट मिळवा. दोन
मॅचिंग मोड्स:
- ऑफलाइन (शब्दशः वाक्यांश) — डिटरमिनिस्टिक, कोणतीही API की नाही, पूर्णपणे डिव्हाइसवर चालते.
- AI (सिमँटिक डिस्क्रिप्शन्स) — LLM कॉन्फिगर केल्यावर, साध्या इंग्रजीतील वर्णने पॅराफ्रेजेस आपोआप ओळखतात.
पर्यायी AI, तुमची स्वतःची की आणा. दस्तऐवज वर्गीकरण, सारांश आणि टू-डू, कॅलेंडर इव्हेंट्स, रिमाइंडर्स, निर्णय, प्रश्न आणि नोट्स यांच्या स्मार्ट एक्सट्रॅक्शनसाठी, खालील तीन प्रोव्हायडर्सपैकी एकाला कनेक्ट करा:
- अँथ्रोपिक (क्लॉड)
- ओपनएआय (चॅटजीपीटी)
- गूगल (जेमिनी)
तुम्ही एपीआय की (API key) आणता. ती तुमच्या डिव्हाइसवर सुरक्षितपणे साठवली जाते — आमच्या सर्व्हरवर कधीही नाही, बॅकअपमध्ये कधीही नाही. संमती ऐच्छिक आहे आणि ती कधीही रद्द करता येते. तुमच्या प्रोव्हायडरला फक्त मजकूर प्रतिलिपी (text transcripts) पाठवल्या जातात
ऑडिओ कधीही नाही, स्पीकर एम्बेडिंग्ज कधीही नाही. मासिक वापराची एकूण रक्कम आणि प्रत्येक रेकॉर्डिंगमधील टोकनची संख्या थेट ॲपमध्ये दाखवली जाते, जेणेकरून तुम्ही काय खर्च करत आहात हे तुम्हाला नेहमी कळते.
प्रत्येक एक्सट्रॅक्शनमध्ये त्याच्या स्रोताचा उल्लेख असतो. ऑडिओमधील नेमक्या त्या क्षणी जाण्यासाठी टू-डू, कॅलेंडर इव्हेंट किंवा रिमाइंडर कार्डवर टॅप करा, जिथे ते बोलले गेले होते. एक्सट्रॅक्शनमध्ये शब्दशः उद्धरण असते आणि ते मूळ सेगमेंटशी लिंक केलेले असते, जेणेकरून तुम्ही कृती करण्यापूर्वी पडताळणी करू शकता.
ट्रान्सक्रिप्टिनेटर कशासाठी उत्तम आहे
- २ ते ६ वक्त्यांसह मीटिंगच्या नोंदी
- दीर्घ मुलाखती, व्याख्याने, प्रवचने
- व्हॉइस मेमोज ज्यांना केवळ रेकॉर्डिंग नव्हे, तर खऱ्या प्रतिलिपींची (ट्रान्सक्रिप्ट्सची) आवश्यकता असते
- फील्ड रेकॉर्डर आयात (WAV, IMA ADPCM सह, MP3, M4A, OGG, FLAC)
- सानुकूल नियमांसह तुमचे स्वतःचे वर्कफ्लो तयार करणे
हे काय करत नाही
- कॉल दरम्यान थेट कॅप्शनिंग — सर्वकाही रेकॉर्डिंगनंतर प्रक्रिया केले जाते
- सुरक्षेसाठी स्पीकरची पडताळणी — आवाज जुळवणे (व्हॉइस मॅचिंग) ही लेबलिंगची सोय आहे, प्रमाणीकरण (ऑथेंटिकेशन) नाही
- क्लाउड सिंक — हे मुद्दामहून केले आहे. तुमची रेकॉर्डिंग तुमच्या फोनवरच राहतात
मोफत, जाहिराती नाहीत, अतिरिक्त विक्री नाही. ट्रान्सक्रिप्टिनेटर मोफत आहे आणि मोफतच राहील. जाहिराती नाहीत, ॲप-मधील खरेदी नाही, प्रीमियम टियर नाही. AI वैशिष्ट्ये खरोखरच ऐच्छिक आहेत — हे ॲप कोणत्याही बाह्य सेवेशिवाय पूर्णपणे कार्य करते.
प्रकाशक: चेरी ब्लॉसम डेव्हलपमेंट, एलएलसी
कोणत्याही रेकॉर्डिंग डिव्हाइसमधून भाषणाचे लिप्यंतरण करा, बोलणाऱ्यांना ओळखा आणि त्यांचे वर्गीकरण करा.
या रोजी अपडेट केले
४ सप्टें, २०२६