Blinking Cartoony Heart Girly Doll
Monday, 3 November 2014
Virtual reality bakal kembali dalam cara yang sangat menakjubkan dengan kehadiran Oculus Rift, perangkat yang diperkenalkan di Consumer Electronics Show, Las Vegas, Nevada. Oculus Rift adalah Head-mounted Virtual Reality Display  (sebuah display yang langsung dikenakan didepan mata), yang dalam bahasa Indonesia dapat ditranslasikan sebagai layar virtual reality yang dipasang di kepala. Oculus Rift dilengkapi dengan head tracking, yg akan mengikuti pergerakan kepala kita. Pandangan kita dalam game menyesuaikan dengan pergerakan kepala kita, menunduk/menoleh dan menengadah. Virtual reality adalah simulasi keberadaan fisik suatu tempat dan objek yang dilakukan oleh komputer. Secara sederhana, Oculus Rift adalah sebuah layar komputer berbentuk kacamata yang ditempelkan di kepala dengan tali elastis. Masing-masing mata melihat pada layarnya tersendiri, dan menghalangi semua pandangan selain pada layar. Gambar yang ditampilkan tidaklah sama persis, layar kiri menunjukkan lebih banyak area di sebelah kiri dan sebaliknya untuk yang kanan. Saat menggunakan alat ini, otak anda menangkap kedua gambar dan menyatukannya menjadi sebuah gambar yang mensimulasikan jarak pandang mata bagaikan melihat sebuah benda di dunia nyata.

Oculus Rift juga dapat melacak pergerakan kepala, yang memungkinkan anda untuk menoleh dan melihat sekeliling di dalam game. Alat ini mendeteksi apakah anda melihat ke atas, bawah, kiri, kanan, dan juga ketika anda memiringkan kepala ke kanan atau kiri dan menyesuaikan tampilan pada layar. Hal ini dapat dilakukan menggunakan kombinasi dengan kombinasi 3 poros Gyroscope, Accelerometer, dan Magnetometer. 
Oculus Rift tampak seperti sepasang kacamata ski. Di dalamnya terdapat dua lensa, satu untuk setiap mata, yang mengarah pada layar LCD tunggal. Layar akhir akan menjadi 7 inci, sedang prototipe yang diuji 5,6 inci. Layar itu memberikan dua gambar terpisah, satu untuk masing-masing mata, sehingga pengguna mendapatkan stereoscopic 3-D. Occulus Rift versi developer kit memiliki resolusi "HD" sebesar 1280 x 800 atau 640 x 800 per mata. Nantinya, di versi final, resolusi tersebut bakal ditingkatkan menjadi 1920 x 1080 yang berarti menambah beban.

Inilah yang menakjubkan, yakni sensor di accelerometer dangyroscope yang masuk ke dalam game PC. Ketika pengguna memutar kepala, pandangannya bergerak hampir sempurna dengan alat ini, 360 derajat, serta pandangan ke atas dan ke bawah. Situs Oculus mengatakan Rift menggunakan teknologi pelacakan khusus yang membuat latency pelacakan kepala 360 derajat sangat rendah sehingga memungkinkan pengguna secara mulus melewati dunia maya seperti di kehidupan nyata. Setiap gerakan halus kepala pengguna dilacak secara real time sehingga menciptakan pengalaman alami dan intuitif.

Perangkat canggih ini bekerja seperti sebuah peripheral. Anda menghubungkan ke komputer Anda dan bermain game PC dengannya. Ia membutuhkan sebuah PC gaming berkemampuan besar pada saat ini. Oculus Rift dimulai sebagai proyek hobi Palmer Luckey. Pria ini mengawali idenya dengan membongkar smartphone dan lantas membuatnya sebagai pendahulu Oculus Rift. Kemudian proyek itu digarap Kickstarter, sebuah platform pendanaan terbesar di dunia untuk proyek-proyek kreatif yang kabarnya telah dipatenkan oleh Facebook.
Pengguna yang memakai Oculus Rift akan masuk ke dunia yang sama sekali baru. Gerakan tubuh mereka bakal merespons seperti di dunia nyata. Sangat nyaman dan alatnya tidak terlalu berat, hanya 369 gram. Benar-benar seperti kacamata ski. Rift menyediakan sudut pandang sekitar 110 derajat. Kombinasi sudut pandang lebar dengan pelacakan kepala dan stereoscopic 3D inilah yang diklaim pengembangnya menciptakan pengalaman virtual reality masa depan.

Satu-satunya masalah adalah kecenderungan untuk memindahkan seluruh tubuhnya dan bukan hanya headset. Jika Anda bersandar untuk melihat sekitar sudut, misalnya, headset tidak dapat menerjemahkannya ke dalam gerakan dalam game. 
Development Kit diharapkan keluar bulan Maret dan perusahaan berharap versi consumer product dapat dirilis tidak terlalu lama pada tahun ini. Oculus mengatakan harganya sekitar US$ 300. Ini adalah pergerakan paling inovatif pada dunia Game saat ini.


Kelebihan dan Kekurangan Oculus Rift:

Kelebihan dalam menggunakan alat ini,diantaranya
  • kualitas grafis terbaik
  • Pengguna serasa masuk kedalam game tersebut
  • Memperluas bidang pandang game
  • Kontrol dapat dilakukan lewat gerakan kepala sehingga memberi kesan nyata

Sebagai alat ciptaan menusia terutama baru saja dikembangkan maka oculus rift tak lepas dari ketidak sempurnaan. Berikut kekurangan dari penggunaan alat oculus rift
  • Sebaiknya tidak diperbolehkan untuk usia lanjut, penyandang penyakit jantung, vertigo, ayan, hipertensi, dll karena efek dari bermain game pada Oculus Rift dapat membuat reaksi berlebihan seperti shock, kaget, takut, mual, dll.
  • Game yang didukung pada Oculus Rift masih sedikit dan harga satuan gamenya cukup mahal karena pengembangannya juga masih baru.
  • Penyebaran alat belum merata diseluruh dunia
  • Harga cenderung mahal
  • Pengguna tidak peka dengan lingkungan sekitar sehingga ia tak akan menyadari suatu kejadian darurat disekitarnya
  • Mempercepat kerusakan mata karena jarak pandang mata terlalu dekat
  • Pengguna akan mengalami krisis interaksi sosial
Masa Depan Oculus Rift
Selain perkembangannya dalam dunia gaming, saya rasa Oculus Rift dapat digunakan dalam berbagai macam kegunaan lain. Simulator misalnya, alat latihan yang tersedia selama ini menggunakan layar dapat digantikan dengan Oculus Rift untuk mendapatkan immersion lebih dalam. Kegunaan virtual reality tidak terhenti di sini, pengembang masih dapat menggunakannya untuk berbagai hal lain baik entertainment atau bisnis. Selain itu cara kerja Oculus rift ini dapat dikembangkan dan diaplikasikan dalam pengoperasian alat jarak jauh seperti kontrol pesawat tempur tak berawak, kontrol robot dan yang lainnya.
Sunday, 2 November 2014
Siri adalah asisten pribadi pintar yang menolong Anda menyelesaikan segala sesuatu cukup dengan meminta. Dengan fitur yang di ciptakan oleh Apple ini, Siri memberi kemudahan yang unik kepada para penggunanya dalam mencari informasi yang di perlukan. Siri akan membantu dalam setiap pekerjaan Anda, Anda hanya cukup mengatakan perintah ke pada siri dan aplikasi ini akan memahami apa yang anda perintahkan, seperti memiliki asisten pribadi, ada beberapa hal yang bisa dilakukan oleh siri. Siri memungkinkan Anda menggunakan suara Anda untuk mengirim pesan, jadwal pertemuan, melakukan panggilan telepon, dan lainnya. Tetapi Siri tidak seperti perangkat lunak pengenalan suara konvensional yang mengharuskan Anda untuk mengingat kata kunci dan menyebutkan perintah tertentu. Siri mengerti suara natural Anda, dan Siri menanyakan sesuatu jika memerlukan informasi lebih lanjut untuk menyelesaikan tugas.
Hanya dengan member input suara dalam berbahasa Inggris (maupun berbagai bahasa lain yang didukung) Siri akan mengerti apa yang Anda katakan dan mencari informasi yang Anda perlukan, setelah informasi didapat maka Siri akan menjawabmu. Ini seperti Anda sedang melakukan pembicaraan dengan iphone Anda sendiri.  Dengan teknologi Siri Anda bisa menggunakan iPhone 4S dengan menggunakan perintah suara. Sebagai contoh, saat Anda akan menelepon sang Adik, Anda tidak perlu susah-susah mencari-cari nomor teleponnya di phonebook, tapi cukup katanya “Call My Sister” maka Siri pun akan langsung menelpon Adik Anda.
Apilkasi Siri  melakukan banyak perintah yang bisa diberikan kepadanya, misalnya Anda bisa mengirim email, menyuruh Siri untuk menyebutkan nomor handphone seseorang yang ada di Phonebook, mengirimkan SMS, menyuruh Siri untuk memutar Playlist lagu, meminta informasi tentang sesuatu misal tentang  restaurant terdekat, perintah menset alarm, perintah untuk menunjukkan arah, sampai mengatur jadwal meeting.
Anda bisa meminta Siri untuk mengirim sms ke seseorang, mengingatkan akan berbagai hal, atau mencari direction, dan siri juga bisa mencari tahu aplikasi apa yang akan di gunakan. Siri mencari jawaban untuk anda via website terutama dari Yelp and Wolfram Alpha. Siri juga menggunakan servise lokasi, Siri juga mengingat dimana tempat tinggalmu, dimana Anda bekerja, dan dimana Anda berada.
Sehinga siri dapat memberikanmu informasi dan pilihan yang terbaik. Dari kontak Anda, siri juga mengetahui siapa temanmu, keluargamu, pacarmu dan bosmu jadi Anda dapat memberikan perintah kepada siri untuk mengirim sms kepada pacar atau orangtuamu contohnya : kirim sms ke Pacar “saya nanti agak telat menjemputmu” atau telepon taxi sekarang! dan bangyak lagi kegunaan dari siri.Sangat mudah dan cepat bukan? 
Siri tersedia di perangkat berikut:
  • iPhone 4s atau versi lebih baru
  • iPad generasi ke-3 atau versi lebih baru
  • iPad mini
  • iPod touch (generasi ke-5)
Dengan app apa Siri dapat berfungsi?
Siri berfungsi dengan hampir semua app internal. Dan Siri cukup pintar untuk menentukan app yang digunakan untuk memberikan jawaban. Siri juga menggunakan Layanan Pencarian dan Lokasi untuk membantu memenuhi permintaan Anda. Berikut adalah daftar app dan layanan yang berfungsi dengan Siri di seluruh dunia:
  • Telepon
  • FaceTime
  • Dikte
  • Musik
  • Mail
  • Pesan
  • Kalender
  • Pengingat
  • Catatan
  • Kontak
  • Alarm
  • Jam Dunia
  • Timer
  • Cuaca
  • Shazam
  • Saham
  • Pencarian Web
  • Pencarian Wikipedia
  • Wolfram|Alpha (Hanya bahasa Inggris)
  • Cari Teman Saya
  • Posting di Facebook atau Twitter
  • Film
  • Olahraga
  • Peluncuran app
  • Peta
  • Pencarian lokal

Siri mengerti dan dapat berbicara dalam bahasa berikut:

  • Amerika Serikat (Inggris, Spanyol)
  • Inggris (Inggris)
  • Australia (Inggris)
  • Prancis (Prancis)
  • Jerman (Jerman)
  • Jepang (Jepang)
  • Kanada (Prancis Kanada, Inggris)
  • Cina (Mandarin)
  • Hong Kong (Kanton)
  • Italia (Italia)
  • Korea (Korea)
  • Meksiko (Spanyol)
  • Spanyol (Spanyol)
  • Swiss (Prancis, Jerman, Italia)
  • Taiwan (Mandarin)

Bagaimana SIRI dapat bekerja? 
SIRI diprediksi terdiri dari 3 lapis program: analiser ucapan ke teks, analiser tata bahasa, dan beberapa penyedia layanan.
  1. Analiser ucapan ke teks (speech to text analyzer) adalah software yang berfungsi untuk mengubah suara yang masuk menjadi teks. Kendati secara konsep sederhana, namun tidak demikian dengan implementasinya. Ketepatan dalam mengkonversi sebuah ucapan ke dalam sebuah teks memerlukan algoritma yang sangat rumit yang dikembangkan selama bertahun-tahun. Di SIRI, pekerjaan ini telah disederhanakan karena SIRI tidak diharuskan mengkonversi keseluruhan kata melainkan hanya mengutip frasa-frasa tertentu yang telah dijabarkan dalam daftar kemampuan SIRI terdahulu.
  2. Analiser tata bahasa adalah software yang dirancang untuk memahami maksud dari sebuah kalimat yang diucapkan berdasarkan frasa kunci yang terkandung di dalamnya. Selain memanfaatkan frasa kunci, SIRI juga menggunakan analisis gramatika dan pencocokan string untuk memahami perintah atau pertanyaan yang Anda ajukan.
  3. Penyedia Layanan : social media facebook twitter, koneksi internet, peta, kontak, dll

CARA MENGGUNAKAN
Agar bisa mulai menggunakan Siri, terlebih dahulu Anda harus memasukan nama Anda. Masuk ke menu Setting – General – SIRI – My Info dan masukan nama Anda, selanjutnya pilih bahasa yang dipakai baik itu UK English, US English, French, ataupun German. Meski untuk sekarang hanya tersedia secara full yakni US English. Sayang sekali memang untuk Bahasa Indonesia, belum tersedia! Jadi untuk menggunakan SIRI ini Anda wajib menggunakan perintah Bahasa Inggris!
Untuk menggunakan SIRI, Anda cukup tekan tombol Home di iPhone 4S tunggu sampai terdengar bunyi Beep dua kali, selanjutnya akan muncul icon Microphone dan tulisan “What can I help you with?” selanjutnya Anda tinggal masukan perintah kepada Siri semisal “Play Marry You” atau “Play my Playlist number 7” jika Anda ingin mendengarkan lagu Marry You dari Bruno Mars, tentunya pastikan di koleksi lagu iTunes Anda ada lagu tersebut. Atau jika Anda ingin mengirim SMS ke sang adik tinggal masukan perintah “Send Text Message to My Sister” pastikan nomor handphone sang adik sudah ada di Phonebook dan di bagian relationshipnya sudah di set ke sister!
Saat memberikan perintah kepada Siri, pastikan Anda mengucapkan kalimat perintah dengan jelas, jangan terpotong-potong, jangan sampai Anda memberikan perintah “call my…..mmmm…. my mother?” tentunya Siri akan sedikit bingung mendengar kalimat yang terpotong dan tidak jelas. Selain itu pastikan perintah yang dimasukan juga jelas dan lebih spesifik, jangan memberikan perintah yang terlalu umum, semisal “Call My Phonebook” ini jelas akan membuat bingung? Masa harus menelepon setiap contact yang ada di phonebook?


Keuntungan dari Siri: 
  • Anda dapat menemukan restoran terdekat dengan hanya mengemudi dan memberikan perintah ke iphone Anda melalui suara dengan teknologi siri.
  • Anda dapat membaca pesan teks.
  • Lihat peta.
  • Membuat janji.
  • Tunggu panggilan.
  • Dan masih banyak banyak lagi manfaat dan keuntungan lainnya.

Dan berikut adalah beberapa kelemahan pada siri: 
  • Anda harus terhubung ke internet untuk menggunakan siri yang tidak dalam 3GS.
  • Peta hanya diterjemahkan dalam bahasa Inggris kami sehingga Anda harus berbicara dalam bahasa Inggris kita yang lain itu tidak menemukan peta.
  • Kadang perintah suara tidak diinterpretasikan oleh iphone saat Anda berbicara dan terjadi sesuatu yang tidak Anda inginkan.
  • Untuk memakai Siri, Anda harus berada di tempat yang tidak bising agar suara Anda dapat ditangkap dengan baik.
Sumber:

Di berbagai media, Anda mungkin pernah menyaksikan Stephen Hawking berbicara di depan mahasiswanya. Fisikawan yang terkenal dengan teori black hole-nya ini sudah tidak mampu lagi mengeluarkan suara dari lisannya, namun berkat teknologi speech synthesizer, dia masih bisa bercakap-cakap. Mesin speech synthesizer Hawking memang cukup kompleks. Alat ini tidak hanya memproduksi suara, tetapi juga menangkap input dari gerakan mata sang doktor. Demikian pula, misalnya, dengan aplikasi voice command yang banyak tertanam di smartphone mutakhir yang memadukan speech recognizer dengan speech synthesizer.
Aplikasi speech synthesizer yang paling sederhana sebenarnya ada pada setiap PC ber-OS Windows. Bila anda menekan tuts Winkey + U di keyboard, Windows akan mengaktifkan Utility Manager, yang di dalamnya terdapat aplikasi Microsoft Narrator. Aplikasi ini akan membaca setiap jendela yang anda aktifkan, termasuk tombol-tombol di dalamnya. Atau, mungkin anda pernah menginstal aplikasi microsoft reader di PC. Aplikasi yang diperuntukkan bagi file >LTT ini pun dilengkapi dengan kemampuan menerjemahkan teks menjadi suara (text to speech) yang merupakan contoh teknologi speech sybthesizer.
Apa itu Speech Synthesis?
Speech synthesis adalah sebuah kemampuan bicara manusia yang dibuat oleh manusia (artificial). Sebuah sistem komputer digunakan untuk tujuan ini yang disebut sebagai speech synthesizer, dan dapat diimplementasikan ke dalam software atau hardware. Sebagai contoh sebuah sistem text-to-speech (TTS) yang dapat mengkonversikan teks dengan bahasa biasa menjadi suara.
Sebuah sistem komputer yang digunakan untuk tujuan ini disebut speech synthesizer, dan dapat diimplementasikan dalam perangkat lunak atau perangkat keras produk. Sebuah teks-to-speech (TTS) sistem mengkonversi teks bahasa normal menjadi berbicara; sistem lain membuat representasi linguistik simbolik seperti transkripsi fonetik ke dalam pidato, pidato disintesis dapat dibuat dengan menggabungkan potongan pidato direkam yang disimpan dalam database. Sistem berbeda dalam ukuran unit pidato disimpan, sebuah sistem yang menyimpan telepon atau diphones menyediakan berbagai keluaran terbesar, tapi mungkin kurang jelas.

Speech synthesis adalah transformasi dari teks ke arah suara (speech). Transformasi ini mengkonversi teks ke pemadu suara (speech synthesis) yang sebisa mungkin dibuat menyerupai suara nyata, disesuaikan dengan aturan – aturan pengucapan bahasa.TTS (text to speech) dimaksudkan untuk membaca teks elektronik dalam bentuk buku, dan juga untuk menyuarakan teks dengan menggunakan pemaduan suara. Sistem ini dapat digunakan sebagai sistem komunikasi, pada sistem informasi referral, dapat diterapkan untuk membantu orang-orang yang kehilangan kemampuan melihat dan membaca.
Synthesized speech dapat diciptakan dengan menggabungkan beberapa potongan-potongan dari pembicaraan/pidato yang sudah direkam dalam sebuah basis data. Kualitas dari sebuah speech synthesizer dilihat dari kemiripannya dengan suara manusia dan kemampuannya untuk bisa dipahami. Program TTS yang jelas dapat membantu orang dengan gangguan visual atau ketidakmampuan membaca, untuk mendengarkan pada pekerjaan yang tertulis dalam komputer. Banyak Sistem Operasi komputer yang telah dimasukkan speech synthesizer sejak tahun 1980-an.
Sebuah sistem text-to-speech (atau "mesin") terdiri dari dua bagian: front-end dan back-end . Front-end memiliki dua tugas utama. Pertama, mengubah teks mentah berisi simbol seperti angka dan singkatan menjadi setara dengan kata-kata tertulis-out. Proses ini sering disebut normalisasi teks, pra-pengolahan, atau tokenization . Front-end kemudian memberikan transkripsi fonetik untuk setiap kata, dan membagi dan menandai teks ke unit prosodi , seperti frase , klausa , dan kalimat . Proses menetapkan transkripsi fonetik untuk kata-kata ini disebut teks-ke-fonem atau grafem konversi -untuk-fonem. Transkripsi fonetik dan informasi prosodi bersama-sama membentuk representasi linguistik simbolik yang output dengan front-end. Back-end-sering disebut sebagai synthesizer-maka mengubah representasi linguistik simbolik menjadi suara. Dalam sistem tertentu, bagian ini meliputi perhitungan dari target prosodi (kontur pitch, durasi fonem), yang kemudian dikenakan pada pidato output.
Sejarah Speech Synthesis
Upaya yang paling awal untuk menghasilkan lahirnya pemandu suara, pada abad XVIII. Terlepas dari kenyataan bahwa upaya pertama  adalah bentuk mesin mekanis, kita dapat mengatakan hari ini  bahwa synthesizer sudah berkualitas tinggi. Pada tahun 1779 di
St Petersburg, Rusia Profesor Kratzenshtein Kristen  fisiologis menjelaskan perbedaan antara lima vokal panjang  (/ A /, / e /, / i /, / o /, dan / u /) dan membuat alat untuk menghasilkan  mereka artifisial. Tahun 1791 di Wina, Wolfgang von Kempelen memperkenalkan nya “Akustik-Mekanik Mesin Speech”. Dalam  sekitar pertengahan 1800-an Charles Wheatstone dibangun terkenal  versi mesin berbicara von Kempelen’s.

Generasi dari sistem pemaduan suara ini dapat dibagi ke dalam 3 masa, yaitu:
1.     Generasi pertama (1962-1977). Format sintesis dari fonem adalah teknologi dominan. Teknologi ini memanfaatkan aturan berdasarkan penguraian fonetik pada kalimat untuk kontur frekuensi forman. Beberapa sintesis masih miskin atau kurang  dalam kejelasan dan kealamiannya.
2.     Generasi kedua (1977-1992). Metode pemadu suara adalah diphone diwakilkan  dengan parameter LPC. Hal tersebut menunujukkan bahwa kejelasan yang baik pada pemadu suara dapat diperoleh dengan andal dari input teks dengan menggabungkan diphone yang sesuai dengan unit. Kejelasan meningkat selama sintesis forman, tetapi kealamian dari pemadu suara masih tetap rendah.
3.     Generasi ketiga (1992-sekarang). Generasi ini ditandai dengan metode ‘ sintesis pemilihan unit’ yang diperkenalkan dan disempurnakan oelh Sagisaka di Labs ATR Kyoto. Hasil dari pemandu suara pada periode ini sangat mendekati  human-generated speech pada bagian kejelasan dan kealamian,
Teknologi pemadu suara modern melibatkan metode dan algoritma yang canggih dan rumit. alat pemadu suara  dari keluarga “Infovox” mungkin mejadi salah satu multi bahasa TTS yang paling dikenal saat ini. Versi komersial pertamanya, Infovox-SA 101, dikembangkan pada tahun 1982 di Institute Teknologi Royal, Swedia dan didasarkan pada sintesis forman.
AT & T Bell Laboratories (Lucent Technologies) juga memiliki tradisi yang sangat panjang tentang pemandu suara (speech synthesis). TTS lengkap yang pertama didemostrasikan di Boston pada tahun 1972 dan diliris pada tahun 1973. Hal ini didasarkan pada model artikulatoris yang sikembangkan oleh Ceceil Coker (Klatt 1987). Pengembangan proses dari sistem penggabungan sintesis ini dimulai oleh Joseph Olive pada pertengahan tahun 1970-an (Bell Labs 1997). Sistem ini sekarang sudah tersedia untuk bahasa Inggris, Perancis, Spanyol, Italia, Jerman, Rusia, Rumania, Cina, dan Jepang (Mcbius et al 1996).
Perangkat Speech Synthesis 
Pidato sistem sintesis berbasis komputer pertama diciptakan pada akhir 1950-an. Pertama umum Inggris sistem text-to-speech dikembangkan oleh Noriko Umeda et al. Pada tahun 1968 di Laboratorium Elektroteknik, Jepang. Pada tahun 1961, fisikawan John Larry Kelly, Jr dan Louis rekan Gerstman menggunakan IBM 704 komputer untuk mensintesis pidato, acara yang paling menonjol dalam sejarah Bell Labs . Kelly perekam suara synthesizer ( vocoder ) ulang lagu " Daisy Bell ", dengan iringan musik dari Max Mathews .Kebetulan, Arthur C. Clarke mengunjungi teman dan kolega John Pierce di fasilitas Bell Labs Murray Hill. Clarke begitu terkesan oleh demonstrasi bahwa ia digunakan dalam adegan klimaks dari skenario-Nya untuk novel nya 2001: A Space Odyssey, di mana HAL 9000 komputer menyanyikan lagu yang sama seperti yang sedang ditidurkan oleh astronot Dave Bowman. Meskipun keberhasilan pidato sintesis murni elektronik, penelitian masih terus dilakukan ke synthesizer pidato mekanis.
Handheld elektronik menampilkan sintesis pidato mulai muncul pada 1970-an. Salah satu yang pertama adalah Telesensory Systems Inc(TSI) Pidato + kalkulator portabel untuk orang buta pada tahun 1976. Perangkat lain yang diproduksi terutama untuk tujuan pendidikan, seperti Bicara & Eja , yang diproduksi oleh Texas Instruments pada tahun 1978. Fidelity merilis versi berbicara komputer catur elektronik pada tahun 1979. Yang pertama video game yang memiliki fitur sintesis pidato adalah 1.980 shoot 'em up arcade game , Stratovox , dari Sun Electronics. Contoh lain awal adalah versi arcade dari Berzerk , dirilis pada tahun yang sama.Pertama multi-player permainan elektronik menggunakan sintesis suara adalah Milton dari Milton Bradley Company , yang memproduksi perangkat di tahun 1980. 
Teknologi Speech Synthesis
Yang paling penting dalam kualitas sistem speech synthesis adalah kealamian dan kejelasannya. Kealamaian menjelaskan bagaimana dekatnya suara output dengan suara manusia, sementara kejelasan adalah dengan kemudahan di mana output tersebut dapat dipahami. Speech synthesizer yang ideal adalah yang alami dan jelas. Sistem speech synthesis biasanya mencoba untuk memaksimalkan kedua karakteristik.
Kualitas terpenting dari sebuah aplikasi speech synthesizer adalah seberapa alami dan inteligibel output yang dihasilkannya. Alami, artinya seberapa dekat suara yang dihasilkan aplikasi speech synthesizer dengan suara manusia. Sedangkan inteligibel adalah seberapa mudah output tersebut dipahami oleh manusia. Semua aplikasi speech synthesizer berusaha untuk menghasilkan output yang alami dan inteligibel sekaligus.
Sampai saat ini, ada banyak teknologi untuk meng-generate gelombang suara sintetis ini. Dua teknologi yang paling banyak digunakan adalah concatenative synthesis dan formant synthesis. Keduanya memiliki keunggulan dan kekurangan sendiri-sendiri.
Teknologi pertama, concatenative synthesis, berbasis pada rangkaian (atau merangkai bersama) segmen-segmen dari suara yang direkam. Umumnya, teknologi ini menghasilkan suara sintesis yang terdengar paling alami.Namun, perbedaan antara suara alami yang direkam dengan segmentasi gelombang bunyi kadang menghasilkan suara yang menggangu. Mirip seperti suara pemberitahuan nomor antrean di bank atau suara call center operator ponsel yang menyebutkan sisa pulsa dan masa berlaku kartu ponsel anda.
Teknologi kedua, formant synthesis, tidak menggunakan sampel suara manusia melainkan membuat suara sintesi menggunakan model akustik. Parameter-parameter seperti frekuensi dasar, alunan suara, dan tingkat kebisingan bervariasi dari waktu ke waktu untuk menciptakan gelombang suara buatan.
Kebanyakan aplikasi berbasis teknologi ini menghasilkan suara buatan (tidak alami) seperti suara robot. Melihat keterbatasan kedua teknologi ini dalam menghasilkan suara buatan, seperti kita harus sabar menunggu pengembangannya lebih lanjut dalam beberapa tahun atau dekade ke depan.
Kualitas yang paling penting dari sebuah sistem sintesis pidato kewajaran dan dimengerti. kealamian menjelaskan seberapa dekat output terdengar seperti suara manusia, sementara kejelasan adalah kemudahan yang output dipahami. Speech synthesizer yang ideal adalah baik alam dan dimengerti. Sistem sintesis pidato biasanya mencoba untuk memaksimalkan kedua karakteristik.
Dua teknologi utama dalam pembuatan gelombang suara synthetic speech adalah Concatenative Synthesis dan Formant Synthesis. Setiap teknologi mempunyai kekuatan dan kelemahannya, dan penggunaan yang ditujukan dari sistem synthesis akan menentukkan pendekatan mana yang digunakan.
  • A. Concatenative Synthesis : 
Concantenative synthesis didasarkan dengan penggabungan dari segmen-segmen dari pembicaraan yang sudah direkam. Secara umum, concatenative synthesis memproduksi synthesized speech dengan suara yang paling alami. Tetapi, perbedaan antara variasi alami dalam pembicaraaan dan sifat dari teknik otomasi untuk pensegmentasian gelombang suara terkadang menghasilkan kesalahan suara dalam output. Namun, perbedaan antara variasi alami dalam pidato dan sifat teknik otomatis untuk membagi bentuk gelombang kadang-kadang menyebabkan gangguan terdengar pada output. Ada tiga sub-jenis utama dari sintesis concatenative.
    • Sintesis Pemilihan unit
      • Sintesis Pemilihan unit menggunakan besar database pidato direkam. Selama pembuatan database, setiap ucapan tercatat tersegmentasi ke dalam beberapa atau semua hal berikut: individu telepon , diphones , setengah-telepon, suku kata , morfem , kata , frase , dan kalimat . Biasanya, pembagian ke dalam segmen dilakukan dengan menggunakan dimodifikasi khusus recognizer pidato disetel ke "keselarasan dipaksa" mode dengan beberapa koreksi manual setelah itu, dengan menggunakan representasi visual seperti yang gelombang dan spektogram .  Sebuah indeks unit dalam database pidato kemudian dibuat berdasarkan segmentasi dan parameter akustik seperti frekuensi dasar (lapangan ), durasi, posisi dalam suku kata, dan telepon tetangga. Pada waktu berjalan , target ucapan yang diinginkan dibuat dengan menentukan rantai terbaik unit calon dari database (pemilihan unit). Proses ini biasanya dicapai dengan menggunakan khusus tertimbang pohon keputusan .
      • Pemilihan unit menyediakan kealamian terbesar, karena hanya berlaku sedikit pemrosesan sinyal digital (DSP) untuk pidato direkam. DSP sering membuat pidato yang direkam terdengar kurang alami, meskipun beberapa sistem menggunakan sejumlah kecil pengolahan sinyal pada titik Rangkaian untuk menghaluskan bentuk gelombang. Output dari yang terbaik unit-seleksi sistem sering dibedakan dari suara manusia nyata, terutama dalam konteks dimana sistem TTS telah disetel. Namun, kealamian maksimum biasanya membutuhkan unit-pilihan database pidato menjadi sangat besar, dalam beberapa sistem mulai ke gigabyte data dicatat, mewakili puluhan jam berbicara.  Juga, pilihan algoritma Unit telah dikenal untuk memilih segmen dari Tempat yang menghasilkan kurang dari sintesis ideal (misalnya kata-kata kecil menjadi tidak jelas) bahkan ketika pilihan yang lebih baik ada dalam database. Baru-baru ini, peneliti telah mengusulkan berbagai metode otomatis untuk mendeteksi segmen alami di unit-pilihan sistem sintesis pidato.
    • Sintesis diphone 
      • Sintesis diphone menggunakan database pidato minimal berisi semua diphones (suara-to-suara transisi) yang terjadi dalam suatu bahasa. Jumlah diphones tergantung pada fonotaktik bahasa: misalnya, Spanyol memiliki sekitar 800 diphones, dan Jerman sekitar 2500. Dalam sintesis diphone, hanya satu contoh dari setiap diphone terkandung dalam database pidato. Pada saat runtime, target prosodi kalimat ditumpangkan pada unit-unit minimal dengan cara pemrosesan sinyal digital teknik seperti linear predictive coding ,PSOLA atau MBROLA. Diphone sintesis menderita gangguan sonik sintesis concatenative dan robot-terdengar sifat sintesis forman, dan memiliki beberapa keuntungan baik pendekatan lain dari ukuran kecil. Dengan demikian, penggunaannya dalam aplikasi komersial menurun, meskipun terus digunakan dalam penelitian karena ada beberapa implementasi perangkat lunak tersedia secara bebas.
    • Domain-spesifik sintesis 
      • Domain-spesifik sintesis concatenates direkam sebelumnya kata dan frase untuk menciptakan ucapan-ucapan yang lengkap. Hal ini digunakan dalam aplikasi di mana berbagai teks output sistem akan terbatas pada domain tertentu, seperti jadwal angkutan pengumuman atau laporan cuaca.  Teknologi ini sangat sederhana untuk menerapkan, dan telah digunakan secara komersial untuk waktu yang lama , dalam perangkat seperti berbicara jam dan kalkulator. Tingkat kealamian sistem ini bisa sangat tinggi karena berbagai jenis kalimat terbatas, dan mereka cocok dengan prosodi dan intonasi dari rekaman asli.
      • Karena sistem ini dibatasi oleh kata-kata dan frasa dalam database mereka, mereka tidak tujuan umum dan hanya dapat mensintesis kombinasi kata dan frase yang mereka telah terprogram. Campuran kata-kata dalam bahasa alami diucapkan namun masih dapat menyebabkan masalah kecuali banyak variasi diperhitungkan. Misalnya, dalam non-rhotic dialek dari bahasa Inggris "r" dalam kata-kata seperti "jelas" / klɪə / biasanya hanya diucapkan ketika kata berikut memiliki vokal sebagai huruf pertama (misalnya"membersihkan" direalisasikan sebagai / ËŒklɪəɾʌʊt / ). Demikian juga di Perancis , banyak konsonan akhir menjadi tidak lagi diam jika diikuti oleh sebuah kata yang dimulai dengan vokal, efek yang disebut penghubung . Ini pergantian tidak bisa direproduksi oleh sistem kata-Rangkaian sederhana, yang akan membutuhkan kompleksitas tambahan untuk konteks-sensitif .


  • B. Formant Synthesis : 
Formant synthesis tidak menggunakan pembicaraan manusia sebagai sample pada runtime. Daripada itu, synthesized speech yang dihasilkan dibuat dengan additive synthesis dan sebuah model akustik (physical modelling synthesis). 
Parameter seperti frekuensi dasar, penyuaraan, dan tingkat kebisingan di variasikan dari waktu ke waktu untuk menciptakan gelombang buatan (artificial) dari sebuah pembicaraan. Banyak sistem yang berdasarkan formant synthesis menciptakan pembicaraan yang seperti robot yang tidak mungkin dapat dikenal sebagai suara manusia. Tetapi, kealamian maksimum bukan selalu tujuan dari sebuah sistem speech synthesis, dan sistem formant synthesis mempunyai keuntungan dari sistem concatenative. Pembicaraan yang di-formant synthesis-kan dapat menjadi sangat jelas, bahkan dalam kecepatan yang tinggi, sehingga menghindari kesalahan suara yang sering dialami sistem concatenative. 
Formant synthesis biasanya program yang lebih kecil dari concatenative sistem karena ia tidak menggunakan basis data dari sampel-sampel pembicaraan. Oleh karena itu formant synthesis dapat ditanamkan dalam sistem yang mempunyai memory dan microprosesor yang terbatas. Karena sistem yang berdasarkan formant mempunyai kendali penuh dari sluruh aspek dari hasil pembicaraan, variasi yang luas dari prosodi dan intonasi dapat dihasilkan, menyampaikan tidak hanya pertanyaan dan pernyataan tetapi juga emosi dan nada suara.
Forman sintesis tidak menggunakan sampel suara manusia pada saat runtime. Sebaliknya, keluaran suara yang disintesis dibuat menggunakan aditif sintesis dan model akustik (sintesis pemodelan fisik ). Parameter seperti frekuensi dasar , menyuarakan , dan kebisingan tingkat yang bervariasi dari waktu ke waktu untuk membuat gelombang pidato buatan. Metode ini kadang-kadang disebut aturan berbasis sintesis; Namun, banyak sistem concatenative juga memiliki aturan berbasis komponen. Banyak sistem yang didasarkan pada teknologi sintesis forman menghasilkan buatan, robot yang terdengar pidato yang tidak akan pernah salah untuk pidato manusia. Namun, kealamian maksimum tidak selalu tujuan sistem sintesis pidato, dan sistem sintesis forman memiliki keunggulan dibandingkan sistem concatenative. Pidato forman-disintesis dapat diandalkan dimengerti, bahkan pada kecepatan yang sangat tinggi, menghindari Glitches akustik yang biasanya wabah sistem concatenative. Kecepatan tinggi disintesis pidato digunakan oleh tunanetra untuk navigasi cepat komputer menggunakan pembaca layar . Synthesizer forman adalah program biasanya lebih kecil dibandingkan dengan sistem concatenative karena mereka tidak memiliki database contoh pidato. Karena itu mereka dapat digunakan dalam embedded system , di mana memori dan mikroprosesor daya terutama terbatas. Karena sistem berbasis forman memiliki kontrol penuh dari semua aspek pidato output, berbagai prosodies dan intonasi dapat menjadi output, tidak hanya menyampaikan pertanyaan dan pernyataan, tetapi berbagai emosi dan nada suara.
Contoh non-real-time tapi sangat akurat kontrol intonasi dalam sintesis forman meliputi pekerjaan yang dilakukan pada akhir tahun 1970 untuk Texas Instruments mainan Bicara & Eja , dan pada awal tahun 1980 Sega arcade mesin dan dalam banyak Atari, Inc. game arcade menggunakan TMS5220 LPC Chips . Menciptakan intonasi yang tepat untuk proyek ini adalah telaten, dan hasilnya masih harus dicocokkan dengan real-time text-to-speech interface.
  • C. Sintesis artikulatoris
Sintesis artikulatoris mengacu pada teknik komputasi untuk sintesis pidato berdasarkan model manusia saluran vokal dan artikulasi proses yang terjadi di sana. Synthesizer artikulatoris pertama teratur digunakan untuk percobaan laboratorium dikembangkan di Haskins Laboratories di pertengahan 1970-an oleh Philip Rubin , Tom Baer, ​​dan Paul Mermelstein. Synthesizer ini, yang dikenal sebagai ASY, didasarkan pada model saluran vokal dikembangkan di Bell Laboratories pada tahun 1960 dan 1970-an oleh Paul Mermelstein, Cecil Coker, dan rekan.
Sampai saat ini, model sintesis artikulatoris belum dimasukkan ke dalam sistem sintesis pidato komersial. Sebuah pengecualian adalah NeXT sistem berbasis awalnya dikembangkan dan dipasarkan oleh Trillium Suara Research, sebuah perusahaan spin-off dari University of Calgary , di mana banyak riset asli dilakukan. Setelah runtuhnya berbagai inkarnasi NeXT (dimulai oleh Steve Jobs pada akhir tahun 1980 dan bergabung dengan Apple Computer pada tahun 1997), perangkat lunak TRILLIUM diterbitkan di bawah GNU General Public License , dengan bekerja terus sebagai gnuspeech . Sistem, pertama kali dipasarkan pada tahun 1994, memberikan penuh text-to-speech konversi berbasis artikulatoris menggunakan Waveguide atau transmisi-line analog dari saluran mulut dan hidung manusia dikendalikan oleh Carré ini "model daerah khas".
  • D. Sintesis berbasis  HMM 
Sintesis berbasis HMM  adalah metode sintesis berdasarkan model Markov tersembunyi , juga disebut statistik Parametrik Sintesis. Dalam sistem ini, spektrum frekuensi ( vokal ),frekuensi dasar (sumber vokal), dan durasi ( prosodi ) berbicara dimodelkan secara bersamaan oleh HMMs. Pidato bentuk gelombang yang dihasilkan dari HMMs sendiri berdasarkan kemungkinan maksimum kriteria.
  • E. Sintesis Sinewave 
Sintesis sinewave adalah teknik untuk sintesis pidato dengan mengganti forman (band utama energi) dengan peluit nada murni.

Ada beberapa masalah yang terdapat pada pemaduan suara, yaitu:
  • User sangat sensitif terhadap variasi dan informasi suara. Oleh sebab itu, mereka tidak dapat memberikan toleransi atas ketidaksempurnaan pemadu suara.
  • Output dalam bentuk suara tidak dapat diulang atau dicari dengan mudah.
  • Meningkatkan keberisikan pada lingkungan kantor atau jika menggunakan handphone, maka akan meningkatkan biaya pengeluaran.
Lingkungan dari aplikasi pemadu suara adalah:
  • Bagi tunanetra, pemadu suara menawarkan media komunkasi dimana mereka dapat memiliki akses yang tidak terbatas.
  • Lingkungan dimana visual dan haptic skill user berfokus pada hal lain. Contohnya: sinyal bahaya pada kokpit pesawat udara.
Kesimpulan:
Speech synthesis adalah sebuah kemampuan bicara manusia yang dibuat oleh manusia (artificial) dimana computer  dapat mentransformasikan sebuah data berbentuk teks (text) ke arah suara (speech). Oleh karena itu, speech synthesis juga sering dikenal dengan teknologi Text-to-Speech. Namun selain itu, Speech Syntesis tidak selamanya memerlukan text sebagai data inputnya. Seperti yang diterapkan ilmuwan terkenal Stepehen Hawking, ia memanfaatkan AI dengan memanfaatkan, menghubungkan dan memanipulasi saraf biologis dengan teknologi dan alat super canggih sehingga menghasilkan output suara pada mesin yang dipakainya untuk berkomunikasi.

Sumber: 

PENGERTIAN SPEECH RECOGNITION
Pengenalan ucapan atau pengenalan wicara—dalam istilah bahasa Inggrisnya, automatic speech recognition (ASR)—adalah suatu pengembangan teknik dan sistem yang memungkinkan komputer untuk menerima masukan berupa kata yang diucapkan. Teknologi ini memungkinkan suatu perangkat untuk mengenali dan memahami kata-kata yang diucapkan dengan cara digitalisasi kata dan mencocokkan sinyal digital tersebut dengan suatu pola tertentu yang tersimpan dalam suatu perangkat. Kata-kata yang diucapkan diubah bentuknya menjadi sinyal digital dengan cara mengubah gelombang suara menjadi sekumpulan angka yang kemudian disesuaikan dengan kode-kode tertentu untuk mengidentifikasikan kata-kata tersebut. Hasil dari identifikasi kata yang diucapkan dapat ditampilkan dalam bentuk tulisan atau dapat dibaca oleh perangkat teknologi sebagai sebuah komando untuk melakukan suatu pekerjaan, misalnya penekanan tombol pada telepon genggam yang dilakukan secara otomatis dengan komando suara.
Speech Recognition yang juga dikenal sebagai Automatic Speech Recognition atau Computer Speech Recognition, dapat mengkonversikan kata-kata lisan menjadi teks. Istilah “pengenalan suara” terkadang digunakan untuk merujuk kepada sistem pengenalan yang harus dilatih untuk pembicara tertentu, sebagai suatu kasus khusus untuk kebanyakan pengenalan perangkat lunak desktop. Mengenali pembicara dapat menyederhanakan tugas menerjemahkan pembicaraan.
Speech recognition adalah solusi yang lebih luas yang mengacu pada teknologi yang dapat mengenali pembicaraan tanpa ditargetkan pada pembicara tunggal seperti sistem call center yang dapat mengenali suara dengan sendirinya.
Aplikasi speech recognition mencakup voice user interface seperti voice dialing, call routing, pengendali alat domotic, pencarian, memasukkan data sederhana, persiapan dokumen terstruktur, pemrosesan speech-to-text, dan pesawat.
Speech Recognition adalah proses konversi sebuah sinyal akustik, yang ditangkap oleh microphone atau telepon, untuk merangkai kata kata. Kata - kata yang dikenali bisa jadi sebagai hasil akhir, untuk sebuah aplikasi seperti command & control, penginputan data, dan persiapan dokumen. Speech Recognition adalah proses identifikasi suara berdasarkan kata yang diucapkan dengan melakukan konversi sebuah sinyal akustik, yang ditangkap oleh audio device (perangkat input suara).
Alat pengenal ucapan, yang sering disebut dengan speech recognizer, membutuhkan sampel kata sebenarnya yang diucapkan dari pengguna. Sampel kata akan didigitalisasi, disimpan dalam komputer, dan kemudian digunakan sebagai basis data dalam mencocokkan kata yang diucapkan selanjutnya. Sebagian besar alat pengenal ucapan sifatnya masih tergantung kepada pembicara. Alat ini hanya dapat mengenal kata yang diucapkan dari satu atau dua orang saja dan hanya bisa mengenal kata-kata terpisah, yaitu kata-kata yang dalam penyampaiannya terdapat jeda antar kata. Hanya sebagian kecil dari peralatan yang menggunakan teknologi ini yang sifatnya tidak tergantung pada pembicara. Alat ini sudah dapat mengenal kata yang diucapkan oleh banyak orang dan juga dapat mengenal kata-kata kontinu, atau kata-kata yang dalam penyampaiannya tidak terdapat jeda antar kata.

Pengenalan ucapan dalam perkembangan teknologinya merupakan bagian dari pengenalan suara (proses identifikasi seseorang berdasarkan suaranya). Pengenalan suara sendiri terbagi menjadi dua, yaitu pengenalan pembicara (identifikasi suara berdasarkan orang yang berbicara) dan pengenalan ucapan (identifikasi suara berdasarkan kata yang diucapkan).
Speech Recognition juga merupakan sistem yang digunakan untuk mengenali perintah kata dari suara manusia dan kemudian diterjemahkan menjadi suatu data yang dimengerti oleh komputer. Pada saat ini, sistem ini digunakan untuk menggantikan peranan input dari keyboard dan mouse.
Keuntungan dari sistem ini adalah pada kecepatan dan kemudahan dalam penggunaannya. Kata – kata yang ditangkap dan dikenali bisa jadi sebagai hasil akhir, untuk sebuah aplikasi seperti command & control, penginputan data, dan persiapan dokumen. Parameter yang dibandingkan ialah tingkat penekanan suara yang kemudian akan dicocokkan dengan template database yang tersedia. Sedangkan sistem pengenalan suara berdasarkan orang yang berbicara dinamakan speaker recognition. Pada makalah ini hanya akan dibahas mengenai speech recognition karena kompleksitas algoritma yang diimplementasikan lebih sederhana daripada speaker recognition. Algoritma yang akan diimplementasikan pada bahasan mengenai proses speech recognition ini adalah algoritma FFT (Fast Fourier Transform), yaitu algoritma yang cukup efisien dalam pemrosesan sinyal digital (dalam hal ini suara) dalam bentuk diskrit. Algoritma ini mengimplementasikan algoritma Divide and Conquer untuk pemrosesannya. Konsep utama algoritma ini adalah mengubah sinyal suara yang berbasis waktu menjadi berbasis frekuensi dengan membagi masalah menjadi beberapa upa masalah yang lebih kecil. Kemudian, setiap upa masalah diselesaikan dengan cara melakukan pencocokan pola digital suara.
Speech recognition atau pengenalan pembicaraan (juga dikenal sebagai pengenalan suara otomatis atau pengakuan komputer pidato) mengkonversi diucapkan kata-kata untuk teks. The "pengenalan suara" istilah kadang-kadang digunakan untuk merujuk kepada sistem pengakuan yang harus dilatih untuk kasus-speaker tertentu seperti untuk perangkat lunak pengenal yang paling desktop.Menyadari pembicara dapat menyederhanakan tugas menerjemahkan pidato. Pengenalan pembicaraan adalah solusi yang lebih luas yang mengacu pada teknologi yang dapat mengenali pidato tanpa ditargetkan pada pembicara tunggal seperti sistem call center yang dapat mengenali suara sewenang-wenang.

Aplikasi pengenalan pembicaraan termasuk user interface seperti suara panggilan suara (misalnya, "Call home"), call routing (misalnya, "Saya ingin membuat collect call"), kontrol alat domotic, pencarian (misalnya, menemukan podcast di mana tertentu Kata-kata itu diucapkan), sederhana entri data (misalnya, memasukkan nomor kartu kredit), persiapan dokumen terstruktur (misalnya, sebuah laporan radiologi), pengolahan pidato-ke-teks (misalnya, kata prosesor atau email), dan pesawat udara (biasanya disebutInput langsung suara).
Secara umum, speech recognizer memproses sinyal suara yang masuk dan menyimpannya dalam bentuk digital. Hasil proses digitalisasi tersebut kemudian dikonversi dalam bentuk spektrum suara yang akan dianalisa dengan membandingkan dengan template suara pada database sistem. Sebelumnya, data suara masukan dipilah-pilah dan diproses satu per satu berdasarkan urutannya. Pemilahan ini dilakukan agar proses analisis dapat dilakukan secara paralel.
Speech recognition merupakan salah satu jenis biometric recognition,yaitu proses komputer mengenali apa yang diucapkan seseorang berdasarkan intonasi suara yang dikonversi ke dalam bentuk digital print.
Pengenalan pola suara adalah salah satu aplikasi yang berkembang saat ini. Sistem ini mengijinkan kita untuk berkomunikasi antara manusia dengan memasukkan data ke komputer. Salah satu fungsinya adalah untuk meningkatkan efisiensi industri manufaktur, mengontrol mesin dengan berbicara pada mesin itu. Algoritma yang diimplementasikan untuk masalah pengenalan suara ini adalah algoritma divide and conquer. Proses awalnya adalah mengkonversi data spektrum suara ke dalam bentuk digital dan mengibah dalam bentuk diskrit.
SEJARAH SPEECH RECOGNITION
Sejak tahun 1940, perusahaan American Telephone and Telegraph Company (AT&T) sudah mulai mengembangkan suatu perangkat teknologi yang dapat mengidentifikasi kata yang diucapkan manusia. Sekitar tahun 1960-an, para peneliti dari perusahaan tersebut sudah berhasil membuat suatu perangkat yang dapat mengidentifikasi kata-kata terpisah dan pada tahun 1970-an mereka berhasil membuat perangkat yang dapat mengidentifikasi kata-kata kontinu. Alat pengenal ucapan kemudian menjadi sangat fungsional sejak tahun 1980-an dan masih dikembangkan dan terus ditingkatkan keefektifannya hingga sekarang.
Biometrik, termasuk di dalamnya speech recognition, secara umum digunakan untuk identifikasi dan verifikasi. Identifikasi ialah mengenali identitas subyek, dilakukan perbandingan kecocokan antara data biometric subyek dalam database berisi record karakter subyek. Sedangkan verifikasi adalah menentukan apakah subyek sesuai dengan apa yang dikatakan terhadap dirinya.
Biometrik merupakan suatu metoda untuk mengenali manusia berdasarkan pada satu atau lebih ciri-ciri fisik atau tingkah laku yang unik. Biometric Recognition atau biasa disebut dengan Sistem pengenalan biometric mengacu pada identifikasi secara otomatis terhadap manusia berdasarkan psikological atau karakteristik tingkah laku manusia. Ada beberapa jenis teknologi biometric antara lain suara (speech recognition). Speech recognizer yang pertama keluar di tahun 1952. Salah satu perangkat speech recognizer adalah IBM Shoebox, yang dikeluarkan pada 1963 melalui New York World's Fair.
Metode Hidden Markov Model mulai diperkenalkan dan dipelajari pada akhir tahun 1960, metode yang berupa model statistik dari rantai Markov ini semakin banyak dipakai pada tahun-tahun terakhir terutama dalam bidang speech recognition, seperti dijelaskan oleh Lawrence R. Rabiner dalam laporannya yang berjudul “A Tutorial on Hidden Markov Models and Selected Applications in Speech Recognition”
Proses dalam dunia nyata secara umum menghasilkan observable output yang dapat dikarakterisasikan sebagai signal. Signal bisa bersifat diskrit (karakter dalam alfabet) maupun kontinu (pengukuran temperatur, alunan musik). Signal bisa bersifat stabil (nilai statistiknya tidak berubah terhadap waktu) maupun nonstabil (nilai signal berubah-ubah terhadap waktu). Dengan melakukan pemodelan terhadap signal secara benar, dapat dilakukan simulasi terhadap sumber dan pelatihan sebanyak mungkin melalui proses simulasi tersebut. Sehingga model dapat diterapkan dalam sistem prediksi, sistem pengenalan, maupun sistem identifikasi. Secara garis besar model signal dapat dikategorikan menjadi 2 golongan yaitu : model deterministik dan model statistikal. Model deterministik menggunakan nilai-nilai properti dari sebuah signal seperti :amplitudo, frekuensi, fase dari gelombang sinus. Sedangkan model statistikal menggunakan nilai-nilai statistik dari sebuah signal seperti: proses Gaussian, proses Poisson, proses Markov, dan proses Hidden Markov.
SKEMA UTAMA DAN ALGORITMA SPEECH RECOGNITION
Terdapat 4 langkah utama dalam sistem pengenalan suara:
  1. Penerimaan data input
  2. Ekstraksi, yaitu penyimpanan data masukan sekaligus pembuatan database untuk template.
  3. Pembandingan / pencocokan, yaitu tahap pencocokan data baru dengan data suara (pencocokan tata bahasa) pada template.
  4. Validasi identitas pengguna.

Secara umum, speech recognizer memproses sinyal suara yang masuk dan menyimpannya dalam bentuk digital. Hasit proses digitalisasi tersebut kemudian dikonversi dalam bentuk spektrum suara yang akan dianalisa dengan membandingkannya dengan template suara pada database sistem.
Sebelumnya, data suara masukan dipilah-pilah dan diproses satu per satu berdasarkan urutannya. Pemilahan ini dilakukan agar proses analisis dapat dilakukan secara paralel. Proses yang pertama kali dilakukan ialah memproses gelombang kontinu spektrum suara ke dalam bentuk diskrit. Langkah berikutnya ialah proses kalkulasi yang dibagi menjadi dua bagian :
  1. Transformasi gelombang diskrit menjadi array data.
  2. Untuk masing-masing elemen pada aiTay data, hitung "ketinggian" gelombang (frekuensi). Objek permasaiahan yang akan dibagi adalah masukan berukuran n, berupa data diskrit gelombang suara.
Ketika mengkonversi gelombang suara ke dalam bentuk diskrit, gelombang diperlebar dengan cara memperinci berdasarkan waktu. Hal ini dilakukan agar proses algontma seianjutnya (pencocokan) lebih mudah diiakukan. Namun, efek buruknya ialah array of array data yang terbentuk akan lebih banyak.
Dari tiap elemen array data tersebut, dikonversi ke dalam bentuk bilangan biner. Data biner tersebut yang nantinya akan dibandingkan dengan template data suara.
Proses divide and conquer:
  • Pilih sebuah angkaN, dimana N merupakan bilangan bulat kelipatan 2.Bilangan ini berfungsi untuk menghitung jumlah elemen transformasi FFT.
  • Bagi dua data diskrit secara (dengan menerapkan algoritma divide and conquer) menjadi data diskrit yang lebih kecii berukuran N = N,.N2.
  • Objek data dimasukkan ke dalam table (sebagai elemen tabel).
  • Untuk setiap eiemen data, dicocokkan dengan data pada template (pada data template juga dilakukan pemrosesan digitaiisasi menjadi data diskrit, dengan cara yang sama dengan proses digitaiisasi data masukan bam yang ingin dicocokkan).
  • Setiap masalah disatukan kembali dan dianalisis secara keseluruhan, kecocokan dari segi tata bahasa dan apakah data yang diucapkan sesuai dengan kata yang tersedia pada template data.
  • Verifikasi data. Jika sesuai, proses iebih lanjut, sesuai dengan aplikasi yang mengimplementasikan algoritma ini.
JENIS-JENIS SPEECH RECOGNITION
Berdasarkan kemampuan dalam mengenal kata yang diucapkan, terdapat 5 jenis pengenalan kata, yaitu :
  1. Kata-kata yang terisolasi : Proses pengidentifikasian kata yang hanya dapat mengenal kata yang diucapkan jika kata tersebut memiliki jeda waktu pengucapan antar kata
  2. Kata-kata yang berhubungan : Proses pengidentifikasian kata yang mirip dengan kata-kata terisolasi, namun membutuhkan jeda waktu pengucapan antar kata yang lebih singkat
  3. Kata-kata yang berkelanjutan : Proses pengidentifikasian kata yang sudah lebih maju karena dapat mengenal kata-kata yang diucapkan secara berkesinambungan dengan jeda waktu yang sangat sedikit atau tanpa jeda waktu. Proses pengenalan suara ini sangat rumit karena membutuhkan metode khusus untuk membedakan kata-kata yang diucapkan tanpa jeda waktu. Pengguna perangkat ini dapat mengucapkan kata-kata secara natural
  4. Kata-kata spontan : Proses pengidentifikasian kata yang dapat mengenal kata-kata yang diucapkan secara spontan tanpa jeda waktu antar kata
  5. Verifikasi atau identifikasi suara : Proses pengidentifikasian kata yang tidak hanya mampu mengenal kata, namun juga mengidentifikasi siapa yang berbicara.
PROSES KERJA ALAT SPEECH RECOGNITION
Alat pengenal ucapan memiliki empat tahapan dalam prosesnya, yaitu :
  1. Tahap penerimaan masukan : Masukan berupa kata-kata yang diucapkan lewat pengeras suara.
  2. Tahap ekstraksi : Tahap ini adalah tahap penyimpanaan masukan yang berupa suara sekaligus pembuatan basis data sebagai pola. Proses ekstraksi dilakukan berdasarkan metode Model Markov Tersembunyi atau Hidden Markov Model (HMM), yang merupakan model statistik dari sebuah sistem yang diasumsikan oleh Markov sebagai suatu proses dengan parameter yang tidak diketahui. Tantangan dalam model statistik ini adalah menentukan parameter-parameter tersembunyi dari parameter yang dapat diamati. Parameter-parameter yang telah kita tentukan kemudian digunakan untuk analisis yang lebih jauh pada proses pengenalan kata yang diucapkan. Berdasarkan HMM, proses pengenalan ucapan secara umum menghasilkan keluaran yang dapat dikarakterisasikan sebagai sinyal. Sinyal dapat bersifat diskrit (karakter dalam abjad) maupun kontinu (pengukuran temperatur, alunan musik). Sinyal dapat pula bersifat stabil (nilai statistiknya tidak berubah terhadap waktu) maupun nonstabil (nilai sinyal berubah-ubah terhadap waktu). Dengan melakukan pemodelan terhadap sinyal secara benar, dapat dilakukan simulasi terhadap masukan dan pelatihan sebanyak mungkin melalui proses simulasi tersebut sehingga model dapat diterapkan dalam sistem prediksi, sistem pengenalan, maupun sistem identifikasi. Secara garis besar model sinyal dapat dikategorikan menjadi dua golongan, yaitu: model deterministik dan model statistikal. Model deterministik menggunakan nilai-nilai properti dari sebuah sinyal seperti: amplitudo, frekuensi, dan fase dari gelombang sinus. Model statistikal menggunakan nilai-nilai statistik dari sebuah sinyal seperti: proses Gaussian, proses Poisson, proses Markov, dan proses Markov Tersembunyi. Suatu model HMM secara umum memiliki unsur-unsur sebagai berikut:
    • N, yaitu jumlah bagian dalam model. Secara umum bagian tersebut saling terhubung satu dengan yang lain, dan suatu bagian bisa mencapai semua bagian yang lain, serta sebaliknya (disebut dengan model ergodik). Namun hal tersebut tidak mutlak karena terdapat kondisi lain dimana suatu bagian hanya bisa berputar ke diri sendiri dan berpindah ke satu bagian berikutnya. Hal ini bergantung pada implementasi dari model.
    • M, yaitu jumlah simbol observasi secara unik pada tiap bagiannya, misalnya: karakter dalam abjad, dimana bagian diartikan sebagai huruf dalam kata.
    • Probabilita Perpindahan Bagian { } = ij A a
    • Probabilita Simbol Observasi pada bagian j, { } () = j Bb k
    • Inisial Distribusi Bagian i p p . Dengan memberikan nilai pada N, M, A, B, dan p , HMM dapat digunakan sebagai generator untuk menghasilkan urutan observasi. dimana tiap observasi t o adalah salah satu simbol dari V, dan T adalah jumlah observasi dalam suatu sequence.
    • Setelah memberikan nilai N, M, A, B, dan p , maka proses ekstraksi dapat diurutkan. Berikut adalah tahapan ekstraksi pengenalan ucapan berdasarkan HMM :
      • Tahap ekstraksi tampilan : Penyaringan sinyal suara dan pengubahan sinyal suara analog ke digital
      • Tahap tugas pemodelan : Pembuatan suatu model HMM dari data-data yang berupa sampel ucapan sebuah kata yang sudah berupa data digital
      • Tahap sistem pengenalan HMM : Penemuan parameter-parameter yang dapat merepresentasikan sinyal suara untuk analisis lebih lanjut.
  3. Tahap pembandingan : Tahap ini merupakan tahap pencocokan data baru dengan data suara (pencocokan tata bahasa) pada pola. Tahap ini dimulai dengan proses konversi sinyal suara digital hasil dari proses ekstraksi ke dalam bentuk spektrum suara yang akan dianalisa dengan membandingkannya dengan pola suara pada basis data. Sebelumnya, data suara masukan dipilah-pilah dan diproses satu per satu berdasarkan urutannya. Pemilihan ini dilakukan agar proses analisis dapat dilakukan secara paralel. Proses yang pertama kali dilakukan ialah memproses gelombang kontinu spektrum suara ke dalam bentuk diskrit. Langkah berikutnya ialah proses kalkulasi yang dibagi menjadi dua bagian :
    • Transformasi gelombang diskrit menjadi data yang terurut : Gelombang diskrit berbentuk masukan berukuran n yang menjadi objek yang akan dibagi pada proses konversi dengan cara pembagian rincian waktu
    • Menghitung frekuensi pada tiap elemen data yang terurut
    • Selanjutnya tiap elemen dari data yang terurut tersebut dikonversi ke dalam bentuk bilangan biner. Data biner tersebut nantinya akan dibandingkan dengan pola data suara dan kemudian diterjemahkan sebagai keluaran yang dapat berbentuk tulisan ataupun perintah pada perangkat.
  4. Tahap validasi identitas pengguna: Alat pengenal ucapan yang sudah memiliki sistem verifikasi/identifikasi suara akan melakukan identifikasi orang yang berbicara berdasarkan kata yang diucapkan setelah menerjemahkan suara tersebut menjadi tulisan atau komando.
IMPLEMENTASI SPEECH RECOGNITION 
Hardware yang dibutuhkan dalam implementasi Speech Recognition :
  • Sound card : Merupakan perangkat yang ditambahkan dalam suatu Komputer yang fungsinya sebagai perangkat input dan output suara untuk mengubah sinyal elektrik, menjadi analog maupun menjadi digital.
  • Microphone : Perangkat input suara yang berfungsi untuk mengubah suara yang melewati udara, air dari benda orang menjadi sinyal elektrik.
  • Komputer atau Komputer Server : Dalam proses suara digital menterjemahkan gelombang suara menjadi suatu simbol biasanya menjadi suatu nomor biner yang dapat diproses lagi kemudian diidentifikasikan dan dicocokan dengan database yang berisi berkas suara agar dapat dikenali.
APLIKASI ALAT SPEECH RECOGNITION
  • Bidang Komunikasi
    • Komando Suara: Komando Suara adalah suatu program pada komputer yang melakukan perintah berdasarkan komando suara dari pengguna. Contohnya pada aplikasi Microsoft Voice yang berbasis bahasa Inggris. Ketika pengguna mengatakan “Mulai kalkulator” dengan intonasi dan tata bahasa yang sesuai, komputer akan segera membuka aplikasi kalkulator. Jika komando suara yang diberikan sesuai dengan daftar perintah yang tersedia, aplikasi akan memastikan komando suara dengan menampilkan tulisan “Apakah Anda meminta saya untuk ‘mulai kalkulator’?”. Untuk melakukan verifikasi, pengguna cukup mengatakan “Lakukan” dan komputer akan langsung beroperasi.
    • Pendiktean : Pendiktean adalah sebuah proses mendikte yang sekarang ini banyak dimanfaatkan dalam pembuatan laporan atau penelitian. Contohnya pada aplikasi Microsoft Dictation yang merupakan aplikasi yang dapat menuliskan apa yang diucapkan oleh pengguna secara otomatis.
    • Telepon : Pada telepon, teknologi pengenal ucapan digunakan pada proses penekanan tombol otomatis yang dapat menelpon nomor tujuan dengan komando suara.
  • Bidang Kesehatan
    • Alat pengenal ucapan banyak digunakan dalam bidang kesehatan untuk membantu para penyandang cacat dalam beraktivitas. Contohnya pada aplikasi Antarmuka Suara Pengguna atau Voice User Interface (VUI) yang menggunakan teknologi pengenal ucapan dimana pengendalian saklar lampu misalnya, tidak perlu dilakukan secara manual dengan menggerakkan saklar tetapi cukup dengan mengeluarkan perintah dalam bentuk ucapan sebagai saklarnya. Metode ini membantu manusia yang secara fisik tidak dapat menggerakkan saklar karena cacat pada tangan misalnya. Penerapan VUI ini tidak hanya untuk lampu saja tapi bisa juga untuk aplikasi-aplikasi kontrol yang lain.
    • Peralatan elektronik yang menyimpan riwayat kesehatan  atau Electronic Medical Records(EMR) dapat digunakan secara lebih efektif bila menggunakan teknologi speech recognition. Proses pencarian, pertanyaan dan pencarian akan lebih mudah bila menggunakan suara daripada menggunakan keyboard.
  • Bidang Militer
    • Pelatihan Penerbangan : Aplikasi alat pengenal ucapan dalam bidang militer adalah pada pengatur lalu lintas udara atau yang dikenal dengan Air Traffic Controllers (ATC) yang dipakai oleh para pilot untuk mendapatkan keterangan mengenai keadaan lalu-lintas udara seperti radar, cuaca, dan navigasi. Alat pengenal ucapan digunakan sebagai pengganti operator yang memberikan informasi kepada pilot dengan cara berdialog.
    • Helikopter : Aplikasi alat pengenal ucapan pada helikopter digunakan untuk berkomunikasi lewat radio dan menyesuaikan sistem navigasi. Alat ini sangat diperlukan pada helikopter karena ketika terbang, sangat banyak gangguan yang akan menyulitkan pilot bila harus berkomunikasi dan menyesuaikan navigasi dengan terlebih dahulu memencet tombol tertentu.
    • Lain-Lain : Teknologi ini digunakan pada pengoperasian berbagai peralatan pesawat tempur seperti penentuan frekuensi radio, pengaktifan sistem autopilot, penentuan koordinat tuas kendali, parameter peluncuran senjata, pengaktifan sistem navigasi, dan pengaturan tampilan status penerbangan.
  • Entertainment
    • Pada beberapa games komputer,voice recognition digunakan untuk menyelesaikan misi-misi tertentu seperti pada game Tom Clancy’s End war dan LIfeline. Selain itu teknologi ini juga dapat digunakan untuk membantu proses pengetikan pada orang yang memiliki cacat pada bagian tangan.
    • Beberapa software yang menggunakan sistem teknologi speech recognition antara lain Microsoft Voice Command, Nuance Voice Control, VITO Voice2Go, Speereo Voice translator dan SVOX.
Contoh Implementasi teknologi Speech Recognition :
Saat ini pada tahun 2010 Microsoft windows vista dan windows 7 , speech recognition telah disertakan dalam system operasinya . sebagaimana fungsi dari speech recognition menterjemahkan pengucapan kata – kata kedalam bentuk teks digital. Salah satu implementasi speech recognition adalah pada konfrensi PBB dimana seluruh Negara tergabung dalam keanggotaan nya , fungsi speech recognition dalam hal ini menterjemahkan bahasa pembicara dari suatu Negara kedalam bahasa yang dipahami pendengar . Contoh penggunaan lain speech recognition adalah Perawatan kesehatan.
Dalam perawatan kesehatan domain, bahkan di bangun meningkatkan teknologi pengenalan suara, transcriptionists medis (MTs) belum menjadi usang. Layanan yang diberikan dapat didistribusikan daripada diganti. Pengenalan pembicaraan dapat diimplementasikan di front-end atau back-end dari proses dokumentasi medis. Front-End SR adalah salah satu alat untuk mengidentifikasi kata-kata yang ucapkan dan ditampilkan tepat setelah mereka berbicara Back-End SR atau SR tangguhan adalah di mana penyedia menentukan menjadi sebuah sistem dikte digital, dan suara yang diarahkan melalui pidato-mesin pengakuan dan draft dokumen diakui dirutekan bersama dengan file suara yang asli ke MT / editor, yang mengedit draft dan memfinalisasi laporan. Ditangguhkan SR sedang banyak digunakan dalam industri saat ini.
Banyak aplikasi Electronic Medical Records (EMR) dapat menjadi lebih efektif dan dapat dilakukan lebih mudah bila digunakan dalam hubungannya dengan pengenalan-mesin bicara. Pencarian, query, dan pengisian formulir semua bisa lebih cepat untuk melakukan dengan suara dibandingkan dengan menggunakan keyboard.
Kelebihan
Kelebihan dari peralatan yang menggunakan teknologi ini adalah :
  1. Cepat
    • Teknologi ini mempercepat transmisi informasi dan umpan balik dari transmisi tersebut. Contohnya pada komando suara. Hanya dalam selang waktu sekitar satu atau dua detik setelah kita mengkomandokan perintah melalui suara, komputer sudah memberi umpan balik atas komando kita.
  2. Mudah digunakan
    • Kemudahan teknologi ini juga dapat dilihat dalam aplikasi komando suara. Komando yang biasanya kita masukkan ke dalam komputer dengan menggunakan tetikus atau papan ketik kini dapat dengan mudahnya kita lakukan tanpa perangkat keras, yakni dengan komando suara.
Kekurangan
Kekurangan dari peralatan yang menggunakan teknologi ini adalah :
  1. Rawan terhadap gangguan
    • Hal ini disebabkan oleh proses sinyal suara yang masih berbasis frekuensi. Ketika sebuah informasi dalam sinyal suara mempunyai komponen frekuensi yang sama banyaknya dengan komponen frekuensi gangguannya, akan sulit untuk memisahkan gangguan dari sinyal suara
  2. Jumlah kata yang dapat dikenal terbatas
    • Hal ini disebabkan pengenal ucapan bekerja dengan cara mencari kemiripan dengan basis data yang dimiliki.
Kesimpulan:
Suatu pengembangan sistem yang memungkinkan komputer untuk menerima masukan berupa kata yang diucapkan. Alat pengenal ucapan atau yang sering disebut dengan Speech Recognizer, membutuhkan sampel kata sebenarnya yang diucapkan dari pengguna. Penggunaan speech recognicition telah berkembang di berbagai sistem device seperti pada OS Windows dengan Speech Recognition, smartphone Android, dan yang paling terkenal adalah aplikasi Siri pada iPhone.

Sumber:

UNIVERSITAS GUNADARMA

CLOCK

Cute Rocking Baby Monkey

MY PROFILE

Powered by Blogger.

CALENDAR