Đang chuẩn bị liên kết để tải về tài liệu:
Áp dụng bottle neck feature cho nhận dạng tiếng nói tiếng Việt

Đang chuẩn bị nút TẢI XUỐNG, xin hãy chờ

Bài báo trình bày việc áp dụng Bottle Neck Feature(BNF) - một dạng đặc trưng của tín hiệu tiếng nói được trích chọn thông qua mạng neural (Neural Network) - cho nhận dạng tiếng nói tiếng Việt. Nghiên cứu sử dụng mạng Multilayer Perceptron(MLP) năm lớp với kích thước của lớp ẩn thứ nhất khác nhau để trích chọn đặc trưng BNF từ hai loại dữ liệu đầu vào là Perceptual Linear Prediction(PLP) và Mel Frequency Cepstral Coeffcient(MFCC), nhằm đánh giá hiệu quả của mỗi loại đặc trưng sau khi được áp dụng BNF | Tạp chí Tin học và Điều khiển học, T.29, S.4 (2013), 379–388 ÁP DỤNG BOTTLE NECK FEATURE CHO NHẬN DẠNG TIẾNG NÓI TIẾNG VIỆT NGUYỄN VĂN HUY1 , LƯƠNG CHI MAI2 , VŨ TẤT THẮNG2 1 Khoa Điện tử, trường ĐH Kỹ thuật Công nghiệp – Thái Nguyên; huynguyen@tnut.edu.vn 2 Viện Công nghệ Thông tin, Viện Hàn lâm Khoa học & Công nghệ Việt Nam; lcmai,vtthang@ioit.ac.vn Tóm t t. Bài báo trình bày việc áp dụng Bottle Neck Feature(BNF) - một dạng đặc trưng của tín hiệu tiếng nói được trích chọn thông qua mạng neural (Neural Network) - cho nhận dạng tiếng nói tiếng Việt. Nghiên cứu sử dụng mạng Multilayer Perceptron(MLP) năm lớp với kích thước của lớp ẩn thứ nhất khác nhau để trích chọn đặc trưng BNF từ hai loại dữ liệu đầu vào là Perceptual Linear Prediction(PLP) và Mel Frequency Cepstral Coeffcient(MFCC), nhằm đánh giá hiệu quả của mỗi loại đặc trưng sau khi được áp dụng BNF. Kết quả thử nghiệm chứng tỏ BNF hiệu quả với tiếng nói tiếng Việt, kết quả nhận dạng trên đặc trưng BNF tốt hơn so với hệ thống cơ sở (baseline system) trong khoảng từ 6% đến 7%, và đặc trưng MFCC cho kết quả tốt hơn PLP. T khóa. Bottle Neck Feature, nhận dạng tiếng Việt, mô hình makov ẩn. Abstract. In the paper, the basic idea of Bottle Neck Feature(BNF) and the process how to extract BNF are presented. In this study, we apply BNF for Vietnamese speech recognition with five layers MLP network of different sizes for the first hidden layer. Input features to extract BNF feature are Perceptual Linear Prediction(PLP) and Mel Frequency Cepstral Coeffcient(MFCC). The experiments are carried out on a data set of VOV(Voice of Vietnam).The results show that using BNF for Vietnamese speech recognition, a WER(Word Error Rate)is improved up to 6-7% comparing to the baseline system, and MFCC feature gives a better result than PLP feature. Key words. BNF, Bottle Neck Feature, Vietnamese speech recognition, HMM-GMM. 1. GIỚI THIỆU Phương pháp trích chọn các đặc trưng của tiếng nói sử dụng mạng neural đang trở .