Kinh doanh - Marketing
Kinh tế quản lý
Biểu mẫu - Văn bản
Tài chính - Ngân hàng
Công nghệ thông tin
Tiếng anh ngoại ngữ
Kĩ thuật công nghệ
Khoa học tự nhiên
Khoa học xã hội
Văn hóa nghệ thuật
Sức khỏe - Y tế
Văn bản luật
Nông Lâm Ngư
Kỹ năng mềm
Luận văn - Báo cáo
Giải trí - Thư giãn
Tài liệu phổ thông
Văn mẫu
Giới thiệu
Đăng ký
Đăng nhập
Tìm
Danh mục
Kinh doanh - Marketing
Kinh tế quản lý
Biểu mẫu - Văn bản
Tài chính - Ngân hàng
Công nghệ thông tin
Tiếng anh ngoại ngữ
Kĩ thuật công nghệ
Khoa học tự nhiên
Khoa học xã hội
Văn hóa nghệ thuật
Y tế sức khỏe
Văn bản luật
Nông lâm ngư
Kĩ năng mềm
Luận văn - Báo cáo
Giải trí - Thư giãn
Tài liệu phổ thông
Văn mẫu
Thông tin
Điều khoản sử dụng
Quy định bảo mật
Quy chế hoạt động
Chính sách bản quyền
Giới thiệu
Đăng ký
Đăng nhập
0
Trang chủ
Luận Văn - Báo Cáo
Báo cáo khoa học
Báo cáo khoa học: "Text Segmentation by Language Using Minimum Description Length"
tailieunhanh - Báo cáo khoa học: "Text Segmentation by Language Using Minimum Description Length"
The problem addressed in this paper is to segment a given multilingual document into segments for each language and then identify the language of each segment. The problem was motivated by an attempt to collect a large amount of linguistic data for non-major languages from the web. | Text Segmentation by Language Using Minimum Description Length Hiroshi Yamaguchi Kumiko Tanaka-Ishii Graduate School of Faculty and Graduate School of Information Information Science and Technology Science and Electrical Engineering University of Tokyo Kyushu University kumiko@ Abstract The problem addressed in this paper is to segment a given multilingual document into segments for each language and then identify the language of each segment. The problem was motivated by an attempt to collect a large amount of linguistic data for non-major languages from the web. The problem is formulated in terms of obtaining the minimum description length of a text and the proposed solution finds the segments and their languages through dynamic programming. Empirical results demonstrating the potential of this approach are presented for experiments using texts taken from the Universal Declaration of Human Rights and Wikipedia covering more than 200 languages. 1 Introduction For the purposes of this paper a multilingual text means one containing text segments limited to those longer than a clause written in different languages. We can often find such texts in linguistic resources collected from the World Wide Web for many nonmajor languages which tend to also contain portions of text in a major language. In automatic processing of such multilingual texts they must first be segmented by language and the language of each segment must be identified since many state-of-the-art NLP applications are built by learning a gold standard for one specific language. Moreover segmentation is useful for other objectives such as collecting linguistic resources for non-major languages and automatically removing portions written in major languages as noted above. The study reported here was motivated by this objective. The problem addressed in this article is thus to segment a multilingual text by language and identify the language of each .
Thùy Giang
63
10
pdf
Báo lỗi
Trùng lắp nội dung
Văn hóa đồi trụy
Phản động
Bản quyền
File lỗi
Khác
Upload
Tải xuống
đang nạp các trang xem trước
Bấm vào đây để xem trước nội dung
Tải xuống
TÀI LIỆU LIÊN QUAN
Báo cáo khoa học: "Text Segmentation by Language Using Minimum Description Length"
10
59
0
Báo cáo khoa học: "Text Segmentation with LDA-Based Fisher Kernel"
4
68
0
Báo cáo khoa học: "Unsupervised Segmentation of Chinese Text by Use of Branching Entropy"
8
55
1
Báo cáo khoa học: "A Statistical Model for Domain-Independent Text Segmentation"
8
93
0
Báo cáo khoa học: "Text Segmentation Using Reiteration and Collocation"
5
45
0
Báo cáo khoa học: "Text Segmentation with Multiple Surface Linguistic Cues"
5
60
0
Báo cáo khoa học: "Optimal Multi-Paragraph Text Segmentation by Dynamic Programming"
3
72
0
Báo cáo khoa học: "Cohesion and Collocation: Using Context Vectors in Text Segmentation"
5
66
0
Báo cáo khoa học: "BASED TEXT SEGMENTATION ON SIMILARITY BETWEEN WORDS"
3
47
0
Báo cáo khoa học: "MULTI-PARAGRAPH SEGMENTATION EXPOSITORY TEXT"
8
58
0
TÀI LIỆU XEM NHIỀU
Một Case Về Hematology (1)
8
462366
61
Giới thiệu :Lập trình mã nguồn mở
14
26902
79
Tiểu luận: Tư tưởng Hồ Chí Minh về xây dựng nhà nước trong sạch vững mạnh
13
11381
543
Câu hỏi và đáp án bài tập tình huống Quản trị học
14
10576
468
Phân tích và làm rõ ý kiến sau: “Bài thơ Tự tình II vừa nói lên bi kịch duyên phận vừa cho thấy khát vọng sống, khát vọng hạnh phúc của Hồ Xuân Hương”
3
9858
108
Ebook Facts and Figures – Basic reading practice: Phần 1 – Đặng Tuấn Anh (Dịch)
249
8911
1161
Tiểu luận: Nội dung tư tưởng Hồ Chí Minh về đạo đức
16
8528
426
Mẫu đơn thông tin ứng viên ngân hàng VIB
8
8111
2279
Giáo trình Tư tưởng Hồ Chí Minh - Mạch Quang Thắng (Dành cho bậc ĐH - Không chuyên ngành Lý luận chính trị)
152
8006
1826
Đề tài: Dự án kinh doanh thời trang quần áo nữ
17
7303
268
TỪ KHÓA LIÊN QUAN
Báo cáo khoa học
Text Segmentation by Language Using Minimum Description Length
Hiroshi Yamaguchi
Kumiko
Tanaka Ishii
báo cáo khoa học
báo cáo ngôn ngữ
ngôn ngữ tự nhiên
Bài giảng Xử lý ngôn ngữ tự nhiên
Xử lý ngôn ngữ tự nhiên
Kỹ thuật lập trình
Mô hình ngôn ngữ
Mô hình n gram
Dịch máy
Phương pháp dịch máy
Hiểu ngôn ngữ
Phân loại tin tự động
Tạo chí tin học
Điều khiển học
Truy vấn ngôn ngữ tự nhiên
Phép dịch truy vấn ngôn ngữ tự nhiên
Truy vấn SQL
Văn phạm ngữ nghĩa
Xử lý nhập nhằng ngữ nghĩa
Xử lý ngữ nghĩa
Phân tích ngữ nghĩa
Biểu diễn vị từ
Thuộc tính về sự kiện
Thuộc tính về sự kiện
Xử lý ngôn ngữ
Natural Language Processing
Ngôn ngữ lập trình
Nhập nhằng cấu trúc
Tri thức về ngôn ngữ
Mô hình ngôn ngữ Google Book N grams
Mô hình ngôn ngữ KenLM
Phương pháp làm mịn
Bài toán PTCP
Phân tích cú pháp
Cấu trúc ngữ pháp
Phân tích cú pháp xác suất
CKY kết hợp xác suất
Văn phạm phi ngữ cảnh xác suất
Hình thái học
Gán nhãn từ loại
Ngôn ngữ tự nhiên trong dịch máy
Hệ thống dịch máy
Phương pháp xây dựng bảng từ
Tác từ
Conditional random fields
Nhận dạng thực thể có tên
Đối tượng vật lý trừu tượng
Phân lớp văn bản
Biểu diễn nhị phân
Ma trận từ văn bản
Wolfram Alpha
Trích rút thông tin
Phương pháp Snowball
TÀI LIỆU MỚI ĐĂNG
Đóng mới oto 8 chỗ ngồi part 9
10
188
3
13-01-2025
Data Structures and Algorithms - Chapter 8: Heaps
41
195
5
13-01-2025
Quy Trình Canh Tác Cây Bông Vải
8
171
3
13-01-2025
Chương 10: Các phương pháp tính quá trình quá độ trong mạch điện tuyến tính
57
246
8
13-01-2025
OPEN SOURCE ERP REASONABLE TOOLS FOR MANUFACTURING SMEs?
1
156
1
13-01-2025
Lập trình Java cơ bản : Luồng và xử lý file part 8
5
143
1
13-01-2025
Data Mining Classification: Basic Concepts, Decision Trees, and Model Evaluation Lecture Notes for Chapter 4 Introduction to Data Mining
101
150
1
13-01-2025
SQL và PL/SQLCơ bản.Oracle cơ bản - SQL và PL/SQLMỤC LỤCMỤC LỤC ... CHƯƠNG
104
168
0
13-01-2025
CÔNG NGHỆ MÔI TRƯỜNG - CHƯƠNG 5 CƠ SỞ QUÁ TRÌNH XỬ LÝ SINH HỌC
1
157
0
13-01-2025
THUẬT TOÁN LUYỆN KIM SONG SONG (Parallel Simulated Annealing Algorithms) GIẢI QUYẾT BÀI TOÁN MAX-SAT
41
134
1
13-01-2025
TÀI LIỆU HOT
Mẫu đơn thông tin ứng viên ngân hàng VIB
8
8111
2279
Giáo trình Tư tưởng Hồ Chí Minh - Mạch Quang Thắng (Dành cho bậc ĐH - Không chuyên ngành Lý luận chính trị)
152
8006
1826
Ebook Chào con ba mẹ đã sẵn sàng
112
4443
1376
Ebook Tuyển tập đề bài và bài văn nghị luận xã hội: Phần 1
62
6397
1280
Ebook Facts and Figures – Basic reading practice: Phần 1 – Đặng Tuấn Anh (Dịch)
249
8911
1161
Giáo trình Văn hóa kinh doanh - PGS.TS. Dương Thị Liễu
561
3864
680
Giáo trình Sinh lí học trẻ em: Phần 1 - TS Lê Thanh Vân
122
3931
610
Giáo trình Pháp luật đại cương: Phần 1 - NXB ĐH Sư Phạm
274
4793
567
Tiểu luận: Tư tưởng Hồ Chí Minh về xây dựng nhà nước trong sạch vững mạnh
13
11381
543
Bài tập nhóm quản lý dự án: Dự án xây dựng quán cafe
35
4540
490