Kinh doanh - Marketing
Kinh tế quản lý
Biểu mẫu - Văn bản
Tài chính - Ngân hàng
Công nghệ thông tin
Tiếng anh ngoại ngữ
Kĩ thuật công nghệ
Khoa học tự nhiên
Khoa học xã hội
Văn hóa nghệ thuật
Sức khỏe - Y tế
Văn bản luật
Nông Lâm Ngư
Kỹ năng mềm
Luận văn - Báo cáo
Giải trí - Thư giãn
Tài liệu phổ thông
Văn mẫu
Tài liệu HOT
Tìm
Danh mục
Kinh doanh - Marketing
Kinh tế quản lý
Biểu mẫu - Văn bản
Tài chính - Ngân hàng
Công nghệ thông tin
Tiếng anh ngoại ngữ
Kĩ thuật công nghệ
Khoa học tự nhiên
Khoa học xã hội
Văn hóa nghệ thuật
Y tế sức khỏe
Văn bản luật
Nông lâm ngư
Kĩ năng mềm
Luận văn - Báo cáo
Giải trí - Thư giãn
Tài liệu phổ thông
Văn mẫu
Thông tin
Điều khoản sử dụng
Quy định bảo mật
Quy chế hoạt động
Chính sách bản quyền
0
Trang chủ
Luận Văn - Báo Cáo
Báo cáo khoa học
Báo cáo khoa học: "Text Segmentation by Language Using Minimum Description Length"
TAILIEUCHUNG - Báo cáo khoa học: "Text Segmentation by Language Using Minimum Description Length"
The problem addressed in this paper is to segment a given multilingual document into segments for each language and then identify the language of each segment. The problem was motivated by an attempt to collect a large amount of linguistic data for non-major languages from the web. | Text Segmentation by Language Using Minimum Description Length Hiroshi Yamaguchi Kumiko Tanaka-Ishii Graduate School of Faculty and Graduate School of Information Information Science and Technology Science and Electrical Engineering University of Tokyo Kyushu University kumiko@ Abstract The problem addressed in this paper is to segment a given multilingual document into segments for each language and then identify the language of each segment. The problem was motivated by an attempt to collect a large amount of linguistic data for non-major languages from the web. The problem is formulated in terms of obtaining the minimum description length of a text and the proposed solution finds the segments and their languages through dynamic programming. Empirical results demonstrating the potential of this approach are presented for experiments using texts taken from the Universal Declaration of Human Rights and Wikipedia covering more than 200 languages. 1 Introduction For the purposes of this paper a multilingual text means one containing text segments limited to those longer than a clause written in different languages. We can often find such texts in linguistic resources collected from the World Wide Web for many nonmajor languages which tend to also contain portions of text in a major language. In automatic processing of such multilingual texts they must first be segmented by language and the language of each segment must be identified since many state-of-the-art NLP applications are built by learning a gold standard for one specific language. Moreover segmentation is useful for other objectives such as collecting linguistic resources for non-major languages and automatically removing portions written in major languages as noted above. The study reported here was motivated by this objective. The problem addressed in this article is thus to segment a multilingual text by language and identify the language of each .
Thùy Giang
59
10
pdf
Báo lỗi
Trùng lắp nội dung
Văn hóa đồi trụy
Phản động
Bản quyền
File lỗi
Khác
Upload
Tải xuống
đang nạp các trang xem trước
Bấm vào đây để xem trước nội dung
Tải xuống
TÀI LIỆU LIÊN QUAN
Báo cáo khoa học: "Text Segmentation by Language Using Minimum Description Length"
10
46
0
Báo cáo khoa học: "Text Segmentation with LDA-Based Fisher Kernel"
4
56
0
Báo cáo khoa học: "Unsupervised Segmentation of Chinese Text by Use of Branching Entropy"
8
47
0
Báo cáo khoa học: "A Statistical Model for Domain-Independent Text Segmentation"
8
74
0
Báo cáo khoa học: "Text Segmentation Using Reiteration and Collocation"
5
36
0
Báo cáo khoa học: "Text Segmentation with Multiple Surface Linguistic Cues"
5
47
0
Báo cáo khoa học: "Optimal Multi-Paragraph Text Segmentation by Dynamic Programming"
3
53
0
Báo cáo khoa học: "Cohesion and Collocation: Using Context Vectors in Text Segmentation"
5
55
0
Báo cáo khoa học: "BASED TEXT SEGMENTATION ON SIMILARITY BETWEEN WORDS"
3
38
0
Báo cáo khoa học: "MULTI-PARAGRAPH SEGMENTATION EXPOSITORY TEXT"
8
38
0
TÀI LIỆU XEM NHIỀU
Một Case Về Hematology (1)
8
462047
59
Giới thiệu :Lập trình mã nguồn mở
14
23656
73
Tiểu luận: Tư tưởng Hồ Chí Minh về xây dựng nhà nước trong sạch vững mạnh
13
11108
535
Câu hỏi và đáp án bài tập tình huống Quản trị học
14
10339
457
Phân tích và làm rõ ý kiến sau: “Bài thơ Tự tình II vừa nói lên bi kịch duyên phận vừa cho thấy khát vọng sống, khát vọng hạnh phúc của Hồ Xuân Hương”
3
9625
106
Ebook Facts and Figures – Basic reading practice: Phần 1 – Đặng Tuấn Anh (Dịch)
249
8603
1148
Tiểu luận: Nội dung tư tưởng Hồ Chí Minh về đạo đức
16
8354
423
Mẫu đơn thông tin ứng viên ngân hàng VIB
8
7929
2246
Đề tài: Dự án kinh doanh thời trang quần áo nữ
17
6971
260
Giáo trình Tư tưởng Hồ Chí Minh - Mạch Quang Thắng (Dành cho bậc ĐH - Không chuyên ngành Lý luận chính trị)
152
6649
1597
TỪ KHÓA LIÊN QUAN
Báo cáo khoa học
Text Segmentation by Language Using Minimum Description Length
Hiroshi Yamaguchi
Kumiko
Tanaka Ishii
báo cáo khoa học
báo cáo ngôn ngữ
ngôn ngữ tự nhiên
Bài giảng Xử lý ngôn ngữ tự nhiên
Xử lý ngôn ngữ tự nhiên
Kỹ thuật lập trình
Mô hình ngôn ngữ
Mô hình n gram
Dịch máy
Phương pháp dịch máy
Hiểu ngôn ngữ
Phân loại tin tự động
Tạo chí tin học
Điều khiển học
Truy vấn ngôn ngữ tự nhiên
Phép dịch truy vấn ngôn ngữ tự nhiên
Truy vấn SQL
Văn phạm ngữ nghĩa
Xử lý nhập nhằng ngữ nghĩa
Xử lý ngữ nghĩa
Phân tích ngữ nghĩa
Biểu diễn vị từ
Thuộc tính về sự kiện
Thuộc tính về sự kiện
Xử lý ngôn ngữ
Natural Language Processing
Ngôn ngữ lập trình
Nhập nhằng cấu trúc
Tri thức về ngôn ngữ
Mô hình ngôn ngữ Google Book N grams
Mô hình ngôn ngữ KenLM
Phương pháp làm mịn
Bài toán PTCP
Phân tích cú pháp
Cấu trúc ngữ pháp
Phân tích cú pháp xác suất
CKY kết hợp xác suất
Văn phạm phi ngữ cảnh xác suất
Hình thái học
Gán nhãn từ loại
Ngôn ngữ tự nhiên trong dịch máy
Hệ thống dịch máy
Phương pháp xây dựng bảng từ
Tác từ
Conditional random fields
Nhận dạng thực thể có tên
Đối tượng vật lý trừu tượng
Phân lớp văn bản
Biểu diễn nhị phân
Ma trận từ văn bản
Wolfram Alpha
Trích rút thông tin
Phương pháp Snowball
TÀI LIỆU MỚI ĐĂNG
Sáng tạo trong thuật toán và lập trình với ngôn ngữ Pascal và C# Tập 2 - Chương 4
47
283
1
22-06-2024
B2B Content Marketing: 2012 Benchmarks, Budgets & Trends
17
164
1
22-06-2024
XỬ TRÍ CHẤN THƯƠNG SỌ NÃO KÍN
1
144
2
22-06-2024
MẪU CHỨNG CHỈ QUẢN LÝ VŨ KHÍ, VẬT LIỆU NỔ, CCHT
1
141
0
22-06-2024
Quy Trình Canh Tác Cây Bông Vải
8
128
0
22-06-2024
Hướng dẫn chế độ dinh dưỡng cho người bệnh viêm khớp
5
140
0
22-06-2024
Anh văn TOEFL Vocabulary-008
8
130
0
22-06-2024
The Constituents of Medicinal Plants
185
135
0
22-06-2024
Tổng hợp Đề thi học sinh giỏi môn Sinh lớp 9 cấp huyện vòng 1 năm 2010-2011
12
199
2
22-06-2024
báo cáo hóa học:" A decade of modelling research yields considerable evidence for the importance of concurrency: a response to Sawers and Stillwaggon"
7
116
0
22-06-2024
TÀI LIỆU HOT
Mẫu đơn thông tin ứng viên ngân hàng VIB
8
7929
2246
Giáo trình Tư tưởng Hồ Chí Minh - Mạch Quang Thắng (Dành cho bậc ĐH - Không chuyên ngành Lý luận chính trị)
152
6649
1597
Ebook Chào con ba mẹ đã sẵn sàng
112
3988
1298
Ebook Tuyển tập đề bài và bài văn nghị luận xã hội: Phần 1
62
5649
1185
Ebook Facts and Figures – Basic reading practice: Phần 1 – Đặng Tuấn Anh (Dịch)
249
8603
1148
Giáo trình Văn hóa kinh doanh - PGS.TS. Dương Thị Liễu
561
3628
664
Giáo trình Sinh lí học trẻ em: Phần 1 - TS Lê Thanh Vân
122
3839
600
Giáo trình Pháp luật đại cương: Phần 1 - NXB ĐH Sư Phạm
274
4345
541
Tiểu luận: Tư tưởng Hồ Chí Minh về xây dựng nhà nước trong sạch vững mạnh
13
11108
535
Bài tập nhóm quản lý dự án: Dự án xây dựng quán cafe
35
4286
483
Đã phát hiện trình chặn quảng cáo AdBlock
Trang web này phụ thuộc vào doanh thu từ số lần hiển thị quảng cáo để tồn tại. Vui lòng tắt trình chặn quảng cáo của bạn hoặc tạm dừng tính năng chặn quảng cáo cho trang web này.