Mô tả
Kính chào các nhà ngôn ngữ học tương lai! Trạm Nghiên cứu Thành ngữ Học Mở thành phố Huế đang xây dựng một bộ từ điển số hóa các trích đoạn văn bản dân gian.
Sau khi số hóa, một đoạn văn bản được biểu diễn như một chuỗi ký tự s chỉ bao gồm các chữ cái in thường từ 'a' đến 'z'. Để so sánh ngữ âm và tìm kiếm các gốc từ chung giữa các phương ngữ, đội ngũ nghiên cứu áp dụng kỹ thuật n-gram: họ cắt chuỗi thành các đoạn nhỏ liên tiếp, mỗi đoạn có độ dài n.
Ví dụ, với chuỗi "abcde" và n = 3, ta trích xuất được các đoạn: "abc", "bcd", "cde".
Nhiệm vụ của bạn là: Cho một chuỗi s và số nguyên n, hãy đếm xem có bao nhiêu n-gram phân biệt (không trùng lặp nhau) được tạo ra từ chuỗi đó.
Đầu vào
- Chuỗi
s(chỉ chứa các chữ cái in thường'a'đến'z'). - Số nguyên
n().
Đầu ra
- Trả về một số nguyên là số lượng có trong chuỗi .