Nghe (chuyển văn bản thành giọng nói)
Athena có thể đọc thành tiếng những gì bạn đang xem. Mặc định, nó dùng bộ máy giọng nói tích hợp của điện thoại — không tải mô hình, không cần mạng, không tốn phí. Các phương án thay thế bên dưới chỉ cần thiết khi bộ máy đó không hoạt động trên thiết bị của bạn.
Bắt đầu
1. Mở một cuốn sách, hiện thanh công cụ và nhấn "Nghe".
2. Điều chỉnh tốc độ, chọn giọng đọc, và đặt hẹn giờ ngủ nếu bạn muốn việc phát tự dừng.
3. Trong EPUB, câu đang được đọc sẽ được tô sáng và trang cuộn theo. PDF được đọc thành tiếng mà không có tô sáng trên trang.
4. Việc phát tiếp tục khi màn hình tắt và khi Athena chạy nền. Màn hình khóa và bảng thông báo hiển thị bìa và chương, cùng các nút tạm dừng và lùi hoặc tiến một câu.
Nếu không hoạt động: chạy tự kiểm tra giọng nói
Một số điện thoại Android — đặc biệt là các mẫu mà nhà sản xuất đã sửa đổi tầng giọng nói của hệ thống — có bộ máy giọng nói bị lỗi. Vào Cài đặt → Nghe → Tự kiểm tra giọng nói. Athena sẽ thực sự phát một câu thử và hỏi bạn có nghe thấy không: các kiểm tra tự động bằng chương trình không đáng tin trên chính những thiết bị này, nên đôi tai của bạn là trọng tài cuối cùng.
Sau đó, tự kiểm tra đưa ra các cách khắc phục có mục tiêu, đơn giản nhất trước:
1. Đổi bộ máy ngay trong Athena. Nếu điện thoại của bạn có nhiều hơn một bộ máy giọng nói, chỉ cần đổi là đủ và không tải gì thêm. Việc đổi chỉ áp dụng trong Athena và không thay đổi mặc định của hệ thống.
2. Tải dữ liệu giọng nói còn thiếu. Tự kiểm tra có thể đưa bạn thẳng tới trình cài dữ liệu giọng nói của hệ thống.
3. Mở cài đặt giọng nói của hệ thống để kiểm tra bộ máy mặc định và các gói ngôn ngữ.
4. Thiết lập giọng nói đám mây (xem bên dưới).
5. Nếu không cách nào hiệu quả, bạn có thể tìm một bộ máy giọng nói bên thứ ba trong cửa hàng ứng dụng (ví dụ MultiTTS) và cài làm bộ máy hệ thống. Athena không cung cấp liên kết tải và không chịu trách nhiệm về nguồn gốc hay độ an toàn của ứng dụng bên thứ ba; vui lòng tự cân nhắc.
Giọng nói đám mây: dùng khóa API của riêng bạn
Đây là một tính năng nâng cao tùy chọn để lấp những khoảng trống mà bộ máy hệ thống không phủ được, về thiết bị hoặc về ngôn ngữ. Nó không bao giờ được đặt làm mặc định, và Athena tự động quay về bộ máy hệ thống nếu tổng hợp giọng thất bại hoặc bạn mất kết nối — tính năng nghe cơ bản luôn hoạt động ngoại tuyến.
Hai nhà cung cấp được hỗ trợ. Bạn chỉ cần nhập khóa API của riêng mình trong Cài đặt → Nghe → Giọng nói đám mây:
- Volcano Engine (Doubao): truy cập trực tiếp từ Trung Quốc đại lục mà không cần thiết lập mạng thêm. Danh mục giọng đọc 2.0 chính thức đầy đủ được tích hợp sẵn, bao phủ 16 ngôn ngữ.
- Microsoft Azure Speech: cho mọi nơi khác. Danh sách giọng đọc được lấy bằng khóa của bạn từ danh mục chính thức đầy đủ, bao phủ hàng trăm ngôn ngữ. Ngoài khóa, bạn phải nhập khu vực (region) đã chọn khi tạo tài nguyên (ví dụ eastasia).
Về giọng đọc và ngôn ngữ: chúng tôi hiển thị toàn bộ những gì hai nhà cung cấp có, nhóm theo ngôn ngữ và có thể tìm kiếm. Hãy chọn một giọng đọc theo ngôn ngữ của nội dung bạn đang đọc — điều này không liên quan gì tới các ngôn ngữ mà giao diện Athena hỗ trợ. Trước khi đăng ký hoặc thanh toán, hãy xem tài liệu chính thức bên dưới để xác nhận ngôn ngữ của bạn có trong danh sách của nhà cung cấp đó. Một quy tắc của Azure đáng biết trước: nếu ngôn ngữ của giọng đọc không khớp với văn bản, sẽ không có gì được đọc nhưng yêu cầu vẫn bị tính phí. Chọn sai giọng đọc không gây lỗi nào — bạn chỉ nhận được im lặng và một khoản phí.
Về chi phí: bạn trả trực tiếp cho nhà cung cấp. Athena không thu, không cộng thêm gì, và không đặt giới hạn. Lưu ý rằng hai bên tính phí khác nhau — Azure chính thức tính mỗi chữ Hán là hai ký tự, nên văn bản tiếng Trung tốn gấp đôi mức niêm yết, trong khi Volcano tính một chữ Hán là một ký tự. Số ký tự đã tổng hợp trong phiên hiện tại được hiển thị trong ứng dụng để bạn đối soát.
Về bảo mật: khóa API của bạn chỉ ở lại trên thiết bị này. Nó không bao giờ được đồng bộ và không bao giờ tải lên máy chủ của Athena. Cái giá là bạn phải nhập lại trên thiết bị mới; lợi ích là chúng tôi không bao giờ nắm giữ thông tin thanh toán bên thứ ba của bạn. Nó cũng được loại khỏi sao lưu hệ thống và chuyển dữ liệu giữa thiết bị để không thể rò rỉ qua bản sao lưu đám mây.
Khắc phục sự cố
"resource not granted" (Volcano): khóa hợp lệ nhưng dịch vụ chưa được bật, hoặc giọng đọc đã chọn chưa được mua trong bảng điều khiển. Hãy xử lý trong phần quản lý dịch vụ của bảng điều khiển Volcano. Khóa hợp lệ và tổng hợp giọng chạy được là hai việc khác nhau.
Lỗi khu vực Azure: khu vực phải trùng khớp chính xác với khu vực bạn chọn khi tạo tài nguyên Speech. Với tài nguyên Azure China (21Vianet), dùng tên khu vực Trung Quốc như chinaeast2.
Azure hoàn toàn không phát ra tiếng: rất có thể ngôn ngữ của giọng đọc không khớp với văn bản. Azure im lặng trong trường hợp đó nhưng vẫn tính phí yêu cầu, vì vậy hãy đổi sang giọng đọc phù hợp.
Thanh tốc độ không có tác dụng: cả hai nhà cung cấp đều hỗ trợ tốc độ. Nếu không có gì thay đổi, trước hết xác nhận giọng nói đám mây thực sự đang được dùng — Athena âm thầm quay về bộ máy hệ thống khi ngoại tuyến.
Câu đầu tiên mất một lúc: tổng hợp đám mây cần một vòng đi về qua mạng. Các câu sau được tải trước, nên việc phát trở nên liên tục.
Tài liệu chính thức
Tổng hợp giọng nói Volcano Engine Doubao (danh sách giọng đọc và tính phí): https://www.volcengine.com/docs/6561/1257544
Microsoft Azure Speech (hỗ trợ ngôn ngữ và giọng đọc): https://learn.microsoft.com/azure/ai-services/speech-service/language-support