Feedback about NLP From Scratch: Generating Names with a Character-Level RNN
Chưa có ai nhận issue này.
Đánh giá
- Độ khó
- 4/5
- Thời gian dự kiến
- 3-5 ngày
- Mức phù hợp với người mới
- 52/100
- Loại issue
- Lỗi
- Độ rõ ràng
- Khá rõ ràng
- Mức độ hoạt động
- Ít trao đổi
- Công nghệ
- python
- Lĩnh vực
- machine-learning
Hướng nghiên cứu
Bắt đầu với trang hướng dẫn được liên kết “NLP From Scratch” và kiểm tra cách triển khai RNN ở cấp độ ký tự cùng ví dụ huấn luyện của nó. Tái hiện hành vi được báo cáo, đánh giá xem các thay đổi activation được đề xuất có đúng hay không, và chỉ cập nhật hướng dẫn nếu vấn đề được xác nhận, đồng thời giữ nguyên quá trình huấn luyện hoạt động và các mẫu được tạo ra.
Do mô hình lập chỉ mục viết ra từ nội dung của issue.
Mô tả
There is the following issue on this page: https://docs.pytorch.org/tutorials/intermediate/char_rnn_generation_tutorial.html.
There is no non-linearity wrapper while passing the hidden state onto the next iteration, and on output layer that predicts distribution. Results are coming relatively fine though, maybe because nn.LogSoftmax is implicitly acting as non-linearity. But for learning hidden states, its bad, $h_t$ is literally linear combination of $h_{t-1}$, all past $x$ s and $Cat$.
Simple Fix:
class RNN(nn.Module):
def __init__(self,C_in:int, C_hid:int, C_out:int):
super().__init__()
self.C_in = C_in
self.C_hid = C_hid
self.C_out = C_out
self.C_cat = data1.C_cat
self.i2h = nn.Linear(data1.C_cat + C_in + C_hid,C_hid)
self.i2o1 = nn.Linear(data1.C_cat + C_in + C_hid,C_out)
self.o12o2 = nn.Linear(C_out + C_hid,C_hid)
self.o22o3 = nn.Linear(C_hid, C_out)
self.tanh = nn.Tanh()
self.todist = nn.LogSoftmax(dim=1)
def forward(self,x_C:tensor, x_X:tensor, x_H:tensor):
# Inputs = (B=1,C_cat), (B=1, C_in), (B=1,C_out),
# Output = (B=1, C_out), (B=1,C_hid)
x = torch.cat((x_C,x_X,x_H),dim=1)
h = self.tanh(self.i2h(x))
x = self.i2o1(x)
x = torch.cat((x,h),dim=1)
x = self.tanh(self.o12o2(x))
x = self.o22o3(x)
return self.todist(x), h
Edit1: nn.tanh 's range is between $[-1,1]$. Compressing logits before softmax can really impact the result. Using one more layer before projection gave me similar error of 2.2127 , and nice samples.
Thank you.
- Ngôn ngữ chính
- Python
- Star
- 9.3k
- Fork
- 4.4k
- Merge trung bình
- 1 ngày 21 giờ
- Pull request đã merge (30 ngày)
- 4
Hướng dẫn đóng góp
Bắt đầu từ đâu
- Đọc hết issue, rồi đọc hướng dẫn đóng góp của dự án.
- Bình luận trên issue rằng bạn sẽ nhận — tránh hai người làm cùng một việc.
- Fork repository và làm thay đổi trên một nhánh.
- Mở pull request có tham chiếu số hiệu của issue.
Issue khác của pytorch/tutorials
-
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 78/100
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 70/100
-
bug
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 76/100
-
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 78/100
-
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 78/100
Tất cả issue của pytorch/tutorials
Issue tương tự
-
agent-ready documentation needs-triage
Độ khó 1/5 1-3 giờ Mức phù hợp với người mới 88/100
-
documentation
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 91/100
-
workflow-status page template still says reusable workflows are "triggered only by workflow_call:" Đang mở
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 92/100
-
Add https://search.jeremyh.xyz/ Đang mởinstance instance add
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 72/100
searxng/searx-instances#939 · 1 bình luận ·
-
area-deployment area-integrations triage:bot-seen
Độ khó 2/5 Nửa ngày Mức phù hợp với người mới 86/100