Skip to content
Open
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
2 changes: 1 addition & 1 deletion fun_text_processing/text_normalization/normalize.py
Original file line number Diff line number Diff line change
Expand Up @@ -351,7 +351,7 @@ def split_text_into_sentences(self, text: str) -> List[str]:
upper_case_unicode = "\u0410-\u042F"

# Read and split transcript by utterance (roughly, sentences)
split_pattern = f"(?<!\w\.\w.)(?<![A-Z{upper_case_unicode}][a-z{lower_case_unicode}]+\.)(?<![A-Z{upper_case_unicode}]\.)(?<=\.|\?|\!|\.”|\?”\!”)\s(?![0-9]+[a-z]*\.)"
split_pattern = f"(?<!\\w\\.\\w.)(?<![A-Z{upper_case_unicode}][a-z{lower_case_unicode}]+\\.)(?<![A-Z{upper_case_unicode}]\\.)(?<=\\.|\\?|\\!|\\.”|\\?”\\!”)\\s(?![0-9]+[a-z]*\\.)"

sentences = regex.split(split_pattern, text)
return sentences
Expand Down
12 changes: 6 additions & 6 deletions funasr/models/fsmn_kws/encoder.py
Original file line number Diff line number Diff line change
Expand Up @@ -84,7 +84,7 @@ def to_pytorch_net(self, fread):
dtype=torch.float32)
for i in range(self.output_dim):
line = fread.readline()
splits = line.strip().strip('\[\]').strip().split()
splits = line.strip().strip('\\[\\]').strip().split()
assert len(splits) == self.input_dim
cols = torch.tensor([float(item) for item in splits],
dtype=torch.float32)
Expand Down Expand Up @@ -160,7 +160,7 @@ def to_pytorch_net(self, fread):
dtype=torch.float32)
for i in range(self.output_dim):
line = fread.readline()
splits = line.strip().strip('\[\]').strip().split()
splits = line.strip().strip('\\[\\]').strip().split()
assert len(splits) == self.input_dim
cols = torch.tensor([float(item) for item in splits],
dtype=torch.float32)
Expand All @@ -171,7 +171,7 @@ def to_pytorch_net(self, fread):
linear_bias = self.state_dict()['linear.bias']
#print(linear_bias.shape)
bias_line = fread.readline()
splits = bias_line.strip().strip('\[\]').strip().split()
splits = bias_line.strip().strip('\\[\\]').strip().split()
assert len(splits) == self.output_dim
new_bias = torch.tensor([float(item) for item in splits],
dtype=torch.float32)
Expand Down Expand Up @@ -331,7 +331,7 @@ def to_pytorch_net(self, fread):
self.dim = int(fsmn_split[1])

params_line = fread.readline()
params_split = params_line.strip().strip('\[\]').strip().split()
params_split = params_line.strip().strip('\\[\\]').strip().split()
assert len(params_split) == 12
assert params_split[0] == '<LearnRateCoef>'
assert params_split[2] == '<LOrder>'
Expand All @@ -352,7 +352,7 @@ def to_pytorch_net(self, fread):
for i in range(self.lorder):
print('read conv_left weight -- %d' % i)
line = fread.readline()
splits = line.strip().strip('\[\]').strip().split()
splits = line.strip().strip('\\[\\]').strip().split()
assert len(splits) == self.dim
cols = torch.tensor([float(item) for item in splits],
dtype=torch.float32)
Expand All @@ -375,7 +375,7 @@ def to_pytorch_net(self, fread):
for i in range(self.rorder):
print('read conv_right weight -- %d' % i)
line = fread.readline()
splits = line.strip().strip('\[\]').strip().split()
splits = line.strip().strip('\\[\\]').strip().split()
assert len(splits) == self.dim
cols = torch.tensor([float(item) for item in splits],
dtype=torch.float32)
Expand Down
4 changes: 2 additions & 2 deletions funasr/models/fun_asr_nano/tools/format5res.py
Original file line number Diff line number Diff line change
Expand Up @@ -320,8 +320,8 @@ def all_convert(content):
continue
name = tmp[0]
content = tmp[1]
name = re.sub("\.pcm", "", name)
name = re.sub("\.wav", "", name)
name = re.sub("\\.pcm", "", name)
name = re.sub("\\.wav", "", name)
content = recoformat(content)
content = numbersingle(content)
content = ch_number2digit(content)
Expand Down