update repo

2025-09-15 14:48:36 +08:00 · 2023-05-12 11:56:44 +08:00 · 2023-05-12 11:56:44 +08:00 · 8167ecaa49
commit 8167ecaa49
parent fd005eb85f
2 changed files with 5 additions and 2 deletions
--- a/funasr/datasets/large_datasets/dataset.py
+++ b/funasr/datasets/large_datasets/dataset.py
@ -135,7 +135,8 @@ class AudioDataset(IterableDataset):
                            speed = random.choice(self.speed_perturb)
                            if speed != 1.0:
                                mat, _ = torchaudio.sox_effects.apply_effects_tensor(
-                                    mat, sampling_rate, [['speed', str(speed)], ['rate', str(sampling_rate)]])
+                                    torch.tensor(mat).view(1, -1), sampling_rate, [['speed', str(speed)], ['rate', str(sampling_rate)]])
+                                mat = mat.view(-1).numpy()
                        sample_dict[data_name] = mat
                        sample_dict["sampling_rate"] = sampling_rate
                        if data_name == "speech":
--- a/funasr/fileio/sound_scp.py
+++ b/funasr/fileio/sound_scp.py
@ -8,6 +8,7 @@ import soundfile
 import librosa
 from typeguard import check_argument_types

+import torch
 import torchaudio

 from funasr.fileio.read_text import read_2column_text
@ -62,8 +63,9 @@ class SoundScpReader(collections.abc.Mapping):
            speed = random.choice(self.speed_perturb)
            if speed != 1.0:
                array, _ = torchaudio.sox_effects.apply_effects_tensor(
-                    array, rate,
+                    torch.tensor(array).view(1, -1), rate,
                    [['speed', str(speed)], ['rate', str(rate)]])
+            array = array.view(-1).numpy()

        return rate, array