语言模型与数据集

最新推荐文章于 2024-12-27 16:37:20 发布

原创最新推荐文章于 2024-12-27 16:37:20 发布 · 330 阅读

0 ·

CC 4.0 BY-SA版权

文章标签：

#语言模型 #人工智能

该博客介绍了语言模型的概率估计及其应用，如文本生成和序列选择。它讨论了使用N元语法的计数建模方法，并提出了处理长序列数据的两种策略：随机采样和顺序分区。随机采样允许非相邻子序列的生成，而顺序分区则确保了相邻小批量子序列的连续性。这两个函数`seq_data_iter_random`和`seq_data_iter_sequential`分别实现了这两种方法，用于训练模型时的数据迭代。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

（1）语言模型：给定文本序列x1,...,xT,其目的是估计联合概率p(x1,...,xT)，其应用包括做预训练模型、生成文本（给定几个词不断使用xt~p(xt|x1,...,xt-1)生成后续文本）和判断多个序列中那个更常见

（2）使用计数建模：N元语法

（3）读取长序列数据：当序列变得太长而不能被模型一次性全部处理时，可以将这些平均分成n个时间步的小序列，然后引入偏移，保证可以采集到所有情况的数据。

随机采样：在随机采样中，每个样本都是在原始的长序列上任意捕获的子序列。在迭代过程中，来自两个相邻的、随机的、小批量中的子序列不一定在原始序列上相邻。

def seq_data_iter_random(corpus, batch_size, num_steps):  #@save
    """使用随机抽样生成一个小批量子序列。"""
    # 从随机偏移量开始对序列进行分区，随机范围包括`num_steps - 1`
    corpus = corpus[random.randint(0, num_steps - 1):]
    # 减去1，是因为我们需要考虑标签
    num_subseqs = (len(corpus) - 1) // num_steps
    # 长度为`num_steps`的子序列的起始索引
    initial_indices = list(range(0, num_subseqs * num_steps, num_steps))
    # 在随机抽样的迭代过程中，
    # 来自两个相邻的、随机的、小批量中的子序列不一定在原始序列上相邻
    random.shuffle(initial_indices)

    def data(pos):
        # 返回从`pos`位置开始的长度为`num_steps`的序列
        return corpus[pos: pos + num_steps]

    num_batches = num_subseqs // batch_size
    for i in range(0, batch_size * num_batches, batch_size):
        # 在这里，`initial_indices`包含子序列的随机起始索引
        initial_indices_per_batch = initial_indices[i: i + batch_size]
        X = [data(j) for j in initial_indices_per_batch]
        Y = [data(j + 1) for j in initial_indices_per_batch]
        yield torch.tensor(X), torch.tensor(Y)

顺序分区：在迭代过程中，除了对原始序列可以随机抽样外，我们还可以保证两个相邻的小批量中的子序列在原始序列上也是相邻的。

def seq_data_iter_sequential(corpus, batch_size, num_steps):  #@save
    """使用顺序分区生成一个小批量子序列。"""
    # 从随机偏移量开始划分序列
    offset = random.randint(0, num_steps)
    num_tokens = ((len(corpus) - offset - 1) // batch_size) * batch_size
    Xs = torch.tensor(corpus[offset: offset + num_tokens])
    Ys = torch.tensor(corpus[offset + 1: offset + 1 + num_tokens])
    Xs, Ys = Xs.reshape(batch_size, -1), Ys.reshape(batch_size, -1)
    num_batches = Xs.shape[1] // num_steps
    for i in range(0, num_steps * num_batches, num_steps):
        X = Xs[:, i: i + num_steps]
        Y = Ys[:, i: i + num_steps]
        yield X, Y