基于卷积神经网络对文本数据集进行二分类，文本为两列分别为lebal和review，lebal为标签列，reveiw为内容列，对标签列进行读取，标签分别为0和1共两类，随机将两类别的各80%作为训练集，20%作为训练集，在训练时首先对reveiw列文本转换为数字序列，选择最长的句子作为序列定长，其他长度进行按0填充，并对其他建立一个传统卷积神经网络，卷积核大小为3，池化层为平均池化，训练轮数为50，输出训练集和测试集每一轮的准确率和损失率并作一个折线图，基于PYtorch建立模型，给出详细的代码

时间: 2023-11-28 19:04:39 浏览: 263

以下是基于PyTorch建立卷积神经网络进行文本二分类的详细代码： ``` import torch import torch.nn as nn import torch.optim as optim from torchtext.data import Field, TabularDataset, BucketIterator # 设置随机种子 SEED = 1234 torch.manual_seed(SEED) torch.backends.cudnn.deterministic = True # 定义Field TEXT = Field(tokenize='spacy', batch_first=True, include_lengths=True) LABEL = Field(sequential=False, is_target=True) # 构建TabularDataset fields = {'label': ('label', LABEL), 'review': ('text', TEXT)} train_data, test_data = TabularDataset.splits( path='.', train='train.csv', test='test.csv', format='csv', fields=fields) # 构建词汇表 TEXT.build_vocab(train_data, max_size=25000, vectors='glove.6B.100d') LABEL.build_vocab(train_data) # 定义模型 class CNN(nn.Module): def __init__(self, vocab_size, embedding_dim, n_filters, filter_sizes, output_dim, dropout): super().__init__() self.embedding = nn.Embedding(vocab_size, embedding_dim) self.convs = nn.ModuleList([nn.Conv2d(in_channels=1, out_channels=n_filters, kernel_size=(fs, embedding_dim)) for fs in filter_sizes]) self.fc = nn.Linear(len(filter_sizes) * n_filters, output_dim) self.dropout = nn.Dropout(dropout) def forward(self, text, text_lengths): embedded = self.embedding(text) embedded = embedded.unsqueeze(1) conved = [nn.functional.avg_pool2d(nn.functional.relu(conv(embedded)), (text.shape[1], 1)).squeeze(3) for conv in self.convs] cat = self.dropout(torch.cat(conved, dim=1)) return self.fc(cat) # 定义超参数 BATCH_SIZE = 64 EMBEDDING_DIM = 100 N_FILTERS = 100 FILTER_SIZES = [3] OUTPUT_DIM = 1 DROPOUT = 0.5 device = torch.device('cuda' if torch.cuda.is_available() else 'cpu') # 构建迭代器 train_iterator, test_iterator = BucketIterator.splits( (train_data, test_data), batch_size=BATCH_SIZE, device=device, sort_key=lambda x: len(x.text), sort_within_batch=True) # 初始化模型、优化器和损失函数 model = CNN(len(TEXT.vocab), EMBEDDING_DIM, N_FILTERS, FILTER_SIZES, OUTPUT_DIM, DROPOUT).to(device) optimizer = optim.Adam(model.parameters()) criterion = nn.BCEWithLogitsLoss().to(device) # 训练模型 def train(model, iterator, optimizer, criterion): epoch_loss = 0 epoch_acc = 0 model.train() for batch in iterator: optimizer.zero_grad() text, text_lengths = batch.text predictions = model(text, text_lengths).squeeze(1) loss = criterion(predictions, batch.label.float()) acc = ((predictions > 0.5) == batch.label.byte()).sum().item() / len(batch.label) loss.backward() optimizer.step() epoch_loss += loss.item() epoch_acc += acc return epoch_loss / len(iterator), epoch_acc / len(iterator) # 测试模型 def evaluate(model, iterator, criterion): epoch_loss = 0 epoch_acc = 0 model.eval() with torch.no_grad(): for batch in iterator: text, text_lengths = batch.text predictions = model(text, text_lengths).squeeze(1) loss = criterion(predictions, batch.label.float()) acc = ((predictions > 0.5) == batch.label.byte()).sum().item() / len(batch.label) epoch_loss += loss.item() epoch_acc += acc return epoch_loss / len(iterator), epoch_acc / len(iterator) N_EPOCHS = 50 best_valid_loss = float('inf') train_loss_list, train_acc_list, valid_loss_list, valid_acc_list = [], [], [], [] for epoch in range(N_EPOCHS): train_loss, train_acc = train(model, train_iterator, optimizer, criterion) valid_loss, valid_acc = evaluate(model, test_iterator, criterion) train_loss_list.append(train_loss) train_acc_list.append(train_acc) valid_loss_list.append(valid_loss) valid_acc_list.append(valid_acc) if valid_loss < best_valid_loss: best_valid_loss = valid_loss torch.save(model.state_dict(), 'cnn-model.pt') print(f'Epoch: {epoch+1:02}, Train Loss: {train_loss:.3f}, Train Acc: {train_acc*100:.2f}%, Val. Loss: {valid_loss:.3f}, Val. Acc: {valid_acc*100:.2f}%') # 绘制训练集和测试集每一轮的准确率和损失率折线图 import matplotlib.pyplot as plt plt.plot(train_loss_list, label='Training Loss') plt.plot(valid_loss_list, label='Validation Loss') plt.xlabel('Epoch') plt.ylabel('Loss') plt.legend() plt.show() plt.plot(train_acc_list, label='Training Accuracy') plt.plot(valid_acc_list, label='Validation Accuracy') plt.xlabel('Epoch') plt.ylabel('Accuracy') plt.legend() plt.show() ``` 在这个代码中，我们首先定义了 `Field`，并使用 `TabularDataset` 加载数据集。然后，我们使用 `Field` 构建了词汇表，并使用 `BucketIterator` 构建了迭代器。接着，我们定义了卷积神经网络模型，并使用 `Adam` 优化器和 `BCEWithLogitsLoss` 损失函数进行训练。我们使用了 `train` 和 `evaluate` 两个函数分别进行训练和测试。最后，我们使用 `matplotlib` 绘制了训练集和测试集每一轮的准确率和损失率折线图。

阅读全文

相关推荐

cnn-text-classification：在Yelp，IMDB和句子极性数据集v1.0上使用卷积神经网络进行文本分类

2nd 基于字符的卷积神经网络文本分类方法1

动态加载控件及获得sql字段的说明为label

gridview中将dropdownlist中的Value赋给lebal

json格式lebal

latex 伪代码lebal

基于ssm的网络教学平台（有报告）。Javaee项目，ssm项目。

2024年AI代码平台及产品发展简报-V11.pdf

蓝桥杯JAVA代码.zip

QPSK调制解调技术研究与FPGA实现：详细实验文档的探索与实践,基于FPGA实现的QPSK调制解调技术：实验文档详细解读与验证,QPSK调制解调 FPGA设计，有详细实验文档 ,QPSK调制解调;

PID、ADRC和MPC轨迹跟踪控制器在Matlab 2018与Carsim 8中的Simulink仿真研究,PID、ADRC与MPC轨迹跟踪控制器在Matlab 2018与Carsim 8中的仿真研

基于Springboot的个性化图书推荐系统。Javaee项目，springboot项目。

Matlab实现Transformer-Adaboost时间序列预测的详细项目实例（含完整的程序，GUI设计和代码详解）

液滴穿越障碍：从文献到案例的复现研究,液滴破裂与障碍物穿越：文献复现案例研究,液滴生成并通过障碍物破裂 该案例是文献复现，文献与案例一起 ,液滴生成; 障碍物破裂; 文献复现; 案例研究,液滴破

蓝桥杯练习题_2.zip

蓝桥杯笔记，用于个人学习进步.zip

基于最小递归二乘法的MPC自适应轨迹跟踪控制优化 针对轮胎刚度时变特性提升模型精度与鲁棒性，仿真验证满足车辆低速高精度跟踪与高速稳定性提升 ,基于变预测时域MPC自适应轨迹跟踪控制与轮胎侧偏刚度优化提

大家在看

ICCV2019无人机集群人体动作捕捉文章

100万+商品条形码库Excel+SQL

BUPT神经网络与深度学习课程设计

计算机网络_自顶向下方法_第四版_课后习题答案

关于初始参数异常时的参数号-无线通信系统arm嵌入式开发实例精讲

最新推荐

基于ssm的网络教学平台（有报告）。Javaee项目，ssm项目。

2024年AI代码平台及产品发展简报-V11.pdf

蓝桥杯JAVA代码.zip

QPSK调制解调技术研究与FPGA实现：详细实验文档的探索与实践,基于FPGA实现的QPSK调制解调技术：实验文档详细解读与验证,QPSK调制解调 FPGA设计，有详细实验文档 ,QPSK调制解调;

PID、ADRC和MPC轨迹跟踪控制器在Matlab 2018与Carsim 8中的Simulink仿真研究,PID、ADRC与MPC轨迹跟踪控制器在Matlab 2018与Carsim 8中的仿真研

QML实现多功能虚拟键盘新功能介绍

揭秘交通灯控制系统：从电路到算法的革命性演进

rk3588 istore

React购物车项目入门及脚本使用指南

交通信号控制系统优化全解析：10大策略提升效率与安全性

液滴穿越障碍：从文献到案例的复现研究,液滴破裂与障碍物穿越：文献复现案例研究,液滴生成并通过障碍物破裂该案例是文献复现，文献与案例一起 ,液滴生成; 障碍物破裂; 文献复现; 案例研究,液滴破

基于最小递归二乘法的MPC自适应轨迹跟踪控制优化针对轮胎刚度时变特性提升模型精度与鲁棒性，仿真验证满足车辆低速高精度跟踪与高速稳定性提升 ,基于变预测时域MPC自适应轨迹跟踪控制与轮胎侧偏刚度优化提