常见向量数据库的安装与使用
发表于|nlp
|总字数:15|阅读时长:1分钟|浏览量:
常见向量数据库的安装与使用
vector-database
文章作者: 小鱼吃猫
版权声明: 本博客所有文章除特别声明外,均采用 CC BY-NC-SA 4.0 许可协议。转载请注明来源 小鱼吃猫!
相关推荐
2023-08-03
Transformers学习之Evaluate组件
Transformers学习之Evaluate组件这是一个评估函数,在模型训练与测试中,我们会根据一些指标来对模型进行评测,用起来也非常简单哈。 12# 导包import evaluate 支持的评估函数支持的评估函数较多,这里只列出几个常见的,其余可以使用 evaluate.list_evaluation_modules() 方法进行查看 1234{'name': 'f1', 'type': 'metric'}{'name': 'recall', 'type': 'metric'}{'name': 'accuracy', 'type': 'metric'}{'name': 'precision', 'type': ...
2023-08-03
Transformers框架之Datasets 组件
Transformers框架之Datasets 组件Transformers学习之Datasets 组件一、说明 用途:Datesets 顾名思义就是用来加载和保存数据集的组件 二、加载Huggingface数据集 选择数据集如下图,你可以在对应位置选择你想要的数据集,选择任务和语言后,右边会出现对应的数据集点进去对应的数据集,可以看到预览整个数据集,然后点击复制按钮就可以加载数据集了。 加载数据集 123from datasets import *datasets = load_dataset("shibing624/snli-zh")print(datasets) 输出结果如下,可以看到整个数据集的配置:只有一个训练集集,一共有419402条数据,每条数据包含三个字段。 123456DatasetDict({ train: Dataset({ features: ['premise', 'hypothesis', 'label'], num...
2026-04-01
OpenCode安装使用及MCP、Skill的使用
OpenCode安装使用及MCP、Skill的使用 以“完成一个网页版的2048”为例,讲解下如何使用OpenCode。 技术栈: 纯前端项目,使用Vue和JavaScript完成项目
2023-08-30
预训练模型实战之文本摘要
预训练模型实战之文本摘要任务描述文本摘要是指通过各种技术,对文本或者是文本的集合,抽取、总结或是精炼其中的要点信息,用以概括和展示原始文本的主要内容或大意。作为文本生成任务的主要方向之一,从本质上而言,这是一种信息压缩技术。文本摘要技术是信息爆炸时代,提升人们获取有效信息效率的关键技术之一,如何从冗余、非结构化的长文本中提炼出关键信息,构成精简通顺的摘要,是文本摘要的核心问题。 实验概述在之前的文章预训练模型实战中,介绍到了四种预训练语言模型,四种语言模型都可以做文本摘要任务,但像bert这种掩码语言模型效果就相对差一点儿。本文选取四种语言模型,在文本摘要任务上做对比试验。 实验配置数据集LCSTS_new中文短摘要生成数据集2015年发布的生成式短摘要数据集,以微博原文为输入,1~2句话的短摘要为输出。 预训练模型 鉴于资源限制,本文选择的模型在一方面要支持中文,另一方面要模型体积尽可能小,所以本实验的结果并不能代表模型的性能。 hfl/chinese-macbert-base 掩码语言模型 Langboat/mengzi-t5-base seq2s...
2023-09-11
基于向量匹配的检索式问答实战
基于向量匹配的检索式问答实战可以先看一看检索式问答的综述,《检索式问答综述》,这篇是实战,直接上代码。 准备工作 数据集:wangrui6/Zhihu-KOL,包含10w条知乎通用问答数据,以下是两个示例: INSTRUCTION (string) RESPONSE (string) 从北大光华读完MBA的人都去了哪里工作? 这里我们根据北大光华的数据给大家分析一下。 Python3中如何得到Unicode码对应的中文? “看的头晕啊!编码真是把人绕晕了啊!” 模型:哈工大的一个中文BERThfl/chinese-macbert-base 分析可以根据要问的问题和知识库里的句子计算相似度进行答案的搜索,但这要求需要有成对的相似句子对作为训练数据集。这需要每个文法都需要有至少两个以上的句子,这很不现实。所以在实际中,可以直接计算问题和答案之间的相似度,以此来完成答案的索引。 代码实现模型训练 利用问答对训练一个文本相似度计算模型用做编码器 这部分和之前的文章是一样的,可以参考文本相似度匹配中问题2的代码 存储数据 利用上一步训练来的编...
2023-10-09
Module ‘XXX‘ doesn‘t exist on the Hugging Face Hub
Module ‘accuracy’ doesn’t exist on the Hugging Face Hub either.问题:12Module 'accuracy' doesn't exist on the Hugging Face Hub either.Module 'f1' doesn't exist on the Hugging Face Hub either. 原因出现这个错误,主要在使用evaluate时,加载accuarcy,由于网络问题访问不到导致的。 1acc_metric = evaluate.load("accuracy") 解决方案 下载对应的py文件,然后从本地加载 1https://github.com/huggingface/datasets/tree/main/metrics 从本地加载评估模块 123from datasets import load_metricacc_metric = load_metric("./accuracy.py&quo...
公告

