登录社区云,与社区用户共同成长
邀请您加入社区
把新词加入词表,“教会”
深度学习是机器学习的一种特殊方法,而机器学习是实现人工智能的主要途径。
本文介绍了英文分词、词规范化及分句技术。分词涵盖空格/标点分割、正则表达式匹配及BPE子词算法;词规范化包括大小写折叠与词目还原;分句通过标点符号分割,需解决句号歧义,常结合分词结果判定句子边界。
本文系统介绍了NLP中的词嵌入技术发展历程。首先讲解了Word2Vec的Skip-Gram和CBOW模型原理及其在中文文本的应用;然后介绍了融合全局统计的GloVe模型,并给出代码实践;针对传统词嵌入的缺陷,分析了FastText子词嵌入和BPE字节对编码的优势;最后重点阐述了上下文敏感的预训练模型BERT,包括其双向编码特性、输入表示方法以及中文分词器的具体使用方法。通过从静态词嵌入到动态上下文
grad = preds - labels # 一阶梯度hess = np.ones_like(preds) # 二阶梯度适用于 Quantile Regression、Focal Loss 等场景。梯度提升树不仅是算法,更是一种认知范式:承认当前模型的不完美,以谦卑之心,一步步修正偏差。复杂问题,可以分解为一系列简单修正;最优解,往往藏在误差的梯度方向里;真正的强大,源于对细节的极致把控。
本文介绍了在SNLI数据集上微调预训练BERT模型进行自然语言推断的方法。通过加载小版本BERT,构建包含多层感知机的分类器,处理文本对数据,并进行训练优化,最终实现序列级文本分类任务,提升推断准确性。
BERT为自然语言处理提供通用解决方案,微调时只需加全连接层。本文介绍了其在单文本分类、文本对分类或回归、文本标注和问答等任务上的应用及微调方法。
Vectorstore 实现了一个 as_retriever 方法,该方法会生成一个 Retriever 对象,具体来说是 VectorStoreRetriever 对象。这些 Retriever 对象包含特定的 search_type 和 search_kwargs 属性,用于标识要调用底层 Vectorstore 的哪些方法以及如何对这些方法进行参数化。基于文档检索的目的是取回Document
本文系统梳理了知识工程的发展历程与核心技术。知识工程作为人工智能从通用问题求解转向知识驱动的关键转折,其发展经历了四个阶段:起步期(符号主义主导)、成长期(专家系统崛起)、快速发展期(语义网兴起)和多元化发展期(大数据与机器学习融合)。知识表示方法包括产生式规则、框架表示、状态空间和语义网络等,推理技术从经典逻辑发展为智能融合。当前知识图谱面临知识融合质量、扩展性和标准化三大挑战。随着技术进步,知
本文讲解用一维卷积和最大时间汇聚层构建textCNN模型进行情感分析。模型定义多个卷积核捕获局部特征,经汇聚和全连接层输出预测结果,加载预训练词向量后训练,可准确预测句子情感。
本文系统梳理了自然语言处理(NLP)技术的发展与应用全景。从技术演进看,NLP经历了规则驱动、统计学习到大语言模型的三个阶段,实现了从专用智能向通用智能的跨越。在应用层面,NLP已深度融入生活服务(智能交互、信息推荐)、产业赋能(金融风控、医疗诊断)、社会治理(舆情监测、智慧政务)和科研创新(文献分析、知识挖掘)四大领域,显著提升了社会运行效率。尽管面临语言歧义性、数据偏见、可解释性不足等挑战,未
本文讲解用预训练GloVe词向量和双向循环神经网络进行情感分析。构建BiRNN模型,加载预训练词向量且不更新,训练后定义预测函数,并对简单句子进行情感预测。
本文对比分析了自然语言处理(NLP)系统与程序语言编译器的分层处理机制。NLP系统处理自然语言的模糊性和歧义性,分为词法分析(处理分词歧义)、句法分析(构建依存树)和语义分析(理解真实意图)三个层次。编译器则处理形式化语言的严格规则,包括词法分析(识别固定token)、句法分析(构建AST)和语义分析(类型检查)。两者的根本差异源于自然语言为人类沟通设计(模糊灵活)而程序语言为计算机设计(精确严格
本文在WikiText-2上预训练小型BERT,展示损失变化,并演示用预训练BERT表示文本及验证其上下文敏感性。
本文系统分析了英语中{he,she}'s缩写的区分规则:当后接过去分词时为has(完成时),后接现在分词/形容词/名词时为is(进行时/主系表)。文章提供了4条优先级规则及典型例句,特别指出"过去分词=has"是最可靠判断标准。同时开发了Python程序,利用NLTK进行词性标注,自动判断缩写含义。测试显示该方法能准确区分95%的使用场景,为英语学习者和NLP处理提供了实用指南
本文摘要介绍了文本预处理和语言模型的基础知识,以及RNN、GRU、LSTM等神经网络模型。主要内容包括:1)文本预处理步骤(读取数据、词元化、构建词表);2)语言模型定义与实现(n元语法模型、困惑度评估);3)RNN及其变体GRU、LSTM的原理;4)编码器-解码器架构及其在seq2seq任务中的应用。重点强调了文本预处理和语言模型的重要性,而RNN系列模型仅需了解。文中提供了完整的代码实现,包括
本文介绍加载预训练GloVe词向量,通过词相似性和类比任务展示其语义,词相似性用余弦相似度找近义词,词类比通过向量运算完成,证明其能捕捉语义和句法信息。
本文讲解自然语言处理预训练的全局向量的词嵌入。上下文词共现含丰富语义信息,可预先计算共现统计。GloVe模型基于平方损失对跳元模型修改,用全局统计,中心词与上下文词向量数学等价,还可从共现概率比值理解。
本文讲解自然语言处理预训练的词嵌入(word2vec)的跳元语法模型,通过负采样在PTB数据集预训练。涵盖嵌入层定义、前向传播、二元交叉熵损失、模型训练及词向量应用(如余弦相似度找相似词),最终展示“chip”的相似词结果。
摘要: 本文探讨Java大数据技术在NLP对抗训练与鲁棒性提升中的应用。针对对抗攻击导致模型性能下降的问题,提出基于Java生态的解决方案:1)利用Apache Flink实现文本数据的高效清洗;2)通过Deeplearning4j框架构建文本生成对抗网络(GAN)生成对抗样本。文章通过代码实例展示了Flink流式数据过滤和GAN模型构建方法,为后续智慧交通等场景的NLP应用奠定鲁棒性基础,体现了
Decoder-Only架构下Decoder的学习
本文介绍了注意力机制的几种变体及其PyTorch代码实现。主要包括: Self-Attention:基础自注意力机制,通过Q、K、V计算注意力权重,适用于序列内部建模。 CrossAttention:让一个序列关注另一个序列,典型应用于Transformer解码器-编码器交互和多模态任务。 CausalAttention:通过三角掩码实现因果性,确保只能关注当前位置之前的token,适用于自回归生
在分类任务(如医学诊断、机器学习模型评估、数据标注等)中,**两个评估者(或模型)的分类一致性**是衡量结果可靠性的关键指标。**Cohen's Kappa系数(κ)** 是一种经典的统计方法,用于评估分类一致性,同时**校正随机一致的影响**,比简单的“一致率”更可靠。
BERT(Bidirectional Encoder Representations from Transformers)是一种基于Transformer架构的预训练语言模型,通过掩码语言模型(MLM)和下一句预测(NSP)任务实现深度双向语义理解。其核心创新在于双向上下文建模,突破了传统单向语言模型的局限。本文详细介绍了BERT的算法原理、实现步骤及训练流程,包括文本预处理、模型架构、训练策略和
自然语言处理(Natural Language Processing, NLP)是研究如何让机器理解与生成自然语言的学科,核心目标是实现“人与计算机用自然语言有效通信”,属于人工智能中的“认知智能”范畴,被称为“人工智能皇冠上的明珠”。
训练好的分词器以 JSON 文件形式保存以便重用。训练时添加了三个特殊符号:[start]、[end] 和 [pad],分别用于标记句子开始、结束以及对序列进行填充。通过 enable_padding() 配置,使用分词器处理字符串时会自动添加填充符号。在后续部分,我们将看到它们的使用方法。
在食品安全、公共卫生管理日益重要的今天,卫生许可证成为企业合规经营的关键凭证。传统人工审核方式效率低、易出错,而卫生许可证识别技术应运而生,正逐步革新监管与合规流程。下面深入解析这项技术的核心要素。
前言:前面讲解了Transformer的各个部分,本文讲解Transformer模型整体构建。
Graph RAG:知识图谱增强的智能搜索新范式 摘要:Graph RAG(检索增强生成)通过整合知识图谱和大型语言模型(LLM),为传统搜索技术带来革命性突破。相比基于向量检索的原始RAG方法,Graph RAG利用结构化知识图谱中的节点(实体)和边(关系),显著提升了搜索的上下文理解能力、推理深度和领域适应性。本文系统阐述了Graph RAG的技术原理,包括知识图谱构建、图嵌入表示、LLM集成