文本预处理1--去除#和句号之间内容

时间：2024-06-21 18:28:03浏览次数：21

标签：hash -- text pos content input path 句号预处理

1.针对文本里特定两个符号之间内容的中文进行去除，本次选取#和句号之间的内容进行去除。

2.大家可以根据自己的实际需求修改代码实现自己的文本内容的整理。

3.下面是去除#和句号之间内容的python代码：其中读取的是txt文本，处理后的内容写回原txt文件。

import os
def remove_content_between_hash_and_period(input_text):
    start_search_pos = 0
    while True:
        hash_pos = input_text.find('#', start_search_pos)
        if hash_pos == -1:
            break
        period_pos = input_text.find('。', hash_pos)
        if period_pos == -1:
            input_text = input_text[:hash_pos]
            break
        input_text = input_text[:hash_pos] + input_text[period_pos + 1:]
        start_search_pos = hash_pos
    return input_text


def process_txt_files(folder_path):
    for filename in os.listdir(folder_path):
        if filename.endswith('.txt'):
            file_path = os.path.join(folder_path, filename)
            with open(file_path, 'r', encoding='utf-8') as file:
                content = file.read()
                processed_content = remove_content_between_hash_and_period(content)

            # 可选：将处理后的内容写回文件
            with open(file_path, 'w', encoding='utf-8') as file:
                file.write(processed_content)

            # 打印处理后的内容（如果需要）
            # print(f'Processed content of {filename}:')
            # print(processed_content)


# 替换为你的文件夹路径
folder_path = "C:\\Users\\lenovo\\Desktop"
process_txt_files(folder_path)

标签：hash,--,text,pos,content,input,path,句号,预处理
From： https://blog.csdn.net/weixin_53389235/article/details/139797009

文本预处理2-去除空行
1.针对文本里有大量的空行，进行删除空行处理。2.读取txt文档，将处理后的内容写回原文件。#文本预处理2-去除空行importosdefremove_empty_lines(text):#使用splitlines()分割文本为行列表，并过滤掉空行lines=[lineforlineintext.splitlines()ifline.st......
文本预处理3-空一行
1.针对需要空行处理的文本。2.读取txt文档，将处理后的内容写回原文件。文本预处理3-空一行importosimportredefadd_empty_line_before_numbers(text):#正则表达式匹配阿拉伯数字，但排除第一个数字pattern=re.compile(r'(?<!^)(\d+)')#使用列表推导......
布尔约束传播蕴含图绘制-2024-6-21
1.gml格式蕴含图格式的获取（1）在主函数main的代码中增加设置外部输出文件通道——打开、结束前、关闭三个函数的调用。参考所涉及的代码：1parseOptions(argc,argv,true);23SimpSolverS;4doubleinitial_time......
各种技术论坛
各种信息论坛https://user.qzone.qq.com/3434259057http://zgdcnyhl.usa3v.vip/http://home.51.com/city7cchttp://user.qzone.qq.com/316234760/2http://zhangzhan.3vfree.cn/http://zhangzhan1.3vfree.cn/http://zhangzhan2.3vfree.club/http://zhangzhan3.3vfree.work/......
COMP9444 Neural Networks and Deep Learning
COMP9444 Neural Networksand Deep LearningTerm 2, 2024Assignment -Charactersand Hidden Unit DynamicsDue:Tuesday2July, 23:59 pmMarks:20%of final assessmentInthisassignment,youwill be implementingandtraining neural network m......
多维表格场景及实现公式（持续更新）
1.获取目录中最后一级目录场景：获取目录中最后一级目录（CTC公共技术知识库/架构/开发规范/电信软件研发规范）实现公式：LAST(SPLIT([目录],"/")解析：SPLIT按照/拆分字符串，结果：CTC公共技术知识库,架构,开发规范,电信软件研发规范LAST获取列表最后一个，结果：电信软件研发规范......
个人云服务器已经被安全合规等卡脖子建议不要买买了必定后悔安全是个大问题没有能
我的想法自己买一个云服务器，先自己边做边学习，向往硅谷精神，财富与自由。如果能赚钱，就开个公司。这次到期就放弃了。我前前后后6年花6000多元买云服务器。业余花了无数的精力，从2018到现在，也没有折腾起来。安全问题生存空间越来越小，安全是个大问题，被挂马，被入侵。就算是公......
制作油纸伞
<!DOCTYPEhtml><htmllang="en"><head><metacharset="UTF-8"><metahttp-equiv="X-UA-Compatible"content="IE=edge"><metaname="viewport"content="width=d......
TMS320F28335的ADC模块
1 ADC简介英文全称Analog-to-DigitalConverter，模数转换器2 时钟配置外围时钟HSPCLK，通过HISCP来设置SysCtrlRegs.HISCP.all=3;设置为0时，不分频其他都为sysclk/2xHSPCLK=sysclk/(3*2)=150/6=25MHz此时还需要在进行一次分频通过设置ADCTRL3的ADCCLKP......
初中各科学习方法和技巧，家长不妨收藏起来，请转告孩子！
在孩子的学习生涯中，初中是一个至关重要的阶段。随着知识难度的加深和学科的增多，很多学生会出现跟不上班级进度的情况。这时候，作为家长，我们需要关注孩子的学习状况，并采取有效的措施来帮助他们。为了更好地指导孩子学习www.zjia8.com本文将分享初中各科的学习方法和技巧家......

文本预处理1--去除#和句号之间内容

相关文章

赞助商

阅读排行