首页 > 其他分享 >文本预处理1--去除#和句号之间内容

文本预处理1--去除#和句号之间内容

时间:2024-06-21 18:28:03浏览次数:21  
标签:hash -- text pos content input path 句号 预处理

1.针对文本里特定两个符号之间内容的中文进行去除,本次选取#和句号之间的内容进行去除。

2.大家可以根据自己的实际需求修改代码实现自己的文本内容的整理。

3.下面是去除#和句号之间内容的python代码:其中读取的是txt文本,处理后的内容写回原txt文件。

import os
def remove_content_between_hash_and_period(input_text):
    start_search_pos = 0
    while True:
        hash_pos = input_text.find('#', start_search_pos)
        if hash_pos == -1:
            break
        period_pos = input_text.find('。', hash_pos)
        if period_pos == -1:
            input_text = input_text[:hash_pos]
            break
        input_text = input_text[:hash_pos] + input_text[period_pos + 1:]
        start_search_pos = hash_pos
    return input_text


def process_txt_files(folder_path):
    for filename in os.listdir(folder_path):
        if filename.endswith('.txt'):
            file_path = os.path.join(folder_path, filename)
            with open(file_path, 'r', encoding='utf-8') as file:
                content = file.read()
                processed_content = remove_content_between_hash_and_period(content)

            # 可选:将处理后的内容写回文件
            with open(file_path, 'w', encoding='utf-8') as file:
                file.write(processed_content)

            # 打印处理后的内容(如果需要)
            # print(f'Processed content of {filename}:')
            # print(processed_content)


# 替换为你的文件夹路径
folder_path = "C:\\Users\\lenovo\\Desktop"
process_txt_files(folder_path)

 

 

 

 

标签:hash,--,text,pos,content,input,path,句号,预处理
From: https://blog.csdn.net/weixin_53389235/article/details/139797009

相关文章

  • 文本预处理2-去除空行
    1.针对文本里有大量的空行,进行删除空行处理。2.读取txt文档,将处理后的内容写回原文件。#文本预处理2-去除空行importosdefremove_empty_lines(text):#使用splitlines()分割文本为行列表,并过滤掉空行lines=[lineforlineintext.splitlines()ifline.st......
  • 文本预处理3-空一行
    1.针对需要空行处理的文本。2.读取txt文档,将处理后的内容写回原文件。文本预处理3-空一行importosimportredefadd_empty_line_before_numbers(text):#正则表达式匹配阿拉伯数字,但排除第一个数字pattern=re.compile(r'(?<!^)(\d+)')#使用列表推导......
  • 布尔约束传播蕴含图绘制-2024-6-21
      1.gml格式蕴含图格式的获取(1)在主函数main的代码中增加设置外部输出文件通道——打开、结束前、关闭三个函数的调用。参考所涉及的代码:1parseOptions(argc,argv,true);23SimpSolverS;4doubleinitial_time......
  • 各种技术论坛
    各种信息论坛https://user.qzone.qq.com/3434259057http://zgdcnyhl.usa3v.vip/http://home.51.com/city7cchttp://user.qzone.qq.com/316234760/2http://zhangzhan.3vfree.cn/http://zhangzhan1.3vfree.cn/http://zhangzhan2.3vfree.club/http://zhangzhan3.3vfree.work/......
  • COMP9444 Neural Networks and Deep Learning
    COMP9444 Neural Networksand Deep LearningTerm 2, 2024Assignment -Charactersand Hidden Unit DynamicsDue:Tuesday2July, 23:59 pmMarks:20%of final assessmentInthisassignment,youwill be implementingandtraining neural network m......
  • 多维表格场景及实现公式(持续更新)
    1.获取目录中最后一级目录场景:获取目录中最后一级目录(CTC公共技术知识库/架构/开发规范/电信软件研发规范)实现公式:LAST(SPLIT([目录],"/")解析:SPLIT按照/拆分字符串,结果:CTC公共技术知识库,架构,开发规范,电信软件研发规范LAST获取列表最后一个,结果:电信软件研发规范......
  • 个人云服务器已经被安全合规等卡脖子 建议不要买 买了必定后悔 安全是个大问题 没有能
    我的想法自己买一个云服务器,先自己边做边学习,向往硅谷精神,财富与自由。如果能赚钱,就开个公司。这次到期就放弃了。我前前后后6年花6000多元买云服务器。业余花了无数的精力,从2018到现在,也没有折腾起来。安全问题生存空间越来越小,安全是个大问题,被挂马,被入侵。就算是公......
  • 制作油纸伞
    <!DOCTYPEhtml><htmllang="en"><head><metacharset="UTF-8"><metahttp-equiv="X-UA-Compatible"content="IE=edge"><metaname="viewport"content="width=d......
  • TMS320F28335的ADC模块
    1 ADC简介英文全称Analog-to-DigitalConverter,模数转换器2 时钟配置外围时钟HSPCLK,通过HISCP来设置SysCtrlRegs.HISCP.all=3;设置为0时,不分频其他都为sysclk/2xHSPCLK=sysclk/(3*2)=150/6=25MHz此时还需要在进行一次分频通过设置ADCTRL3的ADCCLKP......
  • 初中各科学习方法和技巧,家长不妨收藏起来,请转告孩子!
      在孩子的学习生涯中,初中是一个至关重要的阶段。随着知识难度的加深和学科的增多,很多学生会出现跟不上班级进度的情况。这时候,作为家长,我们需要关注孩子的学习状况,并采取有效的措施来帮助他们。为了更好地指导孩子学习www.zjia8.com本文将分享初中各科的学习方法和技巧家......