<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE ArticleSet PUBLIC "-//NLM//DTD PubMed 2.7//EN" "https://dtd.nlm.nih.gov/ncbi/pubmed/in/PubMed.dtd">
<ArticleSet>
<Article>
<Journal>
				<PublisherName>پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)</PublisherName>
				<JournalTitle>پژوهشنامه پردازش و مدیریت اطلاعات</JournalTitle>
				<Issn>2251-8223</Issn>
				<Volume>33</Volume>
				<Issue>2</Issue>
				<PubDate PubStatus="epublish">
					<Year>2018</Year>
					<Month>02</Month>
					<Day>20</Day>
				</PubDate>
			</Journal>
<ArticleTitle>A new Persian Text Summarization Approach based on Natural Language Processing and Graph Similarity</ArticleTitle>
<VernacularTitle>بهبود خلاصه‌سازی خودکار متون فارسی با استفاده از روش‌های پردازش زبان طبیعی و گراف شباهت</VernacularTitle>
			<FirstPage>885</FirstPage>
			<LastPage>914</LastPage>
			<ELocationID EIdType="pii">699460</ELocationID>
			
<ELocationID EIdType="doi">10.35050/JIPM010.2018.084</ELocationID>
			
			<Language>FA</Language>
<AuthorList>
<Author>
					<FirstName>طیبه</FirstName>
					<LastName>حسینی خواه</LastName>
<Affiliation>دانشگاه صنعتی امیرکبیر</Affiliation>

</Author>
<Author>
					<FirstName>عباس</FirstName>
					<LastName>احمدی</LastName>
<Affiliation>دانشگاه صنعتی امیرکبیر</Affiliation>

</Author>
<Author>
					<FirstName>آزاده</FirstName>
					<LastName>محبی</LastName>
<Affiliation>پژوهشگاه علوم و فناوری اطلاعات ایران (ایرانداک)</Affiliation>
<Identifier Source="ORCID">0000-0002-6443-7450</Identifier>

</Author>
</AuthorList>
				<PublicationType>Journal Article</PublicationType>
			<History>
				<PubDate PubStatus="received">
					<Year>2022</Year>
					<Month>12</Month>
					<Day>10</Day>
				</PubDate>
			</History>
		<Abstract>A significant amount of available information is stored in textual databases which contains a large collection of documents from different sources (such as news, articles, books, emails and web pages). The increasing visibility and importance of this class of information motivates us to work on having better automatic evaluation tools for textual resources.&lt;br /&gt;&lt;br /&gt;The automatic summarization of text is one of the ways to prevent the waste of users’ time. The extractive text summarization consists of the extraction of the more important sentences with the purpose of shortening input text while maintaining the topics covered and the subjects discussed.&lt;br /&gt;&lt;br /&gt;In this paper, we have tried to improve the accuracy of the extracted summaries by combining natural language processing and text mining techniques. By modifying the mentioned algorithms and sentence scoring measures, accuracy is increased as compared to the previously used techniques.&lt;br /&gt;&lt;br /&gt;Part of speech tagging is used for calculating coefficient of words’ importance. Using this approach will in turn help us with to pick the more meaningful words and phrases that will result in better accuracy of the system.&lt;br /&gt;&lt;br /&gt;Graph similarity‘s methods are used to select sentences. Changing weight of the selected sentences in each step leads to solve the redundancy problem.&lt;br /&gt;&lt;br /&gt;Standard evaluation measures such as “Precision” and “Recall” are used to evaluate results based on a Persian corpus.</Abstract>
			<OtherAbstract Language="FA">بخش قابل توجهی از اطلاعات قابل دسترس در پایگاه داده­‌های متنی ذخیره شده­است که شامل مجموعه بزرگی از اسناد و  منابع مختلف (مانند مقالات خبری، کتاب­‌ها، ایمیل­‌ها و صفحات وب) است. افزایش چشمگیر این نوع اطلاعات، وجود ابزارهایی برای ارزیابی خودکار منابع متنی را بیش از هر زمان دیگری آشکار می­‌کند. در این میان خلاصه­‌سازی خودکار متون یکی از راهکارهایی است که از اتلاف وقت کاربران می­‌کاهد. خلاصه­‌سازی استخراجی به معنای انتخاب مهمترین جملات یک متن با هدف کوتاه نمودن آن است به شکلی که اطلاعات مهم متن ورودی را در بر داشته باشد. در این پژوهش با بکارگیری و ترکیب روش‌های پردازش زبان طبیعی دقت خلاصه­‌های استخراجی بهبود می‌یابد و و روشی برای  اصلاح الگوریتم‌ها و معیارهای امتیازدهی به جملات، ارائه می‌شود. در روش پیشنهادی برای  امتیازدهی به کلمات، از برچسب نقش دستوری کلمات در جمله به عنوان ضریب اهمیت کلمات استفاده می‌شود که در نتیجه با  انتخاب بهتر کلمات و جملاتی که بار محتوایی بیشتری دارند، باعث دقت خلاصه‌سازی افزایش می‌یابد. علاوه برآن، برای انتخاب جملات مناسب از متن، ازروش‌های مبتنی بر گراف شباهت بکارگرفته می‌شود به‌گونه‌ای که  با تغییر وزن جملات انتخاب شده  در پیمایش گراف، در هر گام  چالش افزونگی اطلاعات برطرف می‌شود.در نهایت نتایج بدست آمده با معیارهای استانداردی مانند «بازخوانی» و «دقت» و بر روی یک پیکره متنی استاندارد فارسی نیز ارزیابی می‌شود.</OtherAbstract>
		<ObjectList>
			<Object Type="keyword">
			<Param Name="value">خلاصه سازی استخراجی</Param>
			</Object>
			<Object Type="keyword">
			<Param Name="value">پردازش زبان طبیعی</Param>
			</Object>
			<Object Type="keyword">
			<Param Name="value">برچسب گذاری دستوری کلمات</Param>
			</Object>
			<Object Type="keyword">
			<Param Name="value">گراف شباهت</Param>
			</Object>
		</ObjectList>
<ArchiveCopySource DocType="pdf">https://jipm.irandoc.ac.ir/article_699460_eb55292e1c144ddb9e1f31794834e5ee.pdf</ArchiveCopySource>
</Article>
</ArticleSet>
